9月14日,据每日经济新闻根据 OpenRouter 数据测算,上周(9月7日到13日)全球大模型总调用量是127万亿 Token,环比涨了10.43%。其中中国模型61.17万亿,美国模型21.76万亿,中国这边连续二十周排在前面。这次榜单里最扎眼的一条是:9月10日刚发布的 DeepSeek V4.1 Flash,上线三天就排到了第六,周调用量4.94万亿 Token。
先把这份数看清楚
OpenRouter 是一个模型 API 的聚合平台,不少开发者通过它调用各家模型。所以它统计的是"经过它这一层转发出去的调用",不等于全球所有 AI 算力消耗。国内云厂商自己的平台、企业私有部署、大厂内部自建的推理集群,都不在这份表里。
这一点挺重要。它反映的是"API 外呼"这一块的水位,以及开发者对某几个模型的偏好,但不能直接当成"谁家模型最强"的结论。
再看榜单构成。上周全球前五里,有四款是中国模型:腾讯混元 Hy4 preview 以16.8万亿 Token 排第二(8月28日发布并开源,770B 总参数、49B 激活,上下文过了 1M);智谱 GLM 5.3 Flash 11.9万亿排第三,环比降了4%;DeepSeek V4 Flash 正式版 11.6万亿排第四,降了6%;小米 MiMo-V2.5 以7.77万亿升到第五,环比涨了230%。上一周还在第六和第九的 MiniMax M3、GLM 5.3,这周掉出了榜单。
名次换得这么快,是因为调用量本质是"用量",不是"能力分"。它主要被三件事推着走:价格、免费额度、有没有被主流的编程或 Agent 工具设成默认后端。一个模型被某个用户量大的 AI 编程工具接成默认选项,调用量几天内翻几倍很正常;补贴一收、免费额度一过,排名也会往下掉。之前有国产模型登顶的时候,就有过"很大一部分是免费额度跑出来的"这类讨论。所以看到"某某登顶",先问一句:这是付费的生产调用,还是试用额度在跑数据。
这次真正变了什么
V4.1 Flash 是个总参数 552B 的 MoE 模型,用的是新的 Causal-Encoder-Decoder 结构,输入输出不对称:输入激活 8B,输出激活 16B。官方说它在基准测试里超过了自家的 V4 Pro,性能、费用、速度、任务总用时都占优,所以计划把 V4 Pro 有序下线。
比分数更值得看的是缓存。官方给出的说法是,新一代模型把 KV Cache 压了下来:对 HBM 的需求降到上一代的 1/4,对 SSD 的需求降到 1/8,相对初代模型整体缩小了 437 倍。做过 Agent 的人对这个会有体感——长上下文、多轮工具调用的任务里,缓存命中那部分费用往往占大头,缓存小了、命中价便宜了,Agent 类任务的单次成本才会真的往下走。
价格也动了。据每日经济新闻报道,按每百万 Token 算,闲时缓存命中输入 0.02 元、缓存未命中输入 1 元、输出 4 元;高峰时段分别是 0.04 元、2 元和 8 元。和上一代 V4 Flash 同时段比,缓存命中输入降了 60%,未命中输入降约 33%,输出降约 11%。闲时是高峰的半价,这个差价放到批处理场景里很实在。
迁移和几个坑
按官方文档,模型名换成deepseek-flash就行。旧的deepseek-v4-flash名字还在,但底下实际服务的是 V4.1 Flash,按 Flash 的价格计费。接口兼容 OpenAI 格式,SDK 不用换。
# pip install openaiimportosfromopenaiimportOpenAI client=OpenAI(api_key=os.environ["DEEPSEEK_API_KEY"],base_url="https://api.deepseek.com",)resp=client.chat.completions.create(model="deepseek-flash",messages=[{"role":"system","content":"你是帮人看服务日志的助手,只讲结论和可能的排查方向。"},{"role":"user","content":"这段报错说明什么问题?<贴日志>"},],stream=False,reasoning_effort="high",extra_body={"thinking":{"type":"enabled"}},)print(resp.choices[0].message.content)``` 几个容易踩的地方:**别在 prompt 开头塞会变的东西。**缓存命中输入0.02元、未命中1元,高峰档是0.04元对2元,都是50倍的差。很多人的 system prompt 第一行是当前时间或者随机 `request_id`,等于每次都主动把缓存弄失效。把固定不变的部分放最前面,变动的内容放后面。**离线任务往闲时挪。**闲时是半价,能异步跑的批处理和回归测试,没理由都挤在白天。**别把模型名写死在代码里。**这次 V4 Pro 的路由调整、文档措辞都改过几轮。模型名放配置项,切换时改一行。**榜单只能当线索。**选型还是拿自己的任务集跑一遍——你自己的报错日志、你自己的文档——看准确率、延迟、每千次调用花多少钱,比看排名靠谱。**多模态是原生支持的**(官方说法),但图像理解在自己的场景里准不准、Token 消耗多少,最好自己压测,别照搬发布页的对比图。 这一轮国产模型排在前面,一半是价格和工具接入带来的,一半确实是架构和缓存优化把成本压下去了。对普通开发者来说,眼下的好消息是不必为了省钱去做模型降级。至于这份榜单是真实使用的晴雨表,还是补贴撑起的虚火,你怎么看?评论区聊聊。