这几天大模型圈有两类消息值得放在一起看:一类是小米发布并开源了 MiMo-V2.6 系列,旗舰版在第三方测评里拿下了开源权重模型的第一;另一类是 OpenAI、DeepSeek 等厂商在 API 价格上继续调整,降价成了常态。把这两件事拼起来,其实是同一个趋势——模型能力还在往上走,但真正决定"用哪个模型"的,越来越是成本。
发生了什么
据报道,小米在 9 月下旬发布并开源了 MiMo-V2.6 系列,包含全模态旗舰版 Pro 和高效推理版 Flash,模型权重以 MIT 授权免费提供。据第三方测评机构 Artificial Analysis 的数据,MiMo-V2.6-Pro 的综合智能指数达到 46 分,位列开源权重模型榜首,略高于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。
价格上,据报道该系列沿用了上一代 V2.5 的 API 定价:
- Flash 版:每百万 tokens 输入 1 元、输出 2 元
- Pro 版:每百万 tokens 输入 3 元、输出 6 元,并提供高比例(约 99%)的缓存折扣
另一边,据报道 OpenAI 把轻量级模型 Luna 的输入价格从每百万 token 1 美元降到 0.2 美元,输出从 6 美元降到 1.2 美元,降幅约 80%;中端 Terra 同步降价约 20%,旗舰 Sol 基本没动。同期 DeepSeek 也调整了定价区间。几轮下来,"国产模型便宜"这件事,已经从个别厂商的杀手锏变成了行业标配。
- Pro 版:每百万 tokens 输入 3 元、输出 6 元,并提供高比例(约 99%)的缓存折扣
技术本质:能力往上走,但"够用"的门槛被拉低
先说没变的:大模型的进步方向还是老三样——多模态、长上下文、推理能力。所谓"全模态旗舰",本质上还是把文本、图像、音频等输入统一进一个模型做处理,只是工程上做得更稳。
再说变了的:"够用就好"这条线,正在被快速下探。
过去选模型是"能力优先",因为差一点点的模型在复杂推理上会直接翻车。现在开源模型在综合测评上能追到 46 分这个量级,很多日常任务——信息抽取、文本改写、代码补全、客服问答——用中低端价位甚至开源的模型就够跑。厂商的动作也说明了这点:旗舰继续高价保利润,走量的轻量模型拼命降价抢调用量。
这带来两个实际变化:
- 成本结构变了。一个中等规模的 RAG 应用,每月 API 账单从"需要专门申请预算"变成"一顿饭钱"。开发者在选型时可以把成本当作一等公民来考虑。
- 开源和闭源的边界模糊了。权重开源 + MIT 授权,意味着可以私有化部署、可以微调、不用担心厂商哪天调价或下线。对合规敏感的场景,这比省几毛钱更重要。
对普通开发者意味着什么
第一,别再默认"贵的就是对的"。选型前先跑一遍你自己的评测集,而不是厂商公布的榜单分。榜单是平均分,你的业务只关心那几个场景。
第二,会用"多模型切换"结构。主流厂商现在基本都提供 OpenAI 兼容接口,把调用层抽象出来,换模型成本很低:
fromopenaiimportOpenAI client=OpenAI(api_key="YOUR_KEY",base_url="https://api.deepseek.com/v1",# 换成任一兼容 OpenAI 协议的厂商)resp=client.chat.completions.create(model="deepseek-chat",messages=[{"role":"user","content":"把这段需求拆成三个子任务"}],)print(resp.choices[0].message.content)``` 关键是 `base_url` 和 `model` 抽成配置项,哪天性价比变了,改两行配置就能切。**第三,注意几个坑。**一是"缓存折扣"通常只在同一前缀重复命中时才生效,别把它当成普遍价格;二是低价模型在长链推理、多步工具调用上容易掉链子,涉及关键决策还是留个高端模型兜底;三是开源权重不等于免费——私有化部署要算 GPU 的账,小团队未必比直接调 API 划算。## 收尾价格战对厂商是利润压力,对开发者却是实打实的红利。但红利的前提是你会算账、会评测、会切换,而不是被"降价 80%"的标题牵着走。你现在主力用哪个模型、每月大概花多少?评论区聊聊。