小米做了一个“架构最平淡“的模型,然后拿了开源第一:这里面藏着今年最重要的一课
2026/9/24 7:04:11 网站建设 项目流程

摘要

2026 年 9 月 21 日,小米 MiMo 团队发布了 MiMo-V2.6 系列,旗舰款 MiMo-V2.6-Pro 以 46 分登上 Artificial Analysis 智能指数榜首——这是开源权重模型的历史最高分。而它的前代只有 26 分。

有意思的地方在于:它的架构非常"平淡"。经典的 GQA 加滑动窗口注意力,窗口小到 128 个 token。没有花哨的新式注意力变体。

这恰好印证了一个正在被反复验证的判断:如今大部分进步来自数据和后训练配方,而不是架构创新。本文拆解小米技术报告里真正起作用的三件事——更多 agent 任务与跨 harness 训练、从"判对错"升级到"看执行轨迹"的奖励信号、以及超大强化学习批次,顺便讲清楚"开源第一"这个头衔到底值多少。


正文

一、一个反常识的组合:架构最平淡,分数最高

先说结论是什么:MiMo-V2.6-Pro 在 Artificial Analysis 智能指数 v4.3.2 上拿到 46 分,官方口径是 46.32。这个分数让它排到开源权重模型第一位,超过 Z AI 的 GLM-5.3(45 分)和 Kimi K3(44 分)。

而真正值得玩味的是它怎么拿到这个分数的。

如果只看架构,你几乎会以为这是一份保守的技术方案:稀疏 MoE,1.02 万亿总参数、每 token 激活 420 亿;70 层主干,其中 60 层用滑动窗口注意力(SWA),10 层用全局注意力;隐藏维度 6144;384 个路由专家,每 token 激活 8 个。

没有新发明的注意力机制,没有颠覆性的结构。用经典 GQA 搭配 SWA,窗口大小设到 128 个 token。

128 个 token 是什么概念?大概相当于两三个中文句子的长度。也就是说,模型在大部分层里,只能"看见"眼前极小的一段内容。

这听起来像个缺陷。按直觉,上下文窗口都做到 100 万 token 了,注意力窗口怎么反而缩小到 128?传统认知里,注意力看得越远,模型越能把握长距离依赖,能力应该越强。

但 MiMo 的选择说明了一件事:注意力窗口大小是个效率问题,不是能力问题。全局注意力对每个 token 都要和所有其他 token 计算关系,序列一长,计算量平方级增长。把大部分层换成小窗口,计算成本瞬间降下来,而那些真正需要跨长距离理解的层——10 层全局注意力,加上第一层——保留全局视野就够了。

用一句通俗的话说:不是每一层都需要纵观全文,多数层只需要读懂眼前的句子。

这一观察其实不是小米的原创。Sebastian Raschka 在点评这个模型时把话挑明了:这几年他一直在讲一个观点——大部分进步仍然来自数据和后训练配方的改进,花哨的注意力变体大多只是效率优化。MiMo-V2.6-Pro 是这句话的一个有力实证:架构层面几乎没做什么新鲜事,分数却冲到了开源第一。

二、那进步到底从哪来?技术报告里的三件事

既然不是架构,我们就得往训练配方里找。小米这次的技术报告写得相当细,还开源了训练环境和 RL 代码。里面有三件事最值得琢磨。

第一件:把 agent 任务加进来,而且跨 harness 训练。

这是最容易被忽略但可能最重要的一条。

过去训练模型的常见做法,是在固定的一套评测环境(harness)里反复练。问题是,模型很容易"过拟合"到这套环境的特性上——在你自己的测试框架里表现优异,换个框架就露馅。

小米的做法是混合多个 harness 一起训。结果是,DeepSWE 这个长程软件工程基准上,在没见过的 harness 上的 pass@1 准确率从约 50% 提到了 66%。

这 16 个百分点的含义比数字本身更重要:它代表的是泛化能力,而不是记忆能力。模型学到的不是"这套环境该怎么应付",而是"这类任务该怎么解决"。在真实业务里,这个差别就是"能上线"和"只在 Demo 里能用"的差别。

第二件:换掉"判对错"的裁判,改成看过程的裁判。

强化学习靠奖励信号驱动,而奖励信号的质量决定了模型学什么。

绝大多数团队还在用简单的正确性验证器:答案对给 1 分,错给 0 分。这套方法在一个致命缺陷——它没法区分"侥幸做对"和"漂亮地做对"。一个模型绕了 30 步、试错 8 次才蒙对答案,和一个模型 5 步干净利落解决,在二元裁判眼里得分完全一样。长此以往,模型学到的就是"多试几次总能对"。

小米把验证器换成了一个agentic grader(智能体评分器),它除了看结果,还看执行轨迹。配套的是两个机制:GRS(组内奖励合成)在离线阶段用对比不同轨迹的方式,为具体任务生成评分标准;GAR(组内优势重分配)在训练时对通过的轨迹排序,把优势值往更高质量的解法上倾斜。

效果是:模型被引导去用更短的路径、更少的 token 完成任务。这句话值得单独拿出来看——它意味着奖励设计直接影响了推理成本。省 token 不是靠事后压缩,而是在训练阶段就被写进了激励。

第三件:把强化学习批次开到极大。

具体规模是:每次更新用 1,568 个样本,每个样本 16 次采样,合计 25,088 条轨迹;单步训练 token 数达到 27 亿到 37 亿;支持 100 万 token 上下文长度训练。

这不是简单的"堆算力"。全异步的 GRPO 架构、控制面与数据面解耦、混合批次里各任务样本配比的稳定,全是工程难题。大 batch 的意义在于梯度信号更稳定——正如前文所说,二元奖励的噪声本来就大,靠小批量是压不住的。

顺带一提,规模上去之后还有个隐患:MoE 的专家会出现负载漂移,也就是流量过度集中在少数专家上。小米的处理是冻结 MoE Router,同时建立一套防 reward hacking 的机制——覆盖奖励设计、对抗性评测、异常检测、验证器交叉校验四个环节。这部分讲得比较技术,但它是"训练没崩"和"训练崩了"之间的分界线。

三、还有一件事:他们把训练过程直播了

这部分我觉得是这次发布里最有意思的决策。

小米把生产环境的强化学习训练全程直播了。在不到 6 天里,Flash 和 Pro 各自完成 30 步 RL,累计约 75 万条轨迹。训练成本分别约 85 万美元和 262 万美元。

对应的效果是:训练任务的平均通过率相对提升 25%(Flash)和 12%(Pro);样本外的长程软件工程基准 DeepSWE v1.1 分别提升约 17 分(48.8 到 65.7)和约 14 分(58.4 到 72.6)。

为什么直播这件事值得单独说?因为它把一个通常被藏起来的东西摆到了台面上:一次大规模 RL 训练的真实成本、真实耗时、真实失败率。行业里大部分关于"训练一个模型要多少钱"的说法都是模糊的,而这次给了可以对照的具体数字——不到 6 天、262 万美元、14 个基准分。

这个数字还有另一层含义。小米在公告里说,MiMo-V2.6-Pro 在同智能水平下,价格只有海外模型的 1/20 到 1/60;按 Artificial Analysis 的口径,它在智能指数上每完成一个任务约花 0.13 美元。技术报告、训练环境、RL 代码全部开源,权重以 MIT 协议发布在 Hugging Face 和 ModelScope 上。

再叠加一个背景:MiMo 团队由前 DeepSeek 研究员罗福莉(Fuli Luo)带领,小米承诺三年投入 87 亿美元做 AI。把这些放在一起看,这是一次非常明确的战略表态——中国团队正在用"压低单位成本 + 全面开源"的方式,去撼动闭源前沿模型的定价权。

四、冷静一下:这个"第一"的边界在哪

讲完亮点,必须把边界划清楚。这部分比前面所有内容都重要。

第一,"开源第一"不等于"全面第一"。46 分这个成绩的定语是"在开源权重模型里排第一"。Artificial Analysis 自己的页面上,SpaceXAI 的 Grok 4.7(xhigh)同样拿到 46 分。也就是说,它是在开源阵营里登顶,在最顶尖的闭源模型面前属于同一梯队但并非领先。

第二,细分项目上它仍然落后。看小米自己公布的数据:DeepSWE v1.1 上 Pro 得 71.9 分,而 DeepSeek V4.1 Flash 是 74.2、Claude Opus 5 是 74.0、GPT 6 Astra 是 74.0。GDPval 上 Pro 的 Elo 是 1673,落后 Claude Fable 5.1 的 1735 和 Opus 5 的 1708。CyberGym 上的 94.0 分则确实亮眼。

换句话说:这是一个在多项任务上进入第一梯队、但并非每项都第一的模型。综合分数的优势,更多来自均衡而非碾压。

第三,速度数据有两个口径。流传的对比图上标注的输出速度约 326 token/秒,而 Artificial Analysis 在标准端点上实测是 129.7 token/秒、首 token 延迟 2.17 秒。这大概率是端点配置不同导致的差异(官方另有 UltraSpeed 变体,号称同质量下最高快 20 倍)。看到"快多少倍"这类结论时,先确认测的是什么配置。

第四,也有信息没给。第三方点评指出,小米没有发布 system card,也没有公布训练数据截止时间,未列出参与红队的合作方。对一个宣称可商用的 MIT 开源模型来说,这些是后续要补的。

第五,性能数据仍需独立验证。小米自家的评测把多项分数描述为"比肩 GPT-5.6 Sol 和 Claude Opus 5",这类厂商口径需要等待第三方复现。

五、给做 AI 的人最重要的那一课

如果这篇文章只能留一个结论,我希望是这个:

当架构创新进入平台期,真正的差距来自数据、任务多样性和奖励信号的设计。

MiMo-V2.6-Pro 的架构是教科书级别的"朴素"。它能登顶,靠的是:把 agent 任务和多种 harness 混进来训,让模型学会泛化;把二元裁判换成看过程的 agentic grader,让模型学会走短路径;把 batch 开到两万多条轨迹,让噪声大的奖励信号变得可用。

这三件事没有一件需要发明新的注意力机制。它们需要的是把训练当成一个完整的系统来设计——任务从哪来、环境怎么搭、奖励怎么写、失败怎么防。

对照自己的工作,可以问三个问题:

第一,我的评测环境是单一的,还是多样的?如果只有一套,模型在演示里表现好,很可能只是过拟合了这套环境。

第二,我的奖励信号区分得出"侥幸对"和"漂亮地对"吗?如果区分不出,就要接受模型学会绕远路。

第三,我的规模化,是只堆了算力,还是同时把任务多样性和评分器的算力一起放大了?

结语

这次发布最反直觉的地方,在于它用一份极其朴素的技术方案,拿到了一个极其亮眼的分数。

它给整个行业提供了一种心理上的松绑:你不必等着下一代的注意力机制出现,才能做出更好的模型。手边那些不性感的活儿——把任务多样性做上去、把奖励信号写准、把训练流程跑稳——才是真正的胜负手。

那个 128 token 的极小窗口,像是一个隐喻:不用看得很远,把眼前的数据和反馈做扎实,就足够登顶了。

(当然,只在开源阵营里,而且"for now"——这是原文作者自己加的那个限定词。)


互动话题

你觉得"花哨的架构创新"和"扎实的数据配方",哪个更值得投入?如果是你在做技术选型,会为了 46 分的开源第一放弃闭源前沿模型吗?评论区聊聊。


免责声明:文中模型参数、训练数据、成本与跑分信息来自小米 MiMo 官方技术报告与公告、Artificial Analysis 榜单、以及 Sebastian Raschka 等第三方的公开点评。其中"开源权重第一"指特定榜单的特定维度;厂商自报的评测分数尚未全部经第三方独立验证;速度数据因测试端点不同存在口径差异。本文不构成任何技术选型或投资建议。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询