☰
“397B 追平万亿“刷屏,但科学模型评测的含金量经得起推敲吗
2026/10/10 15:54:14 网站建设 项目流程

"397B 追平万亿"刷屏,但科学模型评测的含金量经得起推敲吗

【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397B

2026 年的 WAIC 上,上海 AI 实验室放出的一则消息让整个开源圈炸开了锅:397B 参数的 Intern-S2-397B 在多项科学任务上"追平"了此前的万亿级旗舰 Intern-S1-Pro,社区里"小马拉大车""参数翻倍不如架构翻新"的讨论铺天盖地。紧接着,一篇篇"35B 如何超越万亿模型""结构生成通过率超 40% 优于 GPT-5.5"的标题党文章开始刷屏。

数字很性感,但数字也最容易骗人。一个 397B 的模型凭什么和万亿模型掰手腕?评测跑分背后的口径到底是什么?这篇基于仓库源码逐行核查,试图回答一个问题:当"追平万亿"从新闻标题变成可检验的技术陈述时,它的含金量还剩多少。

一、先把"追平万亿"的评测口径还原出来

1.1 型号与架构:397B 到底是什么

打开仓库根目录的 config.json,型号定义一目了然:

  • 架构为Qwen3_5MoeForConditionalGeneration,即混合 MoE + 混合注意力架构;
  • 文本侧 60 层,其中线性注意力(linear_attention)与全注意力(full_attention)按 3:1 交错排布;
  • 专家总数为 512,每 token 激活 10 个,另有共享专家;
  • mtp_num_hidden_layers: 1,即内建 1 层多头预测(MTP)模块,为推测解码加速留了原生接口。

也就是说,"397B"是总参数量,不是激活参数量。512 选 10 的稀疏路由意味着单次前向实际计算量远小于万亿级稠密模型的对应开销——"追平万亿"的第一层含义,本质上是稀疏化与混合注意力换来的计算效率,而非同等算力下纯粹的性能反超。这一点在解读任何"参数越小越能打"的宣传时都必须先钉在墙上。

权重清单也支持这一判断:model.safetensors.index.json 中记录了 188 个分片、总存储约 807GB,配合 deployment_guide.md 中"8×H100 或 8×H200 即可部署"的说明,可以看出官方定位就是"万亿级能力,实验室级可部署"。

1.2 评测工具链与推理预算:README 自己交代了什么

README.md 的 Performance 一节写得很诚实,值得逐句拆:

We use the OpenCompass, VLMEvalKit, and AgentCompass to evaluate all models. For text reasoning benchmarks, Intern-S2-397B is evaluated with a maximum inference length of 256K tokens, while for multimodal benchmarks, it is evaluated with a maximum inference length of 64K tokens.

这短短一段透露了三个关键口径:

  1. 评测框架:OpenCompass(文本推理)、VLMEvalKit(多模态)、AgentCompass(智能体),全部是实验室自研工具链。用自研评测框架跑自家模型本身没有错,但它意味着每个分数都应当回到"谁来出题、谁来阅卷"的问题上审视。
  2. 推理预算不同:文本基准允许最长 256K token 的推理长度,多模态基准 64K。对于以长思维链著称的科学推理模型,256K 的推理预算意味着模型可以"慢慢想",而部分对比模型在各自官方评测里可能只给了几千到几万 token。推理预算不对齐,分数就不可比——这是"追平万亿"刷屏报道中最容易忽略、也最致命的细节。
  3. 结论自带限定词:README 的注脚明确写了"下划线为开源模型最佳,加粗为全体模型最佳",也就是说官方自己把"开源最佳"与"全模型最佳"分开陈述。社区传播时把这两层经常混为一谈,"追平万亿"的表述正是在这种混淆中完成了二次加工。

1.3 社区流传的具体任务:到底"平"在哪儿

综合社区情报,"追平万亿"主要由以下几条证据支撑:

  • 分子/科学问答:如 MolecularIQ 一类评测中拿下高分,有文章称其"超越 Gemini-3.1-Pro";
  • 材料结构生成:晶体结构生成通过率宣称超过 40%,"显著优于"同期闭源旗舰;
  • 科学编程与智能体:SciCode 等代码类基准上的表现,以及 SWE-bench-Multilingual 等长程任务上的成绩;
  • 推理效率:MTP 推测解码在 8×H200 + SGLang 环境下,长输出吞吐接近翻倍、延迟下降约 61%。

逐条看,这些证据的"含金量"并不均匀:效率指标(吞吐、延迟)是硬事实,可以复现;而"超越某旗舰"的表述高度依赖对比模型的版本、推理配置与评测集的选择。同一张榜单换个对手、换个采样参数,结论可能完全反转。

二、科学评测的常见水分:不是造假,而是口径偏差

"追平万亿"这类话术之所以有市场,是因为科学 AI 评测领域存在几个结构性的水分来源,它们不违法、不造假,但足以让一个 0.5 分的差距在传播中被放大成"代际超越"。

2.1 基准过拟合与训练数据泄露

科学基准大多来自公开论文与公开数据集(分子库、晶体库、基因序列库)。开源模型在训练时几乎必然会接触到这些数据的"影子"——哪怕不是逐字泄露,同类分布的题目早已进入预训练语料。当模型在某个科学基准上拿了高分,我们很难区分这是"推理能力"还是"记忆检索"。尤其当该基准的题目被反复用于 RL 训练(如仓库所述"20+ 领域多任务强化学习联合训练"),模型对题型的适应会进一步推高分数,而这种适应并不迁移。

2.2 任务选择偏差:只报强项,不报全景

"追平万亿"的宣传口径集中在分子、材料、科学编程这类 Intern-S2 的强项上。但一个严谨的评测应该同时报告通用能力的下滑幅度——毕竟任何针对科学任务的 RL 训练都可能挤占通用能力空间。仓库 README 声称"同时保持通用能力",却未在正文给出完整的通用基准对照表,评测图(figs/intern-s2-397b.jpg 为 Git LFS 指针文件,需下载权重后才能查看)又无法在仓库内直接核验。只展示赢面、淡化输面的选择性呈现,是评测话术里最常见的"合法水分"。

2.3 推理预算、采样参数与工具开关不对齐

科学模型评测比通用模型更复杂,因为存在三个额外自由度:

  • 思考/非思考模式:README 明确 Intern-S2-397B 默认开启 thinking 模式,且"不建议在 agent 任务中关闭"。若对比模型用的是短答案模式,而 Intern-S2 用的是长思维链 + 256K 预算,分数的差距很大程度上是"算力换准确率"。
  • 工具调用:AgentCompass 类的评测允许模型调用计算器、代码解释器等工具。能查资料做题和闭卷裸考,含金量天然不同。
  • 采样温度:仓库推荐temperature=0.8, top_p=0.95,而部分评测为了稳定性会用更低的温度。不同采样策略下分数波动可达数个点。

2.4 评测集版本与对比模型的"移动靶"

"超越 Gemini-3.1-Pro""优于 GPT-5.5"这类说法在传播中最容易变质:对比模型是什么版本、什么量级、是否开了工具、评测集是哪一版、是否经过 RL 针对性优化——这些信息在社区二创中几乎全部丢失。当基准没有冻结、对手没有定格,"超越"就只是一个营销时点,而不是一个科学结论。

三、一套识别评测话术的 Checklist

以后再看到"XX 参数追平 YY 万亿"的标题,别急着转发。按下面这张表逐项盘问,大多数刷屏稿会在第三行就露出马脚:

盘问维度具体问题通过标准
参数口径说"397B"是总参数还是激活参数?明确区分,MoE 模型必须标注激活量
推理预算双方评测的最大推理 token 是否一致?明确列出各模型推理长度上限
采样配置温度、top_p、是否开 thinking 模式?给出完整采样参数
工具使用是否允许调用外部工具/代码执行?区分闭卷与开卷
对比对象"万亿模型"具体指哪个版本、哪个量级?版本号 + 参数量 + 评测日期
基准清单除了赢的基准,输的基准是否也公示?完整评测矩阵,含通用能力
评测框架用的是独立第三方还是自研框架?公布框架版本与评测脚本
可复现性评测脚本、prompt、后处理是否开源?他人可跑出同一分数
效率归属"追平"是否部分源于稀疏架构的算力红利?单 token 激活 FLOPs 透明披露
训练数据边界基准题目或其分布是否可能已进入训练集?披露数据去重与污染检测流程

把这 10 问对照仓库现有材料,会发现官方 README.md 与 deployment_guide.md 在"效率"和"可复现性"两项上做得相当扎实——MTP 加速配置、512K 长上下文 YaRN 参数、LMDeploy/vLLM/SGLang 三套部署命令全部可复现;而在"对比对象定格"和"完整基准矩阵"两项上,仓库同样留了明显的开口。这不是这家实验室独有的问题,而是整个行业的通病。

结论:把"追平"从口号还原为工程事实

回到最初的问题:科学模型评测的含金量经得起推敲吗?答案是部分经得起。

经得起推敲的部分是硬工程事实:512 专家的稀疏 MoE 架构(config.json)、原生 MTP 推测解码带来的近倍吞吐提升(社区多篇实测互相印证)、FP8 量化下 8 卡可部署的工程成熟度(deployment_guide.md)、以及 OpenAI 兼容 API + 工具调用 + 时间序列分析的能力边界(README.md 的完整示例代码)。这些是 397B 真正值钱的地方——它证明了科学智能不必以万亿参数为门票,稀疏化、混合注意力与长上下文推理预算的工程组合,能把"科学能力"装进实验室搬得动的机箱里。

经不起推敲的部分是营销修辞:以 256K 推理预算 + 思考模式 + 工具调用跑出的分数,与闭卷、短答案、默认配置的对比模型比高低,再压缩成"追平万亿"四个字,信息损耗率接近百分百。

对读者而言,正确的姿势不是不信评测,而是把评测当成起点而非终点:拿着 10 问清单去读每一个数字,然后用自己的任务、自己的数据、自己的预算跑一遍。当"397B 追平万亿"不再是一句口号,而变成你机器上一条可复现的 throughput 曲线和一组任务完成率时,这场关于评测含金量的讨论,才算真正有了答案。

【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询