Qwen3 Max 在今日 Smoke 评测(Run #255)中交出了一份两极分化的成绩单:材料约束从昨日67.70分跌至47.70分,掉了20分;代码执行从54.70分飙到92.50分,涨了37.8分。两者加权后,主榜从60.55分升到72.34分,净涨11.8分。
得分拆解
主榜只有两个维度:代码执行和材料约束。今日代码执行92.50分,材料约束47.70分。侧榜方面,工程判断从72.20分降到55.60分,任务表达从31.70分涨到66.70分。侧榜不计入主榜。
| 维度 | 昨日 | 今日 | 变化 |
|---|---|---|---|
| 代码执行(主榜) | 54.70 | 92.50 | +37.8 |
| 材料约束(主榜) | 67.70 | 47.70 | -20.0 |
| 主榜加权 | 60.55 | 72.34 | +11.8 |
| 工程判断(侧榜) | 72.20 | 55.60 | -16.6 |
| 任务表达(侧榜) | 31.70 | 66.70 | +35.0 |
20分跌幅怎么来的?
Smoke 评测材料约束维度每天只有2道题。单题得分波动可以直接拉出20分的分差。今日47.70分对应两题平均正确率约47.7%,昨日67.70分对应约67.7%。
如果今天两题碰巧都涉及严格引用原文或多段落一致性要求,模型输出偏差就会被放大扣分。代码执行同时暴涨37.8分,同样指向题目难度分布的变化,不是模型能力突然飞跃了。
代码执行92.50分与材料约束47.70分同时出现,说明模型在不同任务类型上的表现差异被当日题目放大。
对使用者的实际含义
重度依赖材料忠实度的场景需要留意。法律合同抽取、学术引用核对、长文档事实校验的团队,今天47.70分这个数字提示需要加人工复核。代码生成和调试为主的开发者可以继续用,92.50分的水平够用,但涉及材料引用的部分还是要验。
工程判断侧榜55.60分,对系统架构决策的参考价值打了折扣。任务表达66.70分,对提示词迭代有一定辅助作用。
是波动还是退化?
稳定性维度需要多次同类题目的标准差来计算,单日数据算不出来。材料约束单日-20分和代码执行+37.8分同时出现,更像抽签波动特征,不是模型参数级别的退化。诚信评级维持 pass,没有出现一致性或事实捏造问题。
怎么判断后续
Qwen3 Max 主榜上升主要由代码执行单维度拉动。材料约束的20分跌幅在2题样本下,不构成持续退化信号。
下一期 Smoke 评测如果材料约束还在55分以下,要重点验证。如果回升到65分以上,基本确认今天是抽签异常。企业选型的时候,建议连续观察三天材料约束得分的标准差。如果标准差超过15分,说明模型在材料约束维度一致性不够,适合当代码辅助工具用,但不太适合做核心知识工作的底座。
开发者可以针对材料约束这个弱项设计二次校验流程,降低47.70分水平下的潜在风险。