Qwen3 Max 材料约束暴跌20分,代码执行暴涨37.8分:主榜反升11.8分背后的抽签逻辑
2026/8/1 17:34:26 网站建设 项目流程

Qwen3 Max 在今日 Smoke 评测(Run #255)中交出了一份两极分化的成绩单:材料约束从昨日67.70分跌至47.70分,掉了20分;代码执行从54.70分飙到92.50分,涨了37.8分。两者加权后,主榜从60.55分升到72.34分,净涨11.8分。

得分拆解

主榜只有两个维度:代码执行和材料约束。今日代码执行92.50分,材料约束47.70分。侧榜方面,工程判断从72.20分降到55.60分,任务表达从31.70分涨到66.70分。侧榜不计入主榜。

维度昨日今日变化
代码执行(主榜)54.7092.50+37.8
材料约束(主榜)67.7047.70-20.0
主榜加权60.5572.34+11.8
工程判断(侧榜)72.2055.60-16.6
任务表达(侧榜)31.7066.70+35.0
20分跌幅怎么来的?

Smoke 评测材料约束维度每天只有2道题。单题得分波动可以直接拉出20分的分差。今日47.70分对应两题平均正确率约47.7%,昨日67.70分对应约67.7%。

如果今天两题碰巧都涉及严格引用原文或多段落一致性要求,模型输出偏差就会被放大扣分。代码执行同时暴涨37.8分,同样指向题目难度分布的变化,不是模型能力突然飞跃了。

代码执行92.50分与材料约束47.70分同时出现,说明模型在不同任务类型上的表现差异被当日题目放大。

对使用者的实际含义

重度依赖材料忠实度的场景需要留意。法律合同抽取、学术引用核对、长文档事实校验的团队,今天47.70分这个数字提示需要加人工复核。代码生成和调试为主的开发者可以继续用,92.50分的水平够用,但涉及材料引用的部分还是要验。

工程判断侧榜55.60分,对系统架构决策的参考价值打了折扣。任务表达66.70分,对提示词迭代有一定辅助作用。

是波动还是退化?

稳定性维度需要多次同类题目的标准差来计算,单日数据算不出来。材料约束单日-20分和代码执行+37.8分同时出现,更像抽签波动特征,不是模型参数级别的退化。诚信评级维持 pass,没有出现一致性或事实捏造问题。

怎么判断后续

Qwen3 Max 主榜上升主要由代码执行单维度拉动。材料约束的20分跌幅在2题样本下,不构成持续退化信号。

下一期 Smoke 评测如果材料约束还在55分以下,要重点验证。如果回升到65分以上,基本确认今天是抽签异常。企业选型的时候,建议连续观察三天材料约束得分的标准差。如果标准差超过15分,说明模型在材料约束维度一致性不够,适合当代码辅助工具用,但不太适合做核心知识工作的底座。

开发者可以针对材料约束这个弱项设计二次校验流程,降低47.70分水平下的潜在风险。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询