AI 第一次在信息学奥赛中超过最强人类,但这个成绩还不能直接封神
2026/9/19 2:29:42 网站建设 项目流程

AI 第一次在信息学奥赛中超过最强人类,但这个成绩还不能直接封神

文|半熟AI蒸馏室

9 月 3 日凌晨,一篇来自 NVIDIA Nemotron 团队的论文出现在 arXiv 上。

论文里最醒目的数字只有三个:

  • IOI 2026 金牌分数线:361.12 分。
  • 当届最高分人类选手:498.27 分。
  • Nemotron‑3‑Ultra‑CC:535.4 分。

满分是 600 分。

按照论文作者的说法,这是第一次有 AI 系统在一届国际信息学奥林匹克竞赛的题目上,超过当届最高分人类选手。

如果只看这张柱状图,很容易把它理解成编程领域又一个“AlphaGo 时刻”。

但把论文脚注和部署规模读完以后,事情会变得复杂一些。

这套系统不是 IOI 官方参赛者,运行过程没有受到 IOI 官方监督,成绩也没有进入官方排名。现场推理时,它最多使用了 760 张 NVIDIA GB300 GPU。

成绩值得认真看,但还不能只凭一句“AI 打败人类”就下结论。

535.4 分,究竟是什么水平?

IOI,全称国际信息学奥林匹克竞赛,是面向中学生的国际编程竞赛之一。

比赛分两天举行,每天 5 个小时。2026 年的参赛者一共需要解决 6 道算法题,每道题满分 100 分,总分 600 分。

它不是普通的“写一段能运行的代码”。

选手需要自己理解题目、设计算法、处理复杂边界条件,再把程序提交给隐藏测试。答案即使没有完整解决一道题,也可能通过部分子任务获得分数。

IOI 官方成绩页面显示,2026 年金牌分数线是 361.12 分,最高分选手获得 498.27 分。

NVIDIA 团队报告的 535.4 分,比金牌线高出 174.28 分,也比最高分人类选手高出 37.13 分。

从分数本身看,它不是刚刚越过金牌线,而是超过了当届所有正式参赛者。

更值得注意的是,这不是拿已经公开的题目进行事后测试。

论文称,团队在 IOI 2026 正式比赛期间运行了这套系统。当时题目尚未公开,系统不能访问互联网,并且遵守与人类选手相同的比赛时间和提交次数限制。

这降低了模型提前见过题目或直接从网上寻找答案的可能性,也是这项结果最有分量的部分。

这不是“一次回答”,而是一套解题工厂

Nemotron‑3‑Ultra‑CC 并不是读完题目后,直接输出一份代码就结束。

它背后是一整套专门为竞赛编程搭建的系统。

团队首先整理了约 2.2 万道竞赛题,通过监督微调等方式,把基础模型调整成更擅长算法竞赛的版本。用于 IOI 2026 现场测试的 Competition Ultra‑CC,建立在 Nemotron‑3‑Ultra‑550B‑A55B 之上,模型总参数约 5500 亿,实际激活参数约 550 亿。

为了在比赛时间内生成足够多的答案,团队还对模型进行了量化和推理加速。现场运行的峰值资源,是最多 760 张 NVIDIA GB300 GPU。

真正拉开分数的环节叫 GenCorrect。

面对一道题,它会先并行生成最多 200 份候选程序,在本地编译、测试,再按照代码行为和多样性进行筛选,选出 10 份提交给比赛评测系统。

评测系统返回各个子任务的得分后,模型把这些结果带入下一轮,继续生成和修改答案。

前四轮都是“生成 200 份、提交 10 份”。到了最后一轮,候选程序数量被扩大到 1000 份,系统再从中选出最可能得分的 10 份。

IOI 允许每道题最多提交 50 次。GenCorrect 正好把这些机会分成 5 轮,每轮使用 10 次。

也就是说,535.4 分不是某一次“灵光一现”的答案。

它来自大模型、并行采样、本地执行、候选聚类、评测反馈和提交策略共同组成的搜索过程。

把它叫作“AI 模型的成绩”没有错,但更严谨的说法是:这是一套以 Nemotron 为核心的竞赛编程系统所取得的成绩。

论文里最容易被忽略的两句话

第一句话藏在论文脚注里:

这套系统不是 IOI 的官方参赛者,运行过程没有受到 IOI 官方监督,因此成绩没有进入官方排名。

这不代表 535.4 分一定有问题。

论文公布了比赛设置、模型配置和每道题的成绩,IOI 官方页面也能独立确认最高人类分数和金牌线。但 AI 系统具体如何运行、是否完全遵守所有现场条件,目前主要来自论文作者自己的记录。

截至 9 月 3 日,公开信息中还没有看到 IOI 官方或独立研究团队对这次运行进行完整复核。

第二句话是:峰值使用最多 760 张 GB300 GPU。

论文强调 AI 遵守了与人类相同的时间、互联网和提交限制,但没有让双方使用相同的计算资源。

一名选手坐在一台比赛电脑前思考;AI 系统则可以在后台同时生成数百份方案,用大量 GPU 把搜索空间迅速铺开。

这依然是一项工程能力,但它回答的问题更接近:如果给 AI 足够多的计算资源和反馈机会,它能不能在规定时间内搜索出比所有人类选手更高分的解法?

论文给出的答案是:可以。

它并不能直接证明,同等硬件条件下的一个模型已经拥有超过顶尖选手的算法直觉。

为什么这项结果仍然很重要?

限制很多,不等于成绩没有意义。

首先,IOI 2026 是一次前瞻性测试。团队是在题目公开前、正式比赛期间运行系统,而不是在题目进入互联网以后反复调试。

其次,赛后使用通用 GenCorrect 流程进行的 5 次独立运行,平均得到 521.72 分,范围是 495.0 至 545.8 分。虽然这些仍然是论文作者自己的评测,但至少表明高分并不只出现过一次。

更关键的是,它展示了后训练和测试时计算可以把同一个底座推到什么程度。

在 IOI 2025 上,较小的 Nemotron‑3‑Nano 基础模型只有 130 分。经过监督微调后提高到 280 分,强化学习后达到 291 分,再经过 5 轮 GenCorrect,最终得到 468 分,超过当年的金牌线。

这说明决定结果的已经不只是模型参数和一次生成能力。

训练数据怎样筛选、模型如何微调、能否运行代码、怎样利用评测反馈、在有限提交次数内如何选择候选答案,都可能比“第一次回答对不对”更重要。

从这个角度看,这篇论文真正展示的不是一款单独的聊天模型,而是一条工业化的自动解题流水线。

真正被改写的,是“会编程”的定义

过去我们说一个模型“会编程”,通常指它能够补全代码、解释报错或者按照要求写出一个函数。

Nemotron‑3‑Ultra‑CC 展示的是另一种能力:同时生成大量方案,把程序放进执行环境,根据测试结果筛选和修改,再把有限的提交机会分配给最有希望的答案。

它未必像人一样理解一道题,却已经可以利用计算资源,把“提出方案—运行验证—接受反馈—继续修正”做成自动循环。

这对真实软件开发的影响,可能比一张竞赛排名图更直接。

因为许多工程任务本来就有清晰的反馈:代码能不能编译、测试是否通过、性能有没有提升、漏洞能不能复现。只要反馈可以机器化,Agent 就能不断尝试和修正,而不必要求第一次就给出完美答案。

当然,现在这套系统的成本距离普通开发者很远。最多 760 张 GB300 GPU,也不是一个可以随手打开的编程助手。

论文团队表示,未来计划公开比赛版本的 Nemotron‑3‑Ultra‑CC 检查点,以及可以运行的推理和评测方案。只有等模型、代码和运行细节真正公开,外部团队才能判断这项结果能否复现,以及需要付出多高的成本。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询