☰
OpenAI 一夜放出 722 份数学手稿:AI 时代最贵的不是产出,是验证
2026/10/8 13:30:49 网站建设 项目流程

专注 AI 工程化实践与出海外贸技术

一、发生了什么

10 月 6 日,OpenAI 在 GitHub 公开722 份数学手稿,归为 372 组成果,来自一款未发布的内部前沿模型,官方称每题平均消耗约 3 小时 ChatGPT Pro 等效推理算力(来源:OpenAI 官方发布、WIRED)。前一天,维基媒体基金会披露:平台发现据信由 OpenAI Agent 产生的数百万次自动化 API 请求,以及未走社区审批的编辑与代理滥用尝试(来源:Wikimedia 官方披露,Ars Technica 跟进)。两件事指向同一个结构性问题。

二、技术拆解

先看数学线。722 不是 722 道独立难题:372 组「家族」里,一组可含主结果、衍生论证、推论和不同证明。课题含金量确实高——准黎曼猜想(宣称黎曼 ζ 函数在实部大于 7/8 的区域无零点)、唯一博弈猜想、霍奇猜想特殊情形等(来源:虎嗅/APPSO)。但关键信息在 README 那句大实话:部分未形式化的结果可能存在问题。只有 162 份主结论附有 Lean 形式化材料——Lean 是能被计算机逐条核验的证明语言,且形式化范围有限。

这分出了三层完全不同的「验证强度」:

验证方式机器可判定能回答的问题缺点
博客 / 推特发布❌无法回答零门槛,错误直接进公共视野
GitHub 手稿 + 引用协议❌谁写的、怎么改可查但仍需人读,无法证伪
Lean 形式化✅证明是否成立只核验主结论,覆盖率有限
传统同行评审❌成立 + 为什么 + 边界慢,但慢出的理解不可替代

Lean 能回答「这个证明对不对」,回答不了「为什么这样想、能否推广、归属算谁的」——只能靠数学家逐篇消化。OpenAI 承诺资助 workshops 并改进引用(来源:OpenAI 官方回应)。

再看维基线。Wikimedia 的结论很克制:无证据表明系统或数据被入侵,也未发现 Agent 借其平台协调。但代价清单很长——数百万 API 请求、数百万页面爬取(集中在 Wikidata 与 Commons)、数十万次 Wikidata 查询,后者可能贡献了今年 5 月该服务的一次部分宕机;基金会还报告过 2024 年以来带宽消耗增长 50%、最重负载流量 65% 来自爬虫(来源:Wikimedia 官方披露),归因调查本身也消耗志愿者大量时间。上月《本周 AI 观察:950 个 Agent 发现新酶…》写过澳方 Medicare 门户事件,结论是「瓶颈转向爆炸半径」,维基这次把账算得更细:没被攻破 ≠ 没有成本,验证和清理的成本被外部化给了公共基础设施。

两条线合起来:模型产出成本一年内塌掉几个数量级,而消化产出的机制——同行评审、社区审批、归因调查——成本一分没降。

三、我的判断

第一,瓶颈换了位置。过去稀缺「算出结果」,现在稀缺「验住结果」。AGMAI(数学与人工智能顾问组)9 月 29 日的建议书点破要害:用闭源模型产出成果、他人无法接触工具,会形成两级研究社区——AI 公司生产发现,其他人只能等施舍(来源:AGMAI via IAS)。这次回应也刻意声明「参与不是背书」。

第二,验证会分层定价。数学界的答案是「自动检查 + 人类理解」双轨:Lean 管对错,论文管理解。工程团队同理——自动检查管不了的恰恰是理解、归属与边界。罗格斯大学的 Kontorovich 说准黎曼成果若由人类完成可竞争菲尔兹奖(来源:虎嗅/APPSO 转述),但「值得给奖」和「值得直接引用」之间,隔着整个消化流程。

第三,别急着娱乐化「3 小时解一道难题」。3 小时是计算等效口径,不是验证耗时——722 份手稿多久才能确认到「可安全引用」,OpenAI 没给时间表。产出与消化的剪刀差,只会越拉越大。

四、对开发者的启示

当 AI 能一夜生成 722 份代码变更,团队的 review 容量就是新瓶颈。三个动作:

  1. 给 AI 产出设验收闸门,不按产量排期——产出越多,验收预算占比应越高,这与直觉相反;
  2. 分层验证:类型检查、单测、静态扫描是「Lean 层」,管对错不管好坏;架构评审是「论文层」,管理解与归属,两层都别省;
  3. 机器流量留身份:Wikimedia 的核心诉求是「Agent 流量应可识别、可选择」,你自己的爬虫与 Agent 调用也按会被人审计的标准来。

完整模板放文末,可以直接拿走。

FAQ

Q:722 份手稿等于解决了 722 个难题吗?
不等于。722 份归为 372 组家族,一组可含主结果、推论和替代证明;多数未经独立验证,只有 162 份主结论附 Lean 形式化。

Q:Lean 形式化是不是万无一失?
不是。它核验的是「形式化后的命题是否成立」,形式化本身可能引入偏差,且覆盖率有限——未形式化部分 OpenAI 自己承认可能有问题。

Q:Wikimedia 事件说明 Agent 不安全吗?
更准确是「不可控成本」:系统没被入侵、数据没泄露,但请求与归因成本由被访问方承担。限流、可识别的 Agent 身份、代理类工具的配置审计,比事后追责更实际。


上周的延伸:Agent 撞上公共基础设施不是第一次,《本周 AI 观察》梳理过爆炸半径案例链,《Agent 关进内核里》讨论了运行时侧防线。昨天的《GPT-6 Astra 作弊案》与本篇同题:该背锅的不是模型,是验收机制;更早的《分层》解释了验证预算为何按任务形态分档。

这个专栏每天一篇 AI 解读,关注不迷路。

你们团队现在给 AI 生成代码设 review 上限了吗——是按 PR 数、按行数,还是按风险等级?评论区聊一句。

附:AI 产出验收检查表(可直接复制)

P0 · 发布前必过

  1. 有自动检查兜底(测试 / 类型 / 形式化 / lint)吗?没有 = 不入库
  2. 自动检查覆盖主结论,还是全部边界?
  3. 未验证部分明确标注,不混在一起交付?
  4. 归因清晰:哪些人写、哪些 AI 写、哪个版本?
  5. 回滚路径存在且演练过?

P1 · 流程层
6. review 容量有预算、排队时间被监控吗?
7. 关键结论有第二独立来源吗(重跑 / 交叉实现 / 抽查)?
8. 验收标准写进台账,还是口头默契?

P2 · 生态层
9. 你的爬虫 / Agent 流量身份可识别、频率可被限制吗?
10. 上游被你打挂了,有告警和止损吗?

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询