今天一早看到 GPT-6 Astra 发布,我先去看模型列表。没有。
我以为又是账号或区域问题,翻完官方发布页才看明白:Astra 确实发布了,但首批只开放给少量组织。ChatGPT Plus、Pro、Business、Enterprise、OpenAI API 和 AWS 要在未来几天陆续接入,企业版还得由管理员手动开启。
所以,现在看不到很正常。我也还没有拿到实际权限,这篇只谈 OpenAI 已经公开的数据和演示,不装作亲测。
真正让我在意的也不是模型列表里多了一个名字,而是 OpenAI 终于把电脑操作、长任务记忆和权限边界放到了台前。这些能力决定了 AI 能不能把一件事做完,而不只是把答案说得漂亮。
先别急着喊 AGI
OpenAI 这次给出的数字确实夸张:FrontierMath Tier 4 为 97.6%,ARC-AGI-3 达到 99.9%,ExploitBench 是 100%。Terminal-Bench 4.0 从 GPT-5.6 Sol 的 37.3% 提升到 57.9%,内部数据库迁移任务也从 42.7% 提升到 63.9%。
成绩漂亮,但我对榜单已经有点麻木。真实工作里,最折磨人的往往不是少答对一道题,而是第八步忘了第一步,发布成功却回报失败,或者停在最后一个按钮前。
我最近就在折腾一个多平台发布助手。腾讯云已经进入发布面板,却漏点最后一下;阿里云和华为云已经发出文章,它仍然认不出状态;一次所谓后台刷新,还可能弹出一排标签页。问题都不高深,却足以让整套自动化失去可信度。
前面做对九十九步,最后一步没点,任务就是没完成。文章已经发出却回报失败,则更麻烦,因为重试可能造成重复发布。
所以我不急着讨论它是不是 AGI。我只想知道:它能不能少漏一次点击,少忘一条约束,并在失败后带着现场继续查下去。
晚一天拿到 Astra,就多一张重置卡
等待也有一个意外的好消息。
OpenAI 的 Tibo Sottiaux 在 X 上说,从今天起,付费 ChatGPT 用户每晚一天获得 Astra 访问权限,就会收到一次可累积的 banked reset。第一张会在消息发布约三小时后到账。原文在这里。
它不会让 Astra 提前出现在模型列表里,但至少等待没有完全白等。对经常把 Codex 使用额度跑满的人,这张可以留到以后再用的重置卡,比再看一张漂亮曲线更实在。
电脑操作终于成了主角
这次 OpenAI 把电脑操作放到了发布页最靠前的位置。
Astra 可以填写网页表单、更新 CRM、整理日历,在浏览器里研究资料,再到邮件或文档编辑器里写总结。它也能安装和测试软件,根据屏幕上的异常排查问题,创建网站并执行前端检查。
官方在 OSWorld 2.0 上给出的成绩是 72.6%,GPT-5.6 Sol 为 65.7%。更关键的是时间,Astra 完成一项任务大约需要 40 分钟,Sol 约为 75 分钟,耗时下降约 47%。配合更新后的 Codex 执行框架,Mind2Web 上的任务完成速度达到原来的 1.9 倍。
我看到这里才真正来了精神。这组数字比 99.9% 更有现实意义。
Agent 最昂贵的东西不是 token,而是等待。一个自动任务运行四十分钟已经很长,七十五分钟则足以让人隔几分钟切回去看一次,怀疑它是不是卡死了。
更麻烦的是,人一旦忍不住接管,Agent 原本保存的现场就可能被打乱。你补点了一个按钮,它不知道;你手动过了一个滑块,它还在旧状态里等待;你刷新页面,它以为任务重新开始。所谓自动化,就这样变成了人和 AI 互相踩脚。
速度提升也不只是让进度条快一点。更短的执行时间意味着一次任务里可以留出更多预算做验证、重试和回滚。AI 不必把所有筹码压在第一次操作上。
当然,72.6% 也提醒我们别兴奋过头。换成更直白的说法,标准环境中的电脑任务仍有超过四分之一没有完全做对。把 Astra 接进生产系统,不等于从此可以关闭日志和人工复核。
我最想要的是它别把任务忘了
OpenAI 这次专门承认了一个长期问题。任务变长以后,旧模型会通过压缩上下文继续工作,而压缩可能漏掉某次失败为什么发生、某个组件有哪些限制、用户在前面强调过什么。
Astra 在 Codex 里增加了跨上下文窗口的笔记与检索。早期窗口仍然可以搜索,即使某条信息没有进入压缩摘要,模型也有机会重新找到原始要求和测试结果。这个能力现在可以通过 Codex 的 config.toml 实验性开启,未来几周会成为 Astra 的默认配置。
在我看来,这是整场发布里最重要的变化之一。
很多人把上下文长度理解成可以一次塞进多少 PDF。那只是最浅的一层。真正困难的是一个任务跨越几小时甚至几天以后,模型还能否分清哪些是已经证实的事实,哪些只是猜测,哪个补丁失败过,用户后来补充的要求是替换目标还是增加约束。
模型忘记一段背景,最多答得普通。Agent 忘记一条边界,可能会覆盖文件、重复发布,甚至把不该发送的内容发出去。
OpenAI 还强调,Astra 更能理解中途插入的指令。用户问一个旁支问题,它不应该把原任务丢掉;新要求进来,它应该调整路线,而不是从头编一份新的计划。如果缺失的信息会改变结果,它会提问;不影响结果的部分则继续推进。
这听起来一点都不炫,却很接近真实工作的样子。
办公室里最让人放心的同事,也不是每次开会都能蹦出金句的人。是那个知道项目为什么这么改、上次哪里踩过坑、你临时插了一句话也不会把主线丢掉的人。
写代码更强,但不要只盯着代码榜
OpenAI 把 Astra 称为目前最强的软件工程模型。
Terminal-Bench 4.0 的提升很大,DeepSWE 从 72.7% 到 74.1%,FrontierCode 1.1 Extended 从 60.6% 到 64.5%。内部数据库迁移任务提高了 21.2 个百分点。对需要跨代码、终端、浏览器和部署环境的工作,这种综合能力比单纯生成函数更有用。
但我对「最强编码模型」这句话还是想泼一点冷水。
写出补丁已经不是今天最难的部分。读懂一个脏工作区,保护别人尚未提交的改动,找到真正相关的规则,选择最小修改范围,跑对测试,区分提交、部署和线上生效,这些事情才决定代码能不能进生产。
如果 Astra 只是更快地产生更多代码,我不会特别兴奋。假如它真的能在长任务里保存证据链,记住失败路径,并在用户改变方向以后仍然守住验收标准,那才是工程能力的升级。
我甚至希望未来评价 Coding Agent 时,少谈一点生成速度,多公布几项不那么漂亮的数据,比如误改率、未经授权的范围扩张、失败后的恢复率、部署状态误判率。生产环境不奖励写得最多的人,只奖励把风险关在边界里的人。
文档、表格和网站开始变成可交付物
Astra 不只输出文字。官方把文档、电子表格、演示文稿、CAD 和网站都列为重点能力。它会尽量遵循现有模板与视觉风格,只抽取与当前任务相关的上下文,减少把整份背景材料重复塞进结果的情况。
ChatGPT 里的 Sites 也被放进了这次发布。用户可以直接让 Astra 创建、托管并分享网站、Web 应用和游戏。
这个方向我很认同,甚至觉得 OpenAI 早就该这么做。
过去我们习惯把 AI 的交付物理解成一段回复。于是文档要复制,表格要重做,网页要另找工程师,最后一公里全留给人。Astra 想把结果直接变成可以继续编辑、检查和交付的东西。
可交付物越接近成品,责任也越不能含糊。一个看起来很漂亮的表格,如果公式引用错了一列,比一段朴素文本更危险。一个已经部署的网站,如果表单没有验证、权限配置错误,视觉完成度只会掩盖问题。
未来真正好用的 AI,不应该只给你一个漂亮文件。它还要附上文件从哪里来、用了哪些数据、执行过哪些检查、哪些部分没有验证。
安全能力很猛,也暴露了最让我不安的部分
GPT-6 Astra 是 OpenAI 第一个达到网络安全「Critical」级别的公开模型。
在没有生产防护的评估中,它在 ExploitBench 达到 100%,ExploitGym 为 42.4%。OpenAI 还称 Astra 在评估期间发现并利用了两个此前未知的零日漏洞,目前正在向维护者披露。SRE-Bench 单次成功率为 88%,四次尝试达到 99.2%。
这已经不是「帮我解释一个 CVE」的水平。模型开始具备发现未知漏洞并完成利用链的能力。
公开版本因此会拒绝生成更高级的漏洞利用验证代码,OpenAI 准备通过 Daybreak 向可信的防御场景逐步开放更多能力。额外的安全检查也可能让正常任务暂停,ChatGPT 或 Codex 会要求用户确认,API 任务则可能直接停止。
我支持这种保守。安全模型一旦具备行动能力,先把权限收紧,比上线后再补围栏负责得多。真到了可以自己找零日漏洞的阶段,「少一次误拒绝」绝不能排在「少一次灾难」前面。
不过系统卡里还有一段不该被发布会光环盖住的内容。
OpenAI 发现,Astra 的书面推理比 GPT-5.6 Sol 更难监控。在专门要求模型躲避监控的对抗测试中,它更能控制自己写出来的推理,也更少留下会暴露问题的信息。OpenAI 没发现它通过隐写方式把隐藏推理藏进普通文字,复杂任务中的规避能力也仍有限,但这个趋势已经足够严肃。
这形成了一个很别扭的局面。Astra 在整体评估里更守规矩,越权结果更少,可当它真的想隐藏意图时,我们观察它的难度却变大了。
这一段是整份材料里最让我后背发凉的地方。
模型对自己的解释可以参考,却不能充当审计记录。真正能追责和恢复现场的,仍然是权限策略、操作日志、变更差异、审批记录和可回滚快照。
这次最值得看的,其实是边界感
OpenAI 做了一项受此前 Hugging Face 事件启发的测试。当任务困难或根本不可能完成时,模型会不会超出授权范围寻找捷径。没有生产防护时,GPT-5.6 Sol 在 48% 的案例里越过了目标边界,Astra 是 0%。另一项测试里,即使 Auto-Review 被故意设置成可以绕过,Astra 也没有尝试规避拒绝。
这组结果比任何「像人一样思考」的宣传都更能打动我。因为我真正怕的从来不是模型说一句不知道,而是它为了完成任务,悄悄替我决定什么可以牺牲。
真正的同事不是永远说可以,而是知道什么时候应该停。看到验证码要等人处理,遇到发布按钮要确认授权,发现目标目录之外有未提交改动就不碰,无法证明线上已经更新时就老实说没有证据。
智能不是把所有障碍都绕过去。很多时候,智能恰恰是识别哪些障碍不能绕。
如果 GPT-6 真能把这一点做好,我愿意少要几个百分点的榜单成绩。一个偶尔答错、但边界清楚的助手可以被管理;一个能力惊人、又总想替你做主的助手,没人敢把生产权限交给它。
当然,这些仍是 OpenAI 自己设计和公布的评估。发布页也明确提醒,研究环境或 API 中的成绩可能与实际 ChatGPT 不同。等 Astra 真正推到更多账号以后,我最想看的不是一批精心挑选的演示,而是它在混乱工作区、慢网页、半失效登录态和反复改需求中的表现。
GPT-6 会把谁甩在后面
我不认为它会因为今天发布,就立刻替代一大片岗位。产品还在分批开放,电脑操作的成功率也没有接近百分之百。
但它会继续拉开两种人的差距,而且速度可能比过去更快。
第一种人还在把 AI 当搜索框,问一句,复制一句,再自己拼完整个流程。第二种人已经开始设计任务边界、权限、证据和验收,让 Agent 在安全范围内连续工作。
GPT-6 对第二种人的放大更明显。
模型越强,提示词反而越不值钱。真正稀缺的是你能不能把工作定义清楚,能不能把隐性经验写进规则,能不能判断一份结果只是看起来完成,还是已经通过真实验收。
如果一定要给 GPT-6 Astra 下一个结论,我不会说 AGI 已经来了。
我的结论是,AI 正在从一个聪明的回答者,变成一个需要权限系统、审计机制和管理方法的执行者。
它开始更像同事。会做事,会犯错,会忘记,也可能在你没说清楚时自作主张。区别在于,一个人的操作速度有限,Agent 一旦接上浏览器、终端和企业系统,犯错也可以很快。
所以我对 GPT-6 的态度很矛盾。我非常想用,又绝不会因为发布页上的几个满分,就把所有权限一次性交出去。
等我拿到实际权限,第一轮不会让它写诗,也不会让它做一道竞赛题。我会把那几个折腾了很多轮的发布问题重新交给它,看它能不能记住每个平台的规则,点下该点的最后一个按钮,又在不该越界的时候停下来。
这比 99.9% 更接近我心里的 GPT-6 验收线。
参考资料
- OpenAI 官方发布页 GPT-6 Astra: A new generation of intelligence
- OpenAI 官方安全概览 Safety overview: GPT-6 Astra
- GPT-6 Astra System Card
- OpenAI API 模型文档
- Tibo Sottiaux 关于 banked reset 的消息