OpenAI 正式发布 GPT-6 Astra:OSWorld 冲到 72.6%,单任务成本反而降 57%
9 月 3 日,OpenAI 官宣旗舰模型 GPT-6 Astra 正式上线。官方口径不是「又发了一个新模型」,而是直接把它称作「进入 AGI 时代的起点」,并强调这是公司历史上训练规模最大的一次。和几天前还停留在安全预研阶段的预告不同,这次 Astra 带着完整的 API 定价、一整套基准成绩和分阶段的覆盖计划正式落地,开发者已经可以在 API 里以 gpt-6-astra 的名字调用它。
把这次发布拆开看,最值得关注的有三件事:它把旗舰 API 的价格天花板又抬了一档;它在电脑操作类任务上第一次把「做得对」和「做得快」同时推进了一大步;以及 OpenAI 开始用「单任务成本」而不是「单 token 价格」来向企业解释为什么最贵的模型反而可能最省钱。
一、定价再抬一档:标准档 10/50 美元,Fast 模式 2 倍价
GPT-6 Astra 的 API 标准定价是输入每百万 token 10 美元、输出每百万 token 50 美元,缓存读写单独计费。想要更快,可以用 Fast 模式,处理速度最高为标准档的 2.5 倍,价格按标准档的 2 倍收取,也就是输入约 20 美元、输出约 100 美元每百万 token。
这个价位放到市场里是什么水平?OpenAI 自己的上一代旗舰 GPT-5.6 Terra 定价是输入 2 美元、输出 12 美元,GPT-5.6 Sol 目前以促销价在推;Astra 的标准价大约是最新一代促销价口径的 2.5 倍。横向看,Anthropic 的 Claude Fable 5.1 同样是输入 10 美元、输出 50 美元,两者直接对齐;而 Claude Opus 5 是 5 美元和 25 美元,谷歌 Gemini 3.8 Flash 的入门价只要 0.75 美元和 3.75 美元,Meta Muse 的标准档也只有 1.25 美元和 4.25 美元。
把各家的旗舰与轻量档价格摆在一起,能更清楚看到 Astra 站的位置。
| 模型 | 输入价(每百万 token) | 输出价(每百万 token) | 定位 |
|---|---|---|---|
| GPT-6 Astra 标准档 | 10 美元 | 50 美元 | OpenAI 旗舰,正式发布 |
| GPT-6 Astra Fast | 约 20 美元 | 约 100 美元 | 旗舰的加速档 |
| Claude Fable 5.1 | 10 美元 | 50 美元 | Anthropic 旗舰 |
| Claude Opus 5 | 5 美元 | 25 美元 | Anthropic 上一代旗舰 |
| GPT-5.6 Terra | 2 美元 | 12 美元 | OpenAI 上一代旗舰 |
| Gemini 3.8 Flash | 0.75 美元 | 3.75 美元 | Google 轻量档 |
| Meta Muse 标准档 | 1.25 美元 | 4.25 美元 | Meta 开源档 |
价格上探的直接含义是:OpenAI 不再把「便宜」当作旗舰模型的卖点,而是把「能力上限」和「单位任务成本」摆到了台前。对只跑批量文本的小团队来说,这个价格几乎可以肯定不适合;它瞄准的是那些愿意为一次任务的成功率多付钱的场景,比如复杂的电脑操作、长程编码和需要高可靠性的企业工作流。
二、基准全线拉满,但要看清口径
OpenAI 公布的基准里,最抢眼的是电脑操作。在 OSWorld 2.0 的离线子集上,Astra 拿到 72.6%,上一代 GPT-5.6 Sol 是 65.7%。更关键的是耗时:Astra 每个任务大约 40 分钟,Sol 大约 75 分钟,也就是说 Astra 不只做得更对,还快了大约 47%。官方配了一张「Anything you can do on a computer, Astra can do for you. Fast.」的图来强调这层意思,翻译过来就是:你在电脑上能做的事,Astra 都能替你做,而且快。
其他几项硬指标同样拉满:FrontierMath Tier 4 做到 97.6%,Sol 是 83%;GPQA Diamond 96%;代码智能体基准 DeepSWE v1.1 达到 74.1%;在安全测试 ExploitBench 上直接满分 100%;屏幕操作基准 ScreenSpot-Pro(不带工具)92.7%。上下文窗口为 105 万 token,官方给出的 512K 到 1M 区段检索可靠性(MRCR v2 八针测试)是 96.3%。
看基准最需要警惕的是口径。比如 ARC-AGI-3 这个常被拿来讨论「通用智能」的测试,OpenAI 报出的数字是 98.6%,而配上官方适配器 harness 的特定设定下可达 99.9%;但直接用无状态的 API 调用,分数会显著更低。换句话说,同一个模型在不同调用方式下,跑分可以差出一大截。企业拿它做技术选型时,不能只看宣传海报上的最大数字,而要问清楚这个分数是在什么 harness、什么上下文状态下跑出来的。
也不是所有项目都压过对手。在带工具的 Humanity's Last Exam 上,Astra 拿到 57.2%,而 Anthropic 的 Claude Fable 5.1 是 65.0%。这说明 Astra 在最前沿的知识与多步推理上并非全面碾压,OpenAI 自己也没有回避这一点。对采购方来说,这意味着「最强旗舰」不等于「所有任务的最优解」,具体负载还是要具体测。
三、为什么「全场最贵」反而可能更省钱
OpenAI 在发布里反复强调一个观点:单 token 价格已经不能用来比较模型了,因为不同模型的 token 长度、思考方式和任务成功率都不一样。真正该比的是「完成一个任务要花多少钱」。OpenAI 总裁 Brockman 的说法是,token 价格变得越来越没有意义,应该看价格除以任务成功率,或者干脆看实测的单任务成本。
Astra 在这个逻辑下给出了一个具体例子:在 DeepSWE v1.1 代码任务上,Astra 最高配置的成绩超过 Sol 的最高配置,而估算的每任务 API 成本反而低了大约 57%。原因不难理解:Sol 要把一个任务做对,可能需要更多次重试、更长的思考 token 或者更强的后处理;Astra 一次做对的概率更高,累计下来总花费反而更少。
这个算法对两类用户最重要。一类是跑长程 agent 的团队,任务链条越长,单次失败的级联成本越高,买更贵的模型往往是在买确定性。另一类是把模型封装成产品卖的企业,单任务成本直接决定毛利。反过来,对短问题、高并发的批量场景,Astra 的 50 美元输出价几乎是不可承受的,这类负载应该继续留在轻量档模型上。
四、覆盖节奏与安全门控:先企业,后订阅
这次发布的覆盖顺序也透露了 OpenAI 的优先级。首发渠道是 Daybreak 企业客户,之后才向 ChatGPT 订阅用户和云平台铺开,最后是更广的 API 市场。这种「先企业后消费者」的顺序,和 Astra 的安全属性直接相关。OpenAI 官方确认 Astra 是旗下第一个触及「关键网络安全能力」红线的模型,具备的漏洞利用与攻击代码生成能力被归类为高风险,因此这类能力默认不开放,要走 Daybreak 的分阶段审批机制。
对企业来说,这个门控意味着两件事。一是想用满 Astra 的安防与漏洞挖掘能力,需要进入 OpenAI 的信任与安全流程,不是开通 API 就能拿到全部能力;二是对把 Astra 接进自己产品的团队,要提前评估合规与审查链路,别等集成到一半才发现某项能力被 gate 住。OpenAI 同时宣布对符合条件的 API 客户支持 Zero Data Retention(零数据留存),并正在测试 Private Safety Processing,用私有安全处理来缓解企业对敏感代码和数据的顾虑。
给开发者和技术决策者的建议可以浓缩成三条。第一,别把 Astra 当默认模型,它是给「高单次价值任务」用的,批量文本和简单分类请继续用轻量档。第二,选型时用你自己的真实任务集跑一遍单任务成本,而不是对着基准海报比大小,特别注意 ARC 类分数的 harness 口径。第三,如果你做的是长程 agent 或安全相关产品,Astra 值得认真评估,但要先把 Daybreak 审批与数据留存条款读清楚,再决定要不要把它放进架构里。
Astra 的正式发布把旗舰模型的价格与能力天花板同时抬高了一截,也把「按任务计价」这个更接近商业本质的讨论正式摆上了台面。接下来真正值得观察的,不是它还能在多少个基准上拿第一,而是这套昂贵的旗舰能力,能在多少真实业务场景里把单任务成本打到比上一代更低。