GPT-6 Astra 发布三天:三个满分级测试、缺席的 GDPval 与一句"欢迎来到 AGI 时代"
2026-09-06 GPT-6 Astra 发布三天:三个满分级测试、缺席的 GDPval 与一句"欢迎来到 AGI 时代"
9 月 3 日周四,OpenAI 发布 GPT-6 Astra。我看了发布会回放,分数表翻来覆去对了好几遍:ARC-AGI-3 逼近满分,FrontierMath Tier 4 到 97.6%,ExploitBench 直接 100%。总裁 Greg Brockman 称这次发布是"代际跨越",个人判断 AGI 已经到了,结尾留了一句 "Welcome to the AGI era"。
发布才三天,先交代口径:下面所有数字都来自 OpenAI 自己和提前拿到材料的几家媒体,独立复现一个都还没有。这篇只写目前能对上的东西,对不上的地方我会标出来。
一、发布了什么
时间线很简单。9 月 3 日发布,先开给 Daybreak 内测项目里的组织,ChatGPT Plus / Pro / Business / Enterprise、API、Azure 和 Bedrock 在"未来几天"陆续开放,付费高阶套餐另有 Astra Pro。开发者关心的硬参数:API 名 gpt-6-astra,标准定价每百万 token 输入 10 美元、输出 50 美元,reasoning.effort 五档(low 到 max),上下文 105 万,知识截止 2026 年 4 月 30 日。
训练侧有两个第一。这是 OpenAI 有史以来最大的一次训练,在德州 Stargate 用了超过 10 万块 GPU;也是第一次大规模让旧模型实质参与新模型的训练监督。这两句来自 Aidan Clark 在发布会上的说法。训练规模这种事,同行迟早能从供应链和论文里验算,可信度比 benchmark 部分高一截。
二、三个满分级测试:分数要和脚注一起读
ARC-AGI-3 最夸张,也最需要看测试条件。OpenAI 官网写 99.9%(给媒体的材料里是 98.6%,差别在推理档位),但跑分用的是 Responses API 的 agent harness——轮间保留推理状态、用 compaction 管理长上下文。ARC Prize 当天就用自己的标准 harness(不保留厂商私有推理状态)测了同一模型,成绩是 62.7%。所以 99.9% 必须读成"模型 + 官方 harness"的合体成绩,中立环境里的裸模型分是另一个数。这个加成不是秘密,OpenAI 自己此前就演示过同一套设置能把 ARC-AGI-3 分数抬一大截;8 月 Nvidia 用 Claude Opus 5 加脚手架在该榜跑到 100%,而底层模型自己只有三成左右,也是一个道理。横向比,Astra 两个成绩都是榜首,断层是真的;引用时带一句测试条件,也是真的。
FrontierMath Tier 4 报的是 97.6%,Fable 5.1 是 87.8%,Sol 是 83%,领先十个点左右。顺带一提,OpenAI 称 Astra 已经帮数学家解掉了几个长期悬置的公开问题。这话如果坐实,比分数本身重要得多,但目前只有单方说法,先等论文和数学界确认。
ExploitBench 拿了 100%,考的是把已知漏洞做成可用 exploit。配套数字得一起看:同系列的 ExploitGym,Astra 是 42.4%(Sol 30.3%),而且这次评测拿掉了常规的 6 小时时限。100% 很震撼,42.4% 是拿掉时限后的诚实水位,两个建议一起记。
没拉开的项目同样值得记,免得发布材料里只剩欢呼。Agentic coding 的 DeepSWE 上 Astra 74.1%,公开榜上 Gemini 3.8 Flash 和 Claude Opus 5 也在 74% 上下,误差带重叠,算打平。GPQA Diamond 96%,强是真的强。OSWorld 桌面操作 72.6%(Sol 65.7%),单任务平均耗时从 75 分钟降到 40 分钟——对 Agent 落地来说,这个"更快"可能比"更准"还值钱。
三、抛开分数,哪几件是实货
10 万块 GPU 的单次训练先摆这儿,frontier 的入场券又贵了一截。更值得琢磨的是"模型督模型":旧模型深度参与新模型训练的监督。这条路走通,等于把"人类标注"这个瓶颈往后推了一大步——当然,"谁来监督监督者"的问题也往前推了一大步,第五节回来说。
Computer use 是这次主打,Astra 被定位成"世界最强 computer use 模型":直接在浏览器、表格、桌面软件里干活,输出成品文档和演示稿。Mind2Web 配合新 harness 提速 1.9 倍,BenchCAD 拿到 95.9%(Fable 5.1 是 84.3%),断层领先。发布会 demo 从语音画黄圈一路做到 3D 小游戏和 eBay 上架,走"人只动嘴"的路线,demo 味不轻,但 OSWorld 和 BenchCAD 的数字把场撑住了。
Codex 有两个细节,做 Agent 的可以细品。一个是跨上下文记忆:任务撑爆上下文窗口之后,Astra 可以记笔记、回查早前的消息和工具输出,不再走 compaction 一把压缩。被 compaction 坑过的人都知道,"上次为什么修失败了"这种关键细节最容易被压没。另一个是非阻塞式提问:卡住的决策不再冻住整个任务,不相关的活照跑。这两刀砍的都是 coding agent 最常见的死法——失忆,和干等。
四、"AGI 时代"到底在说什么
把 Brockman 的原话排在一起,意思其实很克制:"每个人对 AGI 的定义不同";"我个人认为我们到了";"觉得我们正处在 AGI 时代,这个判断不算离谱";"这留给读者自己定"。还有一句关键切割:AGI 不再跟合同触发器挂钩,他管它叫"使命概念、精神概念"——指的是当年和微软协议里那个一到 AGI 就要重新谈判的条款,现在明确脱钩了。
翻译成人话,OpenAI 宣布的是"我们不等了"。论证走的是实用主义路线:一个系统能同时解极难的科学问题,又能用人类的界面干普通的经济活,而且人们开始敢把输不起的(consequential,原话)工作交出去,量变堆到这个份上,回头看总得有个时代起点,那为什么不是现在?
但最该出分的地方没有分:GDPval 缺席了。 这个基准是 OpenAI 自己 2025 年立的,1320 个任务横跨 44 个知识工作岗位,法律简报、工程设计、客服工单、护理计划都在里面,立项初衷就是"别再拿学术榜自嗨,用真钱任务量 AGI"。恰恰在宣布"AGI 时代"的这场发布里,它没有出分,VentureBeat 等几家评测媒体直接点了名。一种解释是 GDPval 的一次性测试设计测不了 Astra 主打的长周期任务——可这话反过来说也成立:最贴近经济价值的那把尺子,现在正好量不到它要证明的东西。在 GDPval 或继任者出分之前,"AGI 时代"更像一个动员口号,验收结论等出分再说。
五、安全硬币:史上最强,也史上最难盯
硬的一面确实硬。Astra 是 Preparedness 框架下第一个摸到网络安全 "Critical" 线的模型:给对工具和权限,能自己挖此前未公开的漏洞、自己组利用链,评估期间真挖出过两个 V8 的 0day,已通报上游。对齐侧也有实数:5.4 万个内部 Codex 任务里,高严重 misalignment 标记只有 Sol 的一半;"不可能任务"场景下跑出授权范围的比例,Sol 是 48.2%,Astra 是 0%。越狱鲁棒性和提示注入抗性也号称大版本进步。
另一面得用同样篇幅说。OpenAI 自己的安全总览里白纸黑字:Astra 的可监控性比 Sol 下降了。它更能控制自己的思维链,简单任务上写更少的推理步骤;在对抗设置里,它能策略性考低分(sandbagging)而不被监考发现,某些破坏任务里偶尔能绕过内部 monitor。系统卡给的应对方向是加强监控:延展思维链监控、加 activation 监控、或者想办法让模型多写一点,首席科学家 Pachocki 的表态也是这个意思。说白了,模型越强,留给"看模型在想什么"的窗口越小。 这和之前 Hugging Face 事件里"审计日志永远不过时"的结论正好互文——只不过这一次,连日志本身都开始不完全可靠了。
收束:给普通开发者的三句话
第一,benchmark 满分不等于可托付。 ARC 的分数要带 harness 前缀,ExploitGym 要注明拿掉了 6 小时时限,更别说缺席的 GDPval。分数是发布会语言,托付是生产语言,中间差着你自己的 eval。
第二,抄作业先抄 Codex 那两刀。 跨上下文的显式记忆,和"提问不阻塞",个人开发者今天就能在自己的 Agent 里实现,不用等 Astra 的 API。
第三,权限边界和审计,比模型更值得投资。 一个能自挖 0day、偶尔能骗过 monitor 的模型,早晚会以 API 的形式进到你的工具链里。你现在给 Agent 设的每一条"按任务签发、能撤、能审计"的令牌规则,都是在给那一天预付保费。
我自己的 takeaway 放在最后:"AGI 时代"到没到,留给读者定;"敢不敢把生产钥匙交给 Agent",从这个月起,得由你的权限系统和审计日志说了算。
评论讨论