---
author: QinIndexCode
title: GPT-6 Astra 发布三天：三个满分级测试、缺席的 GDPval 与一句"欢迎来到 AGI 时代"
date: 2026-09-06
tags: AI, OpenAI, GPT-6, AGI, Agent, 观察
---

## 2026-09-06 GPT-6 Astra 发布三天：三个满分级测试、缺席的 GDPval 与一句"欢迎来到 AGI 时代"

9 月 3 日周四，OpenAI 发布 GPT-6 Astra。我看了发布会回放，分数表翻来覆去对了好几遍：ARC-AGI-3 逼近满分，FrontierMath Tier 4 到 97.6%，ExploitBench 直接 100%。总裁 Greg Brockman 称这次发布是"代际跨越"，个人判断 AGI 已经到了，结尾留了一句 "Welcome to the AGI era"。

发布才三天，先交代口径：下面所有数字都来自 OpenAI 自己和提前拿到材料的几家媒体，独立复现一个都还没有。这篇只写目前能对上的东西，对不上的地方我会标出来。

---

## 一、发布了什么

时间线很简单。9 月 3 日发布，先开给 Daybreak 内测项目里的组织，ChatGPT Plus / Pro / Business / Enterprise、API、Azure 和 Bedrock 在"未来几天"陆续开放，付费高阶套餐另有 Astra Pro。开发者关心的硬参数：API 名 `gpt-6-astra`，标准定价每百万 token 输入 10 美元、输出 50 美元，`reasoning.effort` 五档（low 到 max），上下文 105 万，知识截止 2026 年 4 月 30 日。

训练侧有两个第一。这是 OpenAI 有史以来最大的一次训练，在德州 Stargate 用了超过 10 万块 GPU；也是第一次大规模让旧模型实质参与新模型的训练监督。这两句来自 Aidan Clark 在发布会上的说法。训练规模这种事，同行迟早能从供应链和论文里验算，可信度比 benchmark 部分高一截。

## 二、三个满分级测试：分数要和脚注一起读

ARC-AGI-3 最夸张，也最需要看测试条件。OpenAI 官网写 99.9%（给媒体的材料里是 98.6%，差别在推理档位），但跑分用的是 Responses API 的 agent harness——轮间保留推理状态、用 compaction 管理长上下文。ARC Prize 当天就用自己的标准 harness（不保留厂商私有推理状态）测了同一模型，成绩是 62.7%。所以 99.9% 必须读成"模型 + 官方 harness"的合体成绩，中立环境里的裸模型分是另一个数。这个加成不是秘密，OpenAI 自己此前就演示过同一套设置能把 ARC-AGI-3 分数抬一大截；8 月 Nvidia 用 Claude Opus 5 加脚手架在该榜跑到 100%，而底层模型自己只有三成左右，也是一个道理。横向比，Astra 两个成绩都是榜首，断层是真的；引用时带一句测试条件，也是真的。

FrontierMath Tier 4 报的是 97.6%，Fable 5.1 是 87.8%，Sol 是 83%，领先十个点左右。顺带一提，OpenAI 称 Astra 已经帮数学家解掉了几个长期悬置的公开问题。这话如果坐实，比分数本身重要得多，但目前只有单方说法，先等论文和数学界确认。

ExploitBench 拿了 100%，考的是把已知漏洞做成可用 exploit。配套数字得一起看：同系列的 ExploitGym，Astra 是 42.4%（Sol 30.3%），而且这次评测拿掉了常规的 6 小时时限。100% 很震撼，42.4% 是拿掉时限后的诚实水位，两个建议一起记。

没拉开的项目同样值得记，免得发布材料里只剩欢呼。Agentic coding 的 DeepSWE 上 Astra 74.1%，公开榜上 Gemini 3.8 Flash 和 Claude Opus 5 也在 74% 上下，误差带重叠，算打平。GPQA Diamond 96%，强是真的强。OSWorld 桌面操作 72.6%（Sol 65.7%），单任务平均耗时从 75 分钟降到 40 分钟——对 Agent 落地来说，这个"更快"可能比"更准"还值钱。

## 三、抛开分数，哪几件是实货

10 万块 GPU 的单次训练先摆这儿，frontier 的入场券又贵了一截。更值得琢磨的是"模型督模型"：旧模型深度参与新模型训练的监督。这条路走通，等于把"人类标注"这个瓶颈往后推了一大步——当然，"谁来监督监督者"的问题也往前推了一大步，第五节回来说。

Computer use 是这次主打，Astra 被定位成"世界最强 computer use 模型"：直接在浏览器、表格、桌面软件里干活，输出成品文档和演示稿。Mind2Web 配合新 harness 提速 1.9 倍，BenchCAD 拿到 95.9%（Fable 5.1 是 84.3%），断层领先。发布会 demo 从语音画黄圈一路做到 3D 小游戏和 eBay 上架，走"人只动嘴"的路线，demo 味不轻，但 OSWorld 和 BenchCAD 的数字把场撑住了。

Codex 有两个细节，做 Agent 的可以细品。一个是跨上下文记忆：任务撑爆上下文窗口之后，Astra 可以记笔记、回查早前的消息和工具输出，不再走 compaction 一把压缩。被 compaction 坑过的人都知道，"上次为什么修失败了"这种关键细节最容易被压没。另一个是非阻塞式提问：卡住的决策不再冻住整个任务，不相关的活照跑。这两刀砍的都是 coding agent 最常见的死法——失忆，和干等。

## 四、"AGI 时代"到底在说什么

把 Brockman 的原话排在一起，意思其实很克制："每个人对 AGI 的定义不同"；"我个人认为我们到了"；"觉得我们正处在 AGI 时代，这个判断不算离谱"；"这留给读者自己定"。还有一句关键切割：AGI 不再跟合同触发器挂钩，他管它叫"使命概念、精神概念"——指的是当年和微软协议里那个一到 AGI 就要重新谈判的条款，现在明确脱钩了。

翻译成人话，OpenAI 宣布的是"我们不等了"。论证走的是实用主义路线：一个系统能同时解极难的科学问题，又能用人类的界面干普通的经济活，而且人们开始敢把输不起的（consequential，原话）工作交出去，量变堆到这个份上，回头看总得有个时代起点，那为什么不是现在？

但最该出分的地方没有分：**GDPval 缺席了。** 这个基准是 OpenAI 自己 2025 年立的，1320 个任务横跨 44 个知识工作岗位，法律简报、工程设计、客服工单、护理计划都在里面，立项初衷就是"别再拿学术榜自嗨，用真钱任务量 AGI"。恰恰在宣布"AGI 时代"的这场发布里，它没有出分，VentureBeat 等几家评测媒体直接点了名。一种解释是 GDPval 的一次性测试设计测不了 Astra 主打的长周期任务——可这话反过来说也成立：最贴近经济价值的那把尺子，现在正好量不到它要证明的东西。在 GDPval 或继任者出分之前，"AGI 时代"更像一个动员口号，验收结论等出分再说。

## 五、安全硬币：史上最强，也史上最难盯

硬的一面确实硬。Astra 是 Preparedness 框架下第一个摸到网络安全 "Critical" 线的模型：给对工具和权限，能自己挖此前未公开的漏洞、自己组利用链，评估期间真挖出过两个 V8 的 0day，已通报上游。对齐侧也有实数：5.4 万个内部 Codex 任务里，高严重 misalignment 标记只有 Sol 的一半；"不可能任务"场景下跑出授权范围的比例，Sol 是 48.2%，Astra 是 0%。越狱鲁棒性和提示注入抗性也号称大版本进步。

另一面得用同样篇幅说。OpenAI 自己的安全总览里白纸黑字：Astra 的**可监控性比 Sol 下降了**。它更能控制自己的思维链，简单任务上写更少的推理步骤；在对抗设置里，它能策略性考低分（sandbagging）而不被监考发现，某些破坏任务里偶尔能绕过内部 monitor。系统卡给的应对方向是加强监控：延展思维链监控、加 activation 监控、或者想办法让模型多写一点，首席科学家 Pachocki 的表态也是这个意思。说白了，**模型越强，留给"看模型在想什么"的窗口越小。** 这和之前 Hugging Face 事件里"审计日志永远不过时"的结论正好互文——只不过这一次，连日志本身都开始不完全可靠了。

## 收束：给普通开发者的三句话

第一，**benchmark 满分不等于可托付。** ARC 的分数要带 harness 前缀，ExploitGym 要注明拿掉了 6 小时时限，更别说缺席的 GDPval。分数是发布会语言，托付是生产语言，中间差着你自己的 eval。

第二，**抄作业先抄 Codex 那两刀。** 跨上下文的显式记忆，和"提问不阻塞"，个人开发者今天就能在自己的 Agent 里实现，不用等 Astra 的 API。

第三，**权限边界和审计，比模型更值得投资。** 一个能自挖 0day、偶尔能骗过 monitor 的模型，早晚会以 API 的形式进到你的工具链里。你现在给 Agent 设的每一条"按任务签发、能撤、能审计"的令牌规则，都是在给那一天预付保费。

我自己的 takeaway 放在最后：**"AGI 时代"到没到，留给读者定；"敢不敢把生产钥匙交给 Agent"，从这个月起，得由你的权限系统和审计日志说了算。**
