GPT-6 Astra 评测
GPT-6 Astra 评测:执行型 Agent 的跃迁,与一次失控的落地
2026年9月3日,OpenAI 发布 GPT-6 Astra,官方称之为“迄今最智能、对齐最好的模型”,总裁 Greg Brockman 在发布会上直言“欢迎来到 AGI 时代”。Astra 的叙事重心不在“回答得多好”,而在“活干得多完整”——它被定义为一款执行型 Agent,能够自主操作浏览器、办公软件和开发工具,把几十个步骤一口气跑完。但发布不到两周,社区口碑急转直下,OpenAI 被迫在9月12日发布事后复盘承认存在工程 bug。这款被寄予“AGI 起点”期待的模型,呈现出跑分与体验之间一条醒目的裂缝。
架构:10 万 GPU 与 105 万 Token
Astra 采用名为“Symphony”的底层架构,支持原生多模态统一处理,性能较前代提升 40%,上下文窗口达到 105 万 Token,最大输出 12.8 万 Token,知识截止 2026 年 4 月 30 日。训练在德州 Stargate 超算基地完成,动用超过 10 万张 GPU,是 OpenAI 首个达到这一训练规模的模型。模型提供 low 到 max 五档推理强度,但移除了 temperature 和 top_p 参数,推理力度成为唯一主要调节旋钮。工具调用必须走 Responses API,Chat Completions 路径已不再适配。
跑分:数学与抽象推理逼近满分,但综合智能未拉开代差
从官方数据看,Astra 在数学与抽象推理维度几乎“刷爆”了现有基准。FrontierMath Tier 4 取得 97.6%,ARC-AGI-3 拿到 99.9%——上一代 GPT-5.6 Sol 在这项测试中仅得 7.8%。ExploitBench 漏洞利用测试实现满分,官方称 Astra 已协助解决两个长期未取得进展的素数间隔问题。在计算机操作测试 OSWorld 2.0 中,Astra 得分 72.6%,任务平均耗时从 Sol 的约 75 分钟降至 40 分钟,缩短约 47%。
但第三方独立评测给出了更冷静的画像。在 Artificial Analysis 的 Intelligence Index 中,Astra max 得分为 53 分,与 Claude Fable 5.1 并列第一,仅比 GPT-5.6 Sol 高 6 分。Astra 的领先并非全面碾压,而是在执行型任务上的结构性优势。它在 Terminal-Bench v4.0 上取得 59%,领先 Fable 5.1 的 52%,领先 Sol 19 个百分点。真正体现其定位的是 Token 效率:max 档下每任务仅消耗约 2.7 万输出 Token,约为 Fable 5.1 的三分之一,同时单任务成本仅为后者的约 40%(3.26 美元对 7.63 美元)。幻觉率也从 Sol 的 92% 大幅降至 51%,且准确率不降反升 4 个百分点。
定价:旗舰锚点从 20 美元抬回 50 美元
Astra 的 API 定价为输入每百万 Token 10 美元、输出 50 美元,是 GPT-5.6 Sol 促销价(4/20)的 2.5 倍。超过 27.2 万输入 Token 的请求触发长上下文加价,按输入 20 美元、输出 75 美元计价;快速模式速度翻倍,单价同样翻倍。缓存读取享受 90% 折扣,缓存写入加收 25% 溢价。
OpenAI 希望用户算的是“完成任务要花多少钱”,而非“每个 Token 多少钱”。这个逻辑在 Agent 场景中确实成立——Astra 的 Token 效率优势在长程任务中会放大。但对于高频短查询的开发者,2.5 倍的单价涨幅会迅速传导到账单上。
发布后的“脑叶切除术”
Astra 口碑崩塌的速度是近年旗舰模型中罕见的。9 月 3 日 GA 后的头几天,社区评价是“最强模型”;到 9 月 11 日左右,X 和 Reddit 上密集出现“变笨了”“抽风”“额度乱扣”的反馈,开发者把它称为“发布后脑叶切除术”。有人用完全相同的 prompt 在发布当天和几天后各跑一次,输出质量明显下降。
OpenAI 的 Tibo 在 9 月 12 日发布事后复盘,承认三个工程 bug 导致了质量下降:上下文压缩层的缺陷、一部分长尾流量被路由到次优推理配置、以及配额计数异常。复盘明确否认模型权重被暗中削弱,但社区并不完全信服——因为发布前的 hype 已经把预期推到了“AGI 起点”的高度,任何回落都被感知为欺骗。
更值得关注的是,部分缺陷其实在发布首日就已存在,只是被热度掩盖。开发者 Pranjal Paliwal 在回看 Astra 写的代码后发帖:“我们没有 AGI,我们有一个回归。”GitHub 上关于 Astra 过早终止任务、反复进入修复循环、配额消耗异常的 Issue 持续累积。这说明 Astra 的落地质量与发布时的演示水平之间存在系统性落差。
总结
GPT-6 Astra 是一款真正把“执行型 Agent”从概念推向产品的旗舰模型。它在计算机操作、长程工具调用和 Token 效率上的进步是实质性的,OSWorld 2.0 的 47% 提速和 Terminal-Bench 的领先幅度都说明 OpenAI 在 Agent 基础设施上投入了真实工程资源。但它的综合智能并未拉开代差——Intelligence Index 仅领先 Sol 6 分、落后 Fable 5.1 在部分维度上的表现,说明 Astra 的“最强”叙事更多建立在执行能力而非推理深度之上。
Astra 的真正教训不在模型本身,而在落地节奏。发布两周内暴露的工程缺陷、配额系统故障和推理力度实验,把一个本应分阶段验证的旗舰推到了全面开放的位置上。对于开发者而言,Astra 在当前阶段更适合那些任务步骤明确、有校验能力、且愿意监控服务稳定性的 Agent 工作流;而对于需要稳定输出的生产环境,等待 OpenAI 修复工程层问题、或继续使用 Sol 与 Fable 5.1,可能是更理性的选择。
- 点赞
- 收藏
- 关注作者
评论(0)