GPT-6 Astra 评测

举报
GrayParis 发表于 2026/09/29 10:22:05 2026/09/29
【摘要】 GPT-6 Astra 评测:执行型 Agent 的跃迁,与一次失控的落地2026年9月3日,OpenAI 发布 GPT-6 Astra,官方称之为“迄今最智能、对齐最好的模型”,总裁 Greg Brockman 在发布会上直言“欢迎来到 AGI 时代”。Astra 的叙事重心不在“回答得多好”,而在“活干得多完整”——它被定义为一款执行型 Agent,能够自主操作浏览器、办公软件和开发工...

GPT-6 Astra 评测:执行型 Agent 的跃迁,与一次失控的落地

2026年9月3日,OpenAI 发布 GPT-6 Astra,官方称之为“迄今最智能、对齐最好的模型”,总裁 Greg Brockman 在发布会上直言“欢迎来到 AGI 时代”。Astra 的叙事重心不在“回答得多好”,而在“活干得多完整”——它被定义为一款执行型 Agent,能够自主操作浏览器、办公软件和开发工具,把几十个步骤一口气跑完。但发布不到两周,社区口碑急转直下,OpenAI 被迫在9月12日发布事后复盘承认存在工程 bug。这款被寄予“AGI 起点”期待的模型,呈现出跑分与体验之间一条醒目的裂缝。

架构:10 万 GPU 与 105 万 Token

Astra 采用名为“Symphony”的底层架构,支持原生多模态统一处理,性能较前代提升 40%,上下文窗口达到 105 万 Token,最大输出 12.8 万 Token,知识截止 2026 年 4 月 30 日。训练在德州 Stargate 超算基地完成,动用超过 10 万张 GPU,是 OpenAI 首个达到这一训练规模的模型。模型提供 low 到 max 五档推理强度,但移除了 temperature 和 top_p 参数,推理力度成为唯一主要调节旋钮。工具调用必须走 Responses API,Chat Completions 路径已不再适配。

跑分:数学与抽象推理逼近满分,但综合智能未拉开代差

从官方数据看,Astra 在数学与抽象推理维度几乎“刷爆”了现有基准。FrontierMath Tier 4 取得 97.6%,ARC-AGI-3 拿到 99.9%——上一代 GPT-5.6 Sol 在这项测试中仅得 7.8%。ExploitBench 漏洞利用测试实现满分,官方称 Astra 已协助解决两个长期未取得进展的素数间隔问题。在计算机操作测试 OSWorld 2.0 中,Astra 得分 72.6%,任务平均耗时从 Sol 的约 75 分钟降至 40 分钟,缩短约 47%。

但第三方独立评测给出了更冷静的画像。在 Artificial Analysis 的 Intelligence Index 中,Astra max 得分为 53 分,与 Claude Fable 5.1 并列第一,仅比 GPT-5.6 Sol 高 6 分。Astra 的领先并非全面碾压,而是在执行型任务上的结构性优势。它在 Terminal-Bench v4.0 上取得 59%,领先 Fable 5.1 的 52%,领先 Sol 19 个百分点。真正体现其定位的是 Token 效率:max 档下每任务仅消耗约 2.7 万输出 Token,约为 Fable 5.1 的三分之一,同时单任务成本仅为后者的约 40%(3.26 美元对 7.63 美元)。幻觉率也从 Sol 的 92% 大幅降至 51%,且准确率不降反升 4 个百分点。

定价:旗舰锚点从 20 美元抬回 50 美元

Astra 的 API 定价为输入每百万 Token 10 美元、输出 50 美元,是 GPT-5.6 Sol 促销价(4/20)的 2.5 倍。超过 27.2 万输入 Token 的请求触发长上下文加价,按输入 20 美元、输出 75 美元计价;快速模式速度翻倍,单价同样翻倍。缓存读取享受 90% 折扣,缓存写入加收 25% 溢价。

OpenAI 希望用户算的是“完成任务要花多少钱”,而非“每个 Token 多少钱”。这个逻辑在 Agent 场景中确实成立——Astra 的 Token 效率优势在长程任务中会放大。但对于高频短查询的开发者,2.5 倍的单价涨幅会迅速传导到账单上。

发布后的“脑叶切除术”

Astra 口碑崩塌的速度是近年旗舰模型中罕见的。9 月 3 日 GA 后的头几天,社区评价是“最强模型”;到 9 月 11 日左右,X 和 Reddit 上密集出现“变笨了”“抽风”“额度乱扣”的反馈,开发者把它称为“发布后脑叶切除术”。有人用完全相同的 prompt 在发布当天和几天后各跑一次,输出质量明显下降。

OpenAI 的 Tibo 在 9 月 12 日发布事后复盘,承认三个工程 bug 导致了质量下降:上下文压缩层的缺陷、一部分长尾流量被路由到次优推理配置、以及配额计数异常。复盘明确否认模型权重被暗中削弱,但社区并不完全信服——因为发布前的 hype 已经把预期推到了“AGI 起点”的高度,任何回落都被感知为欺骗。

更值得关注的是,部分缺陷其实在发布首日就已存在,只是被热度掩盖。开发者 Pranjal Paliwal 在回看 Astra 写的代码后发帖:“我们没有 AGI,我们有一个回归。”GitHub 上关于 Astra 过早终止任务、反复进入修复循环、配额消耗异常的 Issue 持续累积。这说明 Astra 的落地质量与发布时的演示水平之间存在系统性落差。

总结

GPT-6 Astra 是一款真正把“执行型 Agent”从概念推向产品的旗舰模型。它在计算机操作、长程工具调用和 Token 效率上的进步是实质性的,OSWorld 2.0 的 47% 提速和 Terminal-Bench 的领先幅度都说明 OpenAI 在 Agent 基础设施上投入了真实工程资源。但它的综合智能并未拉开代差——Intelligence Index 仅领先 Sol 6 分、落后 Fable 5.1 在部分维度上的表现,说明 Astra 的“最强”叙事更多建立在执行能力而非推理深度之上。

Astra 的真正教训不在模型本身,而在落地节奏。发布两周内暴露的工程缺陷、配额系统故障和推理力度实验,把一个本应分阶段验证的旗舰推到了全面开放的位置上。对于开发者而言,Astra 在当前阶段更适合那些任务步骤明确、有校验能力、且愿意监控服务稳定性的 Agent 工作流;而对于需要稳定输出的生产环境,等待 OpenAI 修复工程层问题、或继续使用 Sol 与 Fable 5.1,可能是更理性的选择。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0)

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。