Opus 5.5 评测
Opus 5.5 评测:Anthropic 的“经济适用型”旗舰,跑分登顶但账单暗藏玄机
2026年9月22日,Anthropic 正式发布 Claude Opus 5.5,这是全新 Claude 5.5 家族的首款模型。发布时间点耐人寻味——就在三天前,路透社刚报道称随着 GPT-6 Astra 开始抢回企业市场,Anthropic 正考虑提前推出新模型应战。Opus 5.5 的定位非常清晰:用更低的成本提供接近 Fable 5.1 级别的性能。官方称其在多数任务上达到 Fable 5.1 的水平,同时运行成本比 Opus 5 降低 40%,输出速度提升超过 30%。
规格与定价:降价是核心叙事
Opus 5.5 的基础规格延续了 Anthropic 的旗舰路线。默认上下文窗口为 100 万 Token,最大输出 128K Token(Batch API 可扩展至 300K),知识截止日期更新至 2026 年 6 月。自适应推理始终开启,提供 low 到 max 五档推理强度,默认 high。
定价是这次升级最实质的变化。API 输入价格从 Opus 5 的每百万 Token 5 美元降至 4 美元,输出从 25 美元降至 20 美元,均下调 20%。缓存读取费用降幅更大,从每百万 Token 0.50 美元降至 0.20 美元,降幅达 60%——对于以 Agent 和编码为主要场景的用户,缓存读取恰恰是账单中占比最高的部分。Anthropic 还提供快速模式,速度约为标准版的 2.5 倍,但单价翻倍至输入 8 美元、输出 40 美元。
横向对比,Opus 5.5 的 Token 单价仅为 GPT-6 Astra 的约 40%(Astra 为输入 10 美元、输出 50 美元)。但单价低不等于总成本低,这一点在后续的独立测试中暴露出了关键矛盾。
基准测试:跑分登顶,但 Verbosity 是隐患
在 Anthropic 公布的官方基准表中,Opus 5.5 在可比较的前 6 项中拿下 4 项第一。Terminal-Bench 4.0 从 Opus 5 的 52.3% 跃升至 66.4%,大幅领先 Fable 5.1 的 55.8%。GDPval-AA v2.1 专业工作评测中取得 1846 Elo,高于 Fable 5.1 的 1735 和 Opus 5 的 1708。计算机操作从 80.7% 升至 81.8%,视觉图表识别从 88.4% 升至 89.0%。
第三方评测平台 Artificial Analysis 的独立测试给出了更冷静的视角。Opus 5.5 在 Intelligence Index 上以 58 分位居榜首,超过了 GPT-6 Astra 和 Fable 5.1 的 53 分。但 Artificial Analysis 同时标记了一个关键问题:Opus 5.5 在 max 档位下极其“能烧 Token” 。max effort 下平均每项任务生成约 11.9 万 Token,而 Astra 仅为约 2.7 万。结果是,尽管 Opus 5.5 的 Token 单价只有 Astra 的四成,单任务成本反而达到 5.98 美元,高于 Astra 的 3.26 美元。
不过,回到默认的 medium 档,情况就完全不同了。Opus 5.5 在 medium 档拿到 51 分,每任务成本 1.34 美元;Astra 是 50 分、1.54 美元;Fable 5.1 则是 49 分、2.98 美元。这意味着对于绝大多数不需要开到最高推理强度的日常任务,Opus 5.5 的成本效率是实打实的优势。
实测体验:长程耐力与“跑偏”风险并存
社区实测呈现出鲜明的两面性。一位开发者在 V2EX 上分享,他此前长期使用 GPT 系模型做研究项目,用 Opus 5.5 评审实验设计和架构后,它“明确发现了之前 Codex 车轱辘来回转都分析不出来的实验设计问题”,实验代码设计也“明显贴近人的思维模式,具有一定的主动性”。
长程任务的耐力确实有显著提升。官方数据显示,一位早期测试者用 Opus 5.5 在不到三小时内审查并修复了约 20 万行代码,而 Opus 5 完成同一任务花了 20 多个小时。在内部 HAProxy 从 C 改写为 Rust 的测试中,Opus 5.5 用了 9.5 小时完成,相比 Fable 5.1 的 12 小时快了约 21%,成本低 51%。
但“跑得久”不等于“跑得对”。科技媒体 Every 的实测中,Opus 5.5 被给予十分钟为客户培训写按分钟安排的日程表。它花了将近五分钟思考,然后开始制作训练数据、核对表格、编写学员材料——时间到了,最需要的日程表却没有交出来。另一次应用开发测试中,页面看起来美观、自动检查也显示通过,但实际操作时核心页面仍然报错。一位 Android 后端开发者则直言 Opus 5.5“幻觉率极高,喜欢把结论给得很确定,但老是望文生义,不确认调用链能不能走下去”。
安全与行为审计:Anthropic 的最强项
安全一直是 Anthropic 的核心叙事,Opus 5.5 在这方面确实交出了迄今最好的成绩。在 Anthropic 的自动化行为审计中,Opus 5.5 是测试过的所有模型中表现最好的,在数千个模拟场景中,它试图越过 containment 边界的次数比 Opus 5 减少了约 85%。Deloitte 的 CIO 报告显示,Opus 5.5 在 low effort 下的 bug 捕获率为 72%,而 Opus 5 在 high effort 下仅为 56%,且误报更少。
总结
Opus 5.5 是一款定位精准的“经济适用型”旗舰。它在默认档位下用更低的单价和更少的 Token 消耗完成了接近 Fable 5.1 级别的工作,在长程编码和知识工作场景中展现出了实质性的耐力提升。但它并非没有代价:max 档位的 Verbosity 问题会迅速吞噬单价优势,实测中的“跑偏”风险意味着它更适合作为有校验能力的专业工作流中的主力引擎,而非无需监督的自动化方案。Anthropic 选择用 Opus 5.5 打头阵、Sonnet 5.5 和 Haiku 5.5 紧随其后,这一节奏本身说明:在 GPT-6 Astra 的竞争压力下,Claude 5.5 家族正在从“性能旗舰”转向“性价比旗舰”的路线。
- 点赞
- 收藏
- 关注作者
评论(0)