Step 5 Preview 评测
Step 5 Preview 评测:600B 参数打到 K3 级性能,但“便宜”的代价藏在细节里
2026年9月20日,阶跃星辰发布新一代旗舰基座模型Step 5 Preview,直接跳过Step 4系列进入Step 5阶段。这是一款专为真实世界Agentic任务打造的模型,总参数量600B、激活参数仅27B,支持100万Token上下文窗口和原生视觉输入。在Artificial Analysis Intelligence Index上,它取得44分,与参数量2.8万亿的Kimi K3持平,仅落后GLM-5.3和Claude Opus 5各一分。但真正让它成为话题的,是定价:单任务成本仅为Claude Opus 5的八分之一,每百万输出Token仅2.7美元。
架构:窄而深,用稀疏索引换长上下文
Step 5 Preview的架构选择颇有针对性。它没有走“加宽网络”的常规路线,而是选择了“窄而深”的设计,共包含92层Transformer。阶跃星辰的理由是,复杂Agent任务通常需要连续搜索、执行代码和调用外部工具,工具返回的信息会形成很长的Prefill阶段,增加模型深度可以为长Prefill中的隐式多跳推理提供更长的信息传播路径。
在百万上下文这个维度上,模型引入了Sparse GQA,通过稀疏索引选择与当前任务相关的历史信息,减少实际进入注意力计算的Token数量。为了抵消Indexer开销和碎片化计算,它进一步采用Block-wise Token Merging,官方称将Indexer和Top-k Selection环节的成本降低至原来的八分之一。这套方案的效果在速度数据上得到了印证:Artificial Analysis实测输出速度约为100 tokens/秒,在同类模型中排名第6。
训练侧同样有不少工程投入。模型在严格在线策略训练中实现了训练与推理的bit-wise对齐,通过确定性算子统一两侧实现、树状归约消除张量并行度影响,端到端开销控制在10%以内;结合MTP-3投机解码、FP8 MoE和跨机专家并行,长程强化学习端到端加速超过三倍。更值得关注的是“自进化”数据体系:Step 5 Preview被用于构建自身后续迭代所需的训练数据,专家制定原则和关键判断,Agent承担任务编排和部分数据生成,团队还建立了Anti-hacking审计机制来防止能力更强的模型寻找评测漏洞。
基准测试:长程Agent是长板,前端渲染是短板
从公开数据看,Step 5 Preview在长程Agent任务上的表现是其最突出的能力。DeepSWE v1.1长程软件工程评测中得分67.7%,略高于Kimi K3 Max的67.5%和GLM-5.3 Max的66.9%。在专门考察Agent连续多步执行的Terminal-Bench 4.0上,Step 5 Preview取得33.3%,接近GPT-5.6 Terra,领先GLM-5.3 Flash和DeepSeek V4.1 Flash的26.8%,而Kimi K3仅为12.6%。在Agents‘ Last Exam的CLI子集ALE-CLI、金融投资研究评测FrontierFinance及跨领域深度研究评测DRACO上,它仅次于GPT-6 Astra或Claude Opus 5,领先其他参评开源模型。
自建StepCodeBench覆盖553个独立代码仓库、9类任务、20个应用领域和33种编程语言,Step 5 Preview在该评测上取得49.0%,在整体任务成功率和跨场景稳定性上表现突出。官方展示的一个案例中,模型将ESP32-S3开发板改造成支持蓝牙按键与语音输入的Vibe Coding键盘,过程中不仅编写代码,还访问COM串口、调用摄像头、获取设备截图并模拟鼠标操作,连续执行超过3小时。
但智东西的实测揭示了明确的边界。模型擅长理解复杂任务、分步骤落地执行,博客链接一键转PPT的完成度很高,3D热气球交互场景也基本符合需求。然而在对视觉设计要求更复杂的场景中,其产出形式缺少图表、配图等多元化素材,需要用户介入迭代指令才能达到理想效果。更值得警惕的是独立社区反馈的工程稳定性问题:有开发者报告模型经常出现工具调用失败,频繁调用不存在的工具,以及“不read就直接edit”导致的失败。
成本效率:看似极致,但Verbosity是隐形账单
Step 5 Preview的定价策略极具侵略性。API价格为输入每百万Token 1美元、输出2.7美元,隐式缓存读取仅0.05美元,缓存折扣高达95%。对比来看,这一价格比GLM-5.3便宜29%的输入成本和39%的输出成本。Artificial Analysis实测其单任务成本为0.71美元,而Kimi K3 Max为2美元,Claude Opus 5为5.86美元。
然而,“便宜”的叙事在Verbosity维度上出现了裂痕。在Intelligence Index评测中,Step 5 Preview生成了约1.60亿输出Token,而相近价位模型的中位数仅为9200万,Artificial Analysis将其标记为“非常冗长”。模型倾向于用更长的推理过程来完成任务,这在一定程度上抵消了低单价带来的成本优势。另一个容易被忽略的问题是响应时间:尽管Decode速度达到100 tokens/秒,但首个answer token平均需要等待约23秒,完整benchmark任务的平均耗时超过12分钟。对于交互式场景,这一延迟是可感知的。
市场定位:先发Preview,开源承诺待兑现
Step 5 Preview的发布节奏值得注意。模型已全量开放API,但完整权重计划于10月15日才开源释放。这意味着当前所有评测都基于服务端版本,社区尚未能在本地环境中验证其真实性能,也没有FP8或GGUF等量化构建可供使用。阶跃星辰将“开源”作为核心叙事之一,但在权重落地之前,开发者对它的信任建立在第三方API评测之上,而非可复现的本地运行。
与此同时,Step 5 Preview在工具调用稳定性上的短板,对于一款主打Agent任务的模型来说是需要正视的问题。Agent场景中,一次工具调用失败可能导致整个任务链断裂,而社区实测中“频繁调用不存在的工具”和“不read就直接edit”这类问题,恰恰指向模型在工具使用纪律上的不足。阶跃星辰在训练侧做了大量工程优化,但预训练阶段对工具调用格式和规范的强化是否足够,目前的信息尚不足以判断。
总结
Step 5 Preview是一款目标明确、数据扎实的旗舰基座模型。它以600B总参数、27B激活参数实现了与2.8万亿参数Kimi K3持平的智能水平,在长程Agent任务和终端执行基准上甚至领先部分更大规模的竞品,速度也处于同类前列。对于需要高频调用、长上下文处理的Agent循环和代码补全场景,它的单位成本优势是实质性的。
但它的短板同样清晰:工具调用稳定性不足、输出冗长导致实际账单膨胀、首个响应延迟偏高、前端渲染和复杂视觉设计能力有限。它更适合作为日常任务的“主力引擎”而非“兜底方案”——在那些任务步骤明确、对工具调用容错有人类监督兜底的场景中,Step 5 Preview提供了当前开源梯队中最具性价比的选择之一。而10月15日的权重开源,将是检验其真实成色的下一个关键节点。
- 点赞
- 收藏
- 关注作者
评论(0)