Muse Spark 1.3 评测
Muse Spark 1.3 评测:Meta 的效率突围与未竟的旗舰之争
2026年9月2日,Meta正式发布Muse Spark 1.3,这是该系列在五个月内的第四次迭代。与以往追求参数规模或单项能力突破的路径不同,1.3的升级主题异常清晰:让模型在长程任务中“跑得更稳、花得更少” 。扎克伯格亲自为其站台,称这是该系列在编程和智能体工作上“幅度最大的一次提升”,并放言其性能“便宜得几乎没必要算账”。
1.3最核心的改进在于工作流效率。根据Meta工程团队的内部对比,新模型在完成相关任务时,工具调用次数平均减少约20%,Token消耗量减少约25%。这并非简单的“省字”行为,而是指向智能体任务中真正的成本痛点——上下文装配、失败重试和无效轮次。Meta同时强化了长程任务中的状态保持能力,模型能够在同一对话线程中处理多个工作流,识别计划缺口后主动修订,并在执行不可逆操作前请求用户确认。在长上下文测试中,1.3在256K至512K区间拿到98.5分,领先第二名GPT-5.6 Sol的91.5分;上下文扩大到512K至1M时,仍以98.1分保持显著优势。
独立评测机构Artificial Analysis的数据为1.3的能力提供了第三方锚点。当前公开可用的xhigh版本在Intelligence Index上得分61,与GPT-5.6 Sol(max)和Grok 4.6(high)并列;限量合作伙伴预览的max版本得分62,仅次于Claude Fable 5.1和Claude Opus 5的部分配置。在Agentic知识工作基准Tau3-Bench Banking上,xhigh版本从1.2的35%跃升至47%,max版本进一步达到52%,位列所有模型第一。DeepSWE v1.1编程测试中,1.3取得75.4分,高于官方图表中GPT-5.6 Sol和Opus 5的成绩。不过Meta也承认,在其他测试项目中竞争对手仍保持领先。
成本效率是1.3最具冲击力的维度。标准API定价维持不变:输入每百万Token 1.25美元,输出4.25美元,缓存输入0.15美元。按Artificial Analysis的测算,xhigh版本每个Intelligence Index任务的成本约为0.55美元,而同一档位的GPT-5.6 Sol(max)和Grok 4.6(high)分别约为0.95美元和0.94美元,溢价超过70%。更具争议的是贡献者层级:开发者若允许Meta使用其数据训练模型,输入价格降至每百万Token 0.10美元,输出降至0.20美元,输入价格仅为标准版的约十二分之一。有网友实测让1.3连续运行两小时、执行超过60次Agent调用进行自我改进迭代,全程花费不到1美元。
然而,1.3也存在需要审慎看待的局限。最强性能集中在max配置中,而该版本目前仅向Meta合作伙伴限量预览,公开可用的xhigh版本在Intelligence Index上落后1分,在OSWorld 2.0等基准上与max的差距更为明显。这意味着开发者当前能实际部署的模型,与Meta宣传材料中展示的“前沿性能”之间存在可感知的落差。此外,1.3的成本效率提升部分来自输入Token的显著增加——agentic评测中每任务输入Token增长约57%,输出Token仅增长约8%。对于输入量远大于输出量的任务,这种“以输入换质量”的策略在账单上的表现需要结合具体工作流来评估。
综合来看,Muse Spark 1.3是一款定位精准的效率型旗舰。它在编程和Agent任务上展现出接近头部水平的竞争力,同时将任务成本压到了同档位模型难以匹配的低位。对于需要长时间运行、多步骤调用的编码和自动化工作流,1.3是目前市场上性价比最突出的选择之一。但它尚未真正站上性能前沿——Anthropic的Claude系列仍在Intelligence Index顶端占据位置,而1.3最好的那部分能力,开发者还需要等待。Meta用五个月四次迭代的节奏证明了自己正在认真参与竞争,而1.3的意义或许不在于“登顶”,而在于它让“足够好且足够便宜”这件事,第一次变得如此有说服力。
- 点赞
- 收藏
- 关注作者
评论(0)