GLM-5.3-flash 评测
GLM-5.3-Flash 评测:18B 激活参数的“越级”与代价
2026年8月26日晚,智谱正式上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型。此前它以“Ox-Alpha”的匿名身份在OpenRouter上进行了数天测试,中文社区称之为“牛来”,上线首日即登顶调用量榜单,刷新了平台单日Token用量历史纪录。智谱在发布公告中写道:“同样智力,1/40价格,前沿智能,第一次不需要省着用。”这句话既是对市场的宣言,也是对这款模型定位的精确概括。
GLM-5.3-Flash最核心的工程选择,是把总参数压缩到320B、每个Token仅激活约18B。它放弃了单纯堆参数的传统路径,转向“用更少的推理计算量保住旗舰能力”。架构上,它成为首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,引入流形约束超连接技术,基于30T Token多模态语料预训练。相比GLM-5.3,其单Token注意力计算量降低3.01倍,KV缓存体积减少4.44倍,在支持1M上下文窗口的同时大幅降低了长上下文场景的服务成本。这意味着它在处理长文档、大型代码仓库时,不会像传统稠密注意力模型那样因上下文膨胀而成本失控。
基准测试的结果验证了这套架构的有效性。在Artificial Analysis Intelligence Index上,GLM-5.3-Flash取得57分,与Claude Opus 4.8的最高档得分持平,超过了上一代旗舰GLM-5.2以及DeepSeek V4 Pro的53分。在Terminal-Bench 2.1上它得到84.3分,仅落后Opus 4.8的85.0分。DeepSWE v1.1编程测试从GLM-5.2的46.2跃升至63.4,AutomationBench从26.2提升至48.8,提升幅度已超出常规版本迭代的范畴。智谱自研的 Code Bench max effort测试中,它以29.0分与Opus 4.8的29.5分仅差0.5分。不过这些数据大多来自官方选定的对比集,独立验证仍在进行中。
定价是GLM-5.3-Flash最具冲击力的维度。官方API价格为输入每百万Token 0.8元、输出2.8元、缓存命中0.23元,仅为GLM-5.3的十分之一,限时折扣期可低至二十分之一。对比Claude Opus 4.8每百万Token约35元输入、175元输出的定价,GLM-5.3-Flash的使用成本约为其四十分之一。即便与调价后的DeepSeek V4 Flash相比,其综合输入输出成本在大多数常规调用场景下仍更具优势。对于需要高频调用的代码补全、文档处理和Agent循环任务,这一价格区间意味着它可以从“偶尔调用”变为“默认选择”。智谱还将其全面接入GLM Coding Plan,可用额度较GLM-5.3增加至三倍。
实测表现呈现出明确的能力边界。智东西的深度测试中,GLM-5.3-Flash在识图任务上准确识别了《复仇者联盟4》海报中的演员与角色对应关系,甚至标注了火箭浣熊的配音演员;在一份字迹混杂的公务员考试试卷照片上,它依靠半份材料和草稿信息仅答错一题。但在视频剪辑和3D游戏开发任务中,问题开始暴露:素材自动漂移到轨道开头、变速和渐变参数修改不生效、页面元素相互遮挡。更严重的是社区反馈的稳定性缺陷——多个GitHub Issue报告该模型在长时间推理后思考轨迹会退化为无限单Token重复,或者在多工具Agent任务中陷入“!”的无限循环,导致会话无法正常终止。
输出速度是另一个需要正视的短板。Artificial Analysis实测其输出速度约为50.2 tokens/秒,而GLM-5.3约为86 tokens/秒,差距接近一倍。对于交互式编程助手或实时对话场景,这一速度落差是可感知的。
综合来看,GLM-5.3-Flash是一款定位精准的效率型前沿模型。它在编程、Agent任务和长上下文处理上展现出接近旗舰水准的竞争力,同时把使用成本压到了同档位模型难以匹配的低位。但它更适合作为日常任务的“主力引擎”而非“兜底方案”——对于高频调用的代码补全、文档理解、信息整理和中等复杂度Agent循环,它是当前市场上性价比最突出的选择之一;而在需要高可靠性的长程任务、复杂视频编辑或严格指令遵循的场景中,它的稳定性短板和速度限制意味着GLM-5.3或竞品旗舰仍然不可替代。这款模型真正值得关注的地方在于,它用18B激活参数做到了上一代753B模型才能完成的事,这比“便宜”本身更具长期意义。
- 点赞
- 收藏
- 关注作者
评论(0)