Qwen3.8-Max 评测

举报
GrayParis 发表于 2026/09/18 09:36:20 2026/09/18
【摘要】 Qwen3.8-Max 评测:2.4 万亿参数的“长程 Agent 豪赌”2026年8月3日,阿里巴巴正式发布 Qwen3.8-Max,这是 Qwen 家族迄今规模最大的模型,也是 Qwen-Max 级别首次宣布开源权重。2.4 万亿总参数、950 亿激活参数、100 万 Token 上下文窗口——这些数字足以让它在发布时占据头条。但真正值得关注的,是这代 Max 把叙事重心从“参数规模”...

Qwen3.8-Max 评测:2.4 万亿参数的“长程 Agent 豪赌”

2026年8月3日,阿里巴巴正式发布 Qwen3.8-Max,这是 Qwen 家族迄今规模最大的模型,也是 Qwen-Max 级别首次宣布开源权重。2.4 万亿总参数、950 亿激活参数、100 万 Token 上下文窗口——这些数字足以让它在发布时占据头条。但真正值得关注的,是这代 Max 把叙事重心从“参数规模”转向了“长程 Agent 能力”。官方技术博客中,规格和榜单被迅速带过,占据大量篇幅的是 16 天自主编程、125 小时科研复现、数百轮芯片优化等端到端执行案例。

架构:渐进式升级而非重构

Qwen3.8-Max 并非从零重构的产物。它基于 Qwen 3.5 的架构基础构建,采用稀疏混合专家(MoE)架构,结合混合注意力机制,在实际推理时仅激活 950 亿参数。在底层细节上,模型引入了 GDN 加 QSA 混合稀疏注意力架构,其中 Gated DeltaNet 负责对历史信息做高效压缩记忆,Qwen 稀疏注意力以微块粒度筛选关键信息,官方称在百万 Token 上下文场景下预填充阶段最高实现 7.6 倍加速。此外,门控残差机制将信息流拓展为四条并行通道,N-gram Embedding 模块提供 51B 规模额外参数以拓展知识容量,训练阶段使用 Muon 优化器提升收敛速度。

这套架构选择传递了一个明确信号:Qwen3.8-Max 不再试图用“更大”来定义自己。2.4T 参数即使在开放权重后,其主要价值也更偏向云厂商、企业和研究机构,而非普通开发者本地部署。它的任务是在 Qwen 体系内抬高能力上限,再由 Qwen Code、办公 Agent 和阿里云将这种能力送进具体工作流。

基准测试:Agent 与多模态亮眼,编码仍有差距

从公开数据看,Qwen3.8-Max 在 Agent 和多模态维度表现出色。在 Artificial Analysis Intelligence Index 上,它取得 40 分,高于同类模型中位数 24。在 GDPval-AA 工作任务的评测中,它的 Elo 评分跃升 468 点至 1739,超过了 Kimi K3 的 1685,仅落后于 Claude Opus 5 的 1852。BenchLM 的类别百分位显示,其 Agentic 能力位列第 95 百分位,多模态能力排名第 5,Coding 位列第 87 百分位。

但在核心软件工程测试中,差距依然明显。Anthropic 的 Fable 5 在 SWE-Pro 上得分 80.0,而 Qwen3.8-Max 为 67.7;FrontierSWE 上 Fable 5 拿到 88.8,Qwen3.8-Max 仅为 73.5。在 Arena 前端代码竞技场中,Qwen3.8-Max 以 1668 分位列第四,落后于 Claude Opus 5(Max)的 1705 分和 Kimi K3(Max)的 1676 分。不过值得注意的是,截至 9 月 2 日,阿里对模型进行了专项后训练更新,CodeArena 前端编程得分提升 22 分至 1691 分,登顶总榜。

实际体验:高完成度背后的“算力黑洞”

雷峰网的一次实测为 Qwen3.8-Max 的长程能力提供了直观参照。测试者让模型从零搭建一个 3D 大模型演进宇宙网站,并与 GPT-5.6 做了对比。结果呈现出鲜明的两面性:Qwen3.8-Max 展现了远超 GPT-5.6 的交付细节,但高完成度的代价是低效率——模型无法自主判断任务终点,导致额度耗尽中断。

这一问题的根源在成本数据中得到了印证。Qwen3.8-Max 每完成一个 Intelligence Index 任务需要 64 个工作步骤,而上一代 Qwen3.7 Max 仅需 14 步;输入 Token 增长至 15 倍,因为模型在每一步都会将此前全部对话历史重新发送。结果是单任务成本从 Qwen3.7 Max 的 0.53 美元涨至 1.14 美元,涨幅超过一倍。Token 单价实际上下降了——输入从 2.5 美元降至 2 美元,输出从 7.5 美元降至 6 美元——但任务层面的总开销反而大幅上升。

速度是另一个不可忽视的短板。Artificial Analysis 实测其输出速度约为 37.8 tokens/秒,在同类模型中处于最低档;首 Token 延迟达到 55.38 秒。这意味着对于交互式编程助手或实时对话场景,Qwen3.8-Max 的响应体验存在明显瓶颈。

另一个需要警惕的信号来自诚实性维度。在 AA-Omniscience 测试中,Qwen3.8-Max 的命中率维持在约 31%,但幻觉率从 Qwen3.7 Max 的 23% 上升至 40%——模型更倾向于“猜答案”而非承认不知道。对于需要高可靠性的专业任务,这是一个需要人工复核兜底的现实约束。

定价与定位

Qwen3.8-Max 的 API 定价为输入每百万 Token 2 美元、输出 6 美元,缓存命中输入 0.25 美元。横向对比,Claude Opus 5 的定价远高于此,但 Kimi K3 在 Intelligence Index 上得分高 1 分的同时,单任务成本仅为 0.86 美元,比 Qwen3.8-Max 便宜约 25%。价格竞争力确实存在,但并非无可替代。

Qwen3.8-Max 是一款目标明确但代价同样明确的旗舰模型。它在 Agent 任务、多模态理解和长程自主执行上展现出了国产模型从未达到的高度,16 天自主编程的公开 trace 证明了模型在真实工程闭环中的持续执行潜力。但它的效率问题不容回避:每任务 64 步的工作流、15 倍的输入 Token 膨胀、超过 1 美元的单任务成本和接近一分钟的首 Token 延迟,共同构成了一个“不计成本追求极致性能”的使用画像。对于需要快速迭代、低成本原型的场景,它并非首选;但在那些任务复杂、周期长、且人类愿意为长程产出支付算力和时间溢价的场景中,Qwen3.8-Max 提供了一种昂贵但有效的国产替代方案。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0)

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。