DeepSeek V4.1 Flash 评测:重新定义高性价比旗舰模型

举报
GrayParis 发表于 2026/09/12 11:06:22 2026/09/12
【摘要】 2026年9月10日,DeepSeek正式发布V4.1 Flash模型,同步下调API价格并宣布V4 Pro服务将于9月14日下线。这款模型不仅是DeepSeek全新架构系列中最小尺寸的产品,更标志着DeepSeek在模型效率和能力边界上的一次重要探索。V4.1 Flash最引人注目的创新在于其非对称模型结构。该模型总参数量为552B,属于混合专家模型(MoE),但采用了全新的Causal-...

2026年9月10日,DeepSeek正式发布V4.1 Flash模型,同步下调API价格并宣布V4 Pro服务将于9月14日下线。这款模型不仅是DeepSeek全新架构系列中最小尺寸的产品,更标志着DeepSeek在模型效率和能力边界上的一次重要探索。

V4.1 Flash最引人注目的创新在于其非对称模型结构。该模型总参数量为552B,属于混合专家模型(MoE),但采用了全新的Causal-Encoder-Decoder架构。其核心特征是输入与输出的计算规模不对称:处理输入时仅激活8B参数,生成输出时激活16B参数。这种设计精准契合了Agent任务的实际工作模式——处理代码仓库、长文档和历史对话时,模型需要读取海量信息,但生成的内容量相对有限。降低输入环节的计算开销,直接改善了这类任务的整体效率。同时,模型通过KV Cache压缩技术,将显存需求降至上一代的四分之一、SSD需求降至八分之一,社区实测输出速度达到300至500 tokens/秒。

在性能表现方面,V4.1 Flash在多项基准测试中取得了令人瞩目的成绩。官方数据显示,该模型在GPQA Diamond科学问答测试中获得90.9分,Codeforces竞赛编程评级达到3471。在终端任务执行测试Terminal-Bench 2.1上,新模型得分90.6,超越了V4 Pro的87.9分以及GPT-5.6 Sol的88.8分。网络安全测试CyberGym中,V4.1 Flash取得88.1分,领先于V4 Pro的83.3分和GPT-5.6 Sol的84.5分。这些结果表明,DeepSeek通过新的预训练方式和更大规模的强化学习后训练,成功将Flash级别的模型推向了旗舰级的智能水平。

然而,独立评测也揭示了V4.1 Flash的能力边界。第三方测试显示,该模型在Artificial Analysis Intelligence Index上得分40,虽然超越了V4 Pro的36分,但仍落后于Kimi K3的44分和GLM-5.3的45分。更值得注意的是,知名评测者Matthew Berman在实测中发现,V4.1 Flash虽然能在约6秒内生成一篇千字文章,但在构建功能性魔方模拟器时出现了颜色逻辑错误,“求解”功能也只是反向回放操作而非应用有效的求解算法。在视觉和物理模拟任务中,模型的表现同样不够稳定。这提示我们,V4.1 Flash在需要严格正确性的场景下,尚不能完全替代顶级旗舰模型。

成本效率是V4.1 Flash最具竞争力的维度。新价格于9月10日12时生效:空闲时段缓存命中输入仅0.02元/百万Token,缓存未命中输入1元,输出4元;高峰时段价格翻倍。相比此前V4 Pro的定价,降幅最高达60%。在语义分析测试中,B300 GPU运行V4.1 Flash的吞吐量达到每芯片66335 tokens/秒,每百万Token成本仅为0.01美元,成本效率较同类方案高出532%。对于需要大量调用API的Agent应用和自动化工作流而言,这一成本优势具有实质性的商业价值。

V4.1 Flash的另一项重要升级是原生多模态视觉理解能力的引入。此前,DeepSeek通过V4 Flash Vision Exp提供实验性质的视觉能力,而此次V4.1 Flash将文字与图片处理整合进同一个主力API模型。开发者可以利用该模型进行文档理解、截图文字识别和图表分析,图片可以作为公开链接传入,也可以编码后直接提交。在基础规格上,模型支持100万Token上下文、最大384K输出,并提供思考与非思考两种模式,思考强度支持low、high、max三档配置。

综合来看,DeepSeek V4.1 Flash是一款定位精准的高性价比主力模型。它在架构设计上实现了效率与能力的平衡,在多数任务上展现出接近旗舰模型的水准,同时将使用成本压缩到极具竞争力的水平。对于代码理解、长文档分析、多模态文档审查以及Agent任务循环等场景,V4.1 Flash是当前市场上最具性价比的选择之一。但用户也需要清醒认识到,在需要高度正确性和复杂物理模拟的场景中,该模型仍存在明显短板。DeepSeek选择让V4 Pro退场、由V4.1 Flash全面承接,既体现了对新产品能力的自信,也预示着模型竞争正从单纯的参数规模比拼,转向效率、成本与能力三角关系的重新平衡。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。