Gemini 4 Pro 评测

举报
GrayParis 发表于 2026/10/01 10:33:35 2026/10/01
【摘要】 Gemini 4 Pro 评测:跳代旗舰的碾压姿态,与一次精心策划的“匿名钓鱼”2026年9月中旬,LMArena竞技场上悄然出现了一个名为“gemini-3.8-flash”的匿名模型。社区起初以为这只是Google对Gemini 3系列的一次常规微调——毕竟Gemini 3.8 Flash刚在9月初正式发布,同名模型再次出现极不寻常。但当全球开发者用极其刁钻的Prompt对其进行压力测...

Gemini 4 Pro 评测:跳代旗舰的碾压姿态,与一次精心策划的“匿名钓鱼”

2026年9月中旬,LMArena竞技场上悄然出现了一个名为“gemini-3.8-flash”的匿名模型。社区起初以为这只是Google对Gemini 3系列的一次常规微调——毕竟Gemini 3.8 Flash刚在9月初正式发布,同名模型再次出现极不寻常。但当全球开发者用极其刁钻的Prompt对其进行压力测试后,马甲被迅速扒下:这极有可能是谷歌DeepMind内部代号“Argon”的下一代旗舰Gemini 4 Pro的早期检查点。谷歌用一种极具攻击性的方式,在没有发布会的情况下,让全行业替它完成了产品评估。

架构:千万级上下文与“跳代”的决断

Gemini 4 Pro最令人窒息的规格来自上下文窗口。泄露信息显示,它支持1000万Token输入上限和25.6万Token输出上限,输出上限约为现有Gemini Pro模型65,536个Token的四倍。更关键的是,它据称具备跨会话永久记忆功能,且无需API即可直接联网。这意味着模型可以在不依赖外部检索增强的情况下,在超长工程会话中保持对历史决策的完整记忆,同时自主获取实时信息。

这一代最值得关注的技术叙事是RSI(递归自我改进)。Google DeepMind首席战略官Jasjeet Sekhon此前在伯克利的一场活动上明确表示,RSI已成为AI巨额投资逻辑中的关键一环。据传Gemini 4之所以能在短短两个月内完成早期预训练并进入后训练阶段,正是因为DeepMind在训练中实现了某种形式的RSI闭环——模型参与改进自身能力。如果这一说法属实,它比任何单项跑分都更具长期意义。

值得一提的是,谷歌原计划在2026年秋季发布Gemini 3.5 Pro作为过渡,但3.5 Pro的进化程度连Flash都比不上,发布一再跳票后最终被取消。DeepMind选择直接跳代到Gemini 4,意味着前一代架构被彻底推翻。

基准测试:多项SOTA,全面压制竞品

从流出的基准测试图来看,Gemini 4 Pro在多项任务中取得了全面领先。在AI智能体编码任务DeepSWE v1.1上,它拿下约88%的分数,超过GPT-6 Astra的86.9%。在真实知识工作任务GDPval-AA v2中,它是唯一突破2000 Elo大关的模型,达到2064分。Terminal-bench 2.1终端编码能力测试中,它以95.3%的得分领跑全场。计算机操作测试OSWorld-2.0中,它取得86.8%,同样排名第一。

更值得注意的指标是任务复杂度的放大效应。在考察Agent连续多步执行能力的Terminal-Bench 4.0中,Gemini 4 Pro与自家Flash的差距从上代的3.2%拉大到了13.9%——任务越复杂、步骤越多,它的优势越明显。这说明Gemini 4 Pro的提升并非简单的“更聪明”,而是在长程规划、工具使用纪律和上下文管理上的系统性进步。

实测体验:碾压的体感与不稳定的审美

开发者实测中最具冲击力的案例来自知名测评博主AI_Screening的物理模拟对比。它要求Gemini 4 Pro和Opus 5.5分别用代码生成一个3D浮筒飞机在水面滑行起飞的场景。Opus 5.5生成的飞机机身晃动剧烈、水面物理反馈生硬,而Gemini 4 Pro的表现“丝滑多了,加速平稳,水面反射清晰,对溅水效果的渲染很逼真”。

更具标志性的测试是一位开发者抛出的“无中生有”任务:在不导入任何3D模型的情况下,Gemini 4 Pro仅用16分钟,通过纯代码生成了一个交互式3D国际空间站绕地球运行的模拟程序。它不仅自己用Three.js建好了空间站模型,还主动从网上抓取了正确的地球贴图,保证经纬度和颜色准确。另有开发者仅用14分钟就生成了一个完整的产品展示网站,前后端全包。

但它并非没有瑕疵。多个测试者指出,生成的UI界面“有点丑”,背面存在透视bug,设计审美在不同部件上表现不稳定。在处理Prompt时,它似乎存在“过度雕琢”的倾向,会竭尽全力丰富细节,哪怕用户没有要求。

定价与市场定位

如果泄露的定价属实,Gemini 4 Pro每百万Token输入2.25美元、输出11.25美元的价格,在顶级旗舰中极具攻击性。横向对比,GPT-6 Astra为输入10美元、输出50美元,Claude Fable 5.1为输入10美元、输出50美元——Gemini 4 Pro的输出单价约为它们的四分之一到五分之一。对于需要高频调用的Agent和编码任务,这一价格差距意味着使用模式可能从“精打细算”转向“默认调用”。

总结

Gemini 4 Pro是一次跳代式的旗舰回归。它在Agent编码、计算机操作和长程任务执行上的全面领先,配合千万级上下文和极具侵略性的定价,构成了一个清晰的产品信号:谷歌不再满足于“在某一项上竞争”,而是要重新定义旗舰模型的基线。RSI技术的引入如果得到验证,更可能从根本上改变模型迭代的速度曲线。

但当前所有信息均来自匿名竞技场测试和泄露截图,谷歌尚未正式确认任何规格或定价。实测中暴露的UI审美不稳定和细节瑕疵,也提示这仍是一个处于迭代中的检查点。真正的Gemini 4 Pro发布时会是什么样,可能比这个“马甲版”更值得期待。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0)

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。