Gemini 4 Pro 评测
Gemini 4 Pro 评测:跳代旗舰的碾压姿态,与一次精心策划的“匿名钓鱼”
2026年9月中旬,LMArena竞技场上悄然出现了一个名为“gemini-3.8-flash”的匿名模型。社区起初以为这只是Google对Gemini 3系列的一次常规微调——毕竟Gemini 3.8 Flash刚在9月初正式发布,同名模型再次出现极不寻常。但当全球开发者用极其刁钻的Prompt对其进行压力测试后,马甲被迅速扒下:这极有可能是谷歌DeepMind内部代号“Argon”的下一代旗舰Gemini 4 Pro的早期检查点。谷歌用一种极具攻击性的方式,在没有发布会的情况下,让全行业替它完成了产品评估。
架构:千万级上下文与“跳代”的决断
Gemini 4 Pro最令人窒息的规格来自上下文窗口。泄露信息显示,它支持1000万Token输入上限和25.6万Token输出上限,输出上限约为现有Gemini Pro模型65,536个Token的四倍。更关键的是,它据称具备跨会话永久记忆功能,且无需API即可直接联网。这意味着模型可以在不依赖外部检索增强的情况下,在超长工程会话中保持对历史决策的完整记忆,同时自主获取实时信息。
这一代最值得关注的技术叙事是RSI(递归自我改进)。Google DeepMind首席战略官Jasjeet Sekhon此前在伯克利的一场活动上明确表示,RSI已成为AI巨额投资逻辑中的关键一环。据传Gemini 4之所以能在短短两个月内完成早期预训练并进入后训练阶段,正是因为DeepMind在训练中实现了某种形式的RSI闭环——模型参与改进自身能力。如果这一说法属实,它比任何单项跑分都更具长期意义。
值得一提的是,谷歌原计划在2026年秋季发布Gemini 3.5 Pro作为过渡,但3.5 Pro的进化程度连Flash都比不上,发布一再跳票后最终被取消。DeepMind选择直接跳代到Gemini 4,意味着前一代架构被彻底推翻。
基准测试:多项SOTA,全面压制竞品
从流出的基准测试图来看,Gemini 4 Pro在多项任务中取得了全面领先。在AI智能体编码任务DeepSWE v1.1上,它拿下约88%的分数,超过GPT-6 Astra的86.9%。在真实知识工作任务GDPval-AA v2中,它是唯一突破2000 Elo大关的模型,达到2064分。Terminal-bench 2.1终端编码能力测试中,它以95.3%的得分领跑全场。计算机操作测试OSWorld-2.0中,它取得86.8%,同样排名第一。
更值得注意的指标是任务复杂度的放大效应。在考察Agent连续多步执行能力的Terminal-Bench 4.0中,Gemini 4 Pro与自家Flash的差距从上代的3.2%拉大到了13.9%——任务越复杂、步骤越多,它的优势越明显。这说明Gemini 4 Pro的提升并非简单的“更聪明”,而是在长程规划、工具使用纪律和上下文管理上的系统性进步。
实测体验:碾压的体感与不稳定的审美
开发者实测中最具冲击力的案例来自知名测评博主AI_Screening的物理模拟对比。它要求Gemini 4 Pro和Opus 5.5分别用代码生成一个3D浮筒飞机在水面滑行起飞的场景。Opus 5.5生成的飞机机身晃动剧烈、水面物理反馈生硬,而Gemini 4 Pro的表现“丝滑多了,加速平稳,水面反射清晰,对溅水效果的渲染很逼真”。
更具标志性的测试是一位开发者抛出的“无中生有”任务:在不导入任何3D模型的情况下,Gemini 4 Pro仅用16分钟,通过纯代码生成了一个交互式3D国际空间站绕地球运行的模拟程序。它不仅自己用Three.js建好了空间站模型,还主动从网上抓取了正确的地球贴图,保证经纬度和颜色准确。另有开发者仅用14分钟就生成了一个完整的产品展示网站,前后端全包。
但它并非没有瑕疵。多个测试者指出,生成的UI界面“有点丑”,背面存在透视bug,设计审美在不同部件上表现不稳定。在处理Prompt时,它似乎存在“过度雕琢”的倾向,会竭尽全力丰富细节,哪怕用户没有要求。
定价与市场定位
如果泄露的定价属实,Gemini 4 Pro每百万Token输入2.25美元、输出11.25美元的价格,在顶级旗舰中极具攻击性。横向对比,GPT-6 Astra为输入10美元、输出50美元,Claude Fable 5.1为输入10美元、输出50美元——Gemini 4 Pro的输出单价约为它们的四分之一到五分之一。对于需要高频调用的Agent和编码任务,这一价格差距意味着使用模式可能从“精打细算”转向“默认调用”。
总结
Gemini 4 Pro是一次跳代式的旗舰回归。它在Agent编码、计算机操作和长程任务执行上的全面领先,配合千万级上下文和极具侵略性的定价,构成了一个清晰的产品信号:谷歌不再满足于“在某一项上竞争”,而是要重新定义旗舰模型的基线。RSI技术的引入如果得到验证,更可能从根本上改变模型迭代的速度曲线。
但当前所有信息均来自匿名竞技场测试和泄露截图,谷歌尚未正式确认任何规格或定价。实测中暴露的UI审美不稳定和细节瑕疵,也提示这仍是一个处于迭代中的检查点。真正的Gemini 4 Pro发布时会是什么样,可能比这个“马甲版”更值得期待。
- 点赞
- 收藏
- 关注作者
评论(0)