
中国智能体进入全球第一梯队
1、90.2%背后,中国智能体进入全球第一梯队
7月27日,实在智能旗下实在Agent以90.2%的任务成功率登上OSWorld总榜及Agentic Framework分榜第一,成为该基准首个突破90%的智能体。
这张榜单上,不仅有Anthropic、OpenAI、Meta等大模型巨头,也有UiPath等国际自动化厂商。中国企业能够同台竞技并刷新公开纪录,意义不只是“拿了一个高分”,更在于证明:AI竞争并非只有模型参数一条路,工程体系与产业经验同样可以形成技术优势。
| 关键指标 | 实在Agent表现 |
|---|---|
| 总成功率 | 90.2% |
| 完成得分 | 325.59/361 |
| 系统操作 | 24/24 |
| GIMP图像处理 | 24/26 |
2、OSWorld难在哪里
2.1 不考“会不会说”,考“能不能做”
OSWorld由香港大学、卡内基梅隆大学、滑铁卢大学等机构参与开发,相关论文发表于NeurIPS 2024。OpenAI、Anthropic、Google等企业发布新模型时,也常用它衡量计算机操控能力。
它要求AI进入真实操作系统,通过鼠标、键盘和屏幕信息操作Chrome、VS Code、LibreOffice、GIMP等软件。任务完成与否由验证脚本判断,不依赖主观打分。
2.2 难点在连续执行
真正考验智能体的,不是完成一次点击,而是能否跨应用规划、识别异常并持续纠错。例如:
- 下载文件后整理数据;
- 在多个软件间传递信息;
- 完成图像编辑和系统设置;
- 在长链路中避免一步出错、全程失效。
因此,90.2%体现的是综合执行能力,而非单次模型回答质量。当然,基准高分也不等于企业场景中的绝对可靠,真实生产环境仍有弹窗、延迟、权限和合规等复杂问题。

3、登顶靠的不是“押中一个模型”
3.1 模型之外,还有Harness
智能体可以理解为“模型+工程框架”。模型提供通用智力,Harness则负责规划、工具调用、上下文管理、异常处理和安全控制。对企业而言,后者决定AI能否从“会回答”变成“会干活”。
3.2 八年积累转化为工程优势
实在智能自2018年起深耕自动化,已服务超过6000家企业。真实业务中的老旧系统、无API软件、复杂流程和异常场景,为智能体训练与迭代提供了产业基础。
这也是国产科技创新值得关注之处:不只追赶概念,更把长期积累变成产品能力。对老板而言,判断AI价值最终要回到两件事——能否稳定完成工作,能否带来可计算的降本增效。实在Agent此次登顶说明,下一阶段的竞争,将不只是大模型之争,更是AI员工推动组织升级的能力之争。
- 点赞
- 收藏
- 关注作者
评论(0)