中国智能体进入全球第一梯队

举报
yd_293602503 发表于 2026/07/30 14:38:47 2026/07/30
【摘要】 1、90.2%背后,中国智能体进入全球第一梯队7月27日,实在智能旗下实在Agent以90.2%的任务成功率登上OSWorld总榜及Agentic Framework分榜第一,成为该基准首个突破90%的智能体。这张榜单上,不仅有Anthropic、OpenAI、Meta等大模型巨头,也有UiPath等国际自动化厂商。中国企业能够同台竞技并刷新公开纪录,意义不只是“拿了一个高分”,更在于证明:...

1、90.2%背后,中国智能体进入全球第一梯队

7月27日,实在智能旗下实在Agent以90.2%的任务成功率登上OSWorld总榜及Agentic Framework分榜第一,成为该基准首个突破90%的智能体。

这张榜单上,不仅有Anthropic、OpenAI、Meta等大模型巨头,也有UiPath等国际自动化厂商。中国企业能够同台竞技并刷新公开纪录,意义不只是“拿了一个高分”,更在于证明:AI竞争并非只有模型参数一条路,工程体系与产业经验同样可以形成技术优势。

关键指标 实在Agent表现
总成功率 90.2%
完成得分 325.59/361
系统操作 24/24
GIMP图像处理 24/26

2、OSWorld难在哪里

2.1 不考“会不会说”,考“能不能做”

OSWorld由香港大学、卡内基梅隆大学、滑铁卢大学等机构参与开发,相关论文发表于NeurIPS 2024。OpenAI、Anthropic、Google等企业发布新模型时,也常用它衡量计算机操控能力。

它要求AI进入真实操作系统,通过鼠标、键盘和屏幕信息操作Chrome、VS Code、LibreOffice、GIMP等软件。任务完成与否由验证脚本判断,不依赖主观打分。

2.2 难点在连续执行

真正考验智能体的,不是完成一次点击,而是能否跨应用规划、识别异常并持续纠错。例如:

  • 下载文件后整理数据;
  • 在多个软件间传递信息;
  • 完成图像编辑和系统设置;
  • 在长链路中避免一步出错、全程失效。

因此,90.2%体现的是综合执行能力,而非单次模型回答质量。当然,基准高分也不等于企业场景中的绝对可靠,真实生产环境仍有弹窗、延迟、权限和合规等复杂问题。

3、登顶靠的不是“押中一个模型”

3.1 模型之外,还有Harness

智能体可以理解为“模型+工程框架”。模型提供通用智力,Harness则负责规划、工具调用、上下文管理、异常处理和安全控制。对企业而言,后者决定AI能否从“会回答”变成“会干活”。

3.2 八年积累转化为工程优势

实在智能自2018年起深耕自动化,已服务超过6000家企业。真实业务中的老旧系统、无API软件、复杂流程和异常场景,为智能体训练与迭代提供了产业基础。

这也是国产科技创新值得关注之处:不只追赶概念,更把长期积累变成产品能力。对老板而言,判断AI价值最终要回到两件事——能否稳定完成工作,能否带来可计算的降本增效。实在Agent此次登顶说明,下一阶段的竞争,将不只是大模型之争,更是AI员工推动组织升级的能力之争。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。