90.2%登顶背后:一套跑了八年的Harness工程体系,如何撑起Computer-Use Agent的落地?

举报
Hello_AIAgent 发表于 2026/09/10 11:20:18 2026/09/10
【摘要】 数据来源:OSWorld-Verified 官方榜单,截至 2026/9/10 更新。榜单第一:实在Agent / 实在智能 / Type: Agentic framework / Max Steps: 100 / Runs: 1 / 成功率 90.2%。 一、OSWorld 榜单更新:实在Agent 以 90.2% 登顶在 Computer-Use Agent 这个赛道上,OSWorld ...

数据来源:OSWorld-Verified 官方榜单,截至 2026/9/10 更新。
榜单第一:实在Agent / 实在智能 / Type: Agentic framework / Max Steps: 100 / Runs: 1 / 成功率 90.2%。

image.png


一、OSWorld 榜单更新:实在Agent 以 90.2% 登顶

在 Computer-Use Agent 这个赛道上,OSWorld 一直被视为最接近“真实电脑操作”的试金石。

它不是那种只跑网页 DOM、只点固定按钮的玩具 benchmark。OSWorld 提供的是真实操作系统环境,支持 Ubuntu、Windows、macOS,任务覆盖 Chrome、GIMP、LibreOffice、Thunderbird、VLC、VS Code,以及跨应用工作流和 OS 级文件操作。官方基准包含 369 个真实世界计算机任务,其中 8 个 Google Drive 任务因网络依赖可官方排除,因此 361 任务口径被广泛接受。

更关键的是,OSWorld 采用执行式评估:不是看 Agent 说了什么,而是看它最后有没有把文件改对、把邮件发对、把表格算对、把系统状态改对。每个任务都有初始状态配置和自定义评估脚本,强调可复现、可验证。

在最新 OSWorld-Verified 榜单中,排名第一的是:

排名 模型/Agent 团队 类型 成功率 成功/总数
1* 实在Agent 实在智能 Agentic framework 90.2% 325.59 / 361
2 claude-fable-5[1m] Anthropic General model 86.0% 307.73 / 358
3 Pointer Agent w/ Opus 4.7 Pointer Agentic framework 83.6% 301.94 / 361
4 claude-opus-5[1m] Anthropic General model 83.4% 300.2 / 360
5 Coasty CUA v1 Coasty Team General model 82.8% 297.29 / 359
6 Pointer Agent w/ Sonnet 4.6 Pointer Agentic framework 81.5% 293.22 / 360
7 Muse Spark 1.1 Meta Superintelligence Labs General model 80.7% 291.22 / 361
8 Holo3-35B-A3B H Company Specialized model 80.4±2.2% 296.41 / 359
9 OpenAPA w/ gemini-3.1-pro Laiye Agentic framework 78.3% 282.8 / 361
10 VLAA-GUI w/ Opus 4.5 UCSC VLAA Lab Agentic framework 76.3% 272.24 / 357

几个信息值得注意:

  1. 90.2% 是单次运行结果。榜单里实在Agent 的 Runs 是 1,没有带多 rollout 投票标记。也就是说,它不是靠 N 次采样选最优刷出来的。
  2. 它是 Agentic framework,不是单纯模型。榜单把 General model、Specialized model、Agentic framework 分开。实在Agent 属于第三类:把模型、工具、环境、验证、恢复组织成结构化工作流。
  3. 它领先通用模型最强成绩 4.2 个百分点,领先其他 Agentic framework 也有一截。这说明当前 Computer-Use Agent 的竞争,已经不只是“模型谁更聪明”,而是“Harness 谁更稳”。

二、拆开 90.2%:确定性桌面几乎打满,Chrome 和跨应用仍是硬骨头

先看实在Agent 在 OSWorld-Verified 361 任务上的分应用表现:

应用域 成功/总数 成功率
OS 24.0 / 24 100%
VLC 16.89 / 17 99.4%
LibreOffice Calc 46.0 / 47 97.9%
LibreOffice Writer 22.0 / 23 95.7%
VS Code 22.0 / 23 95.7%
GIMP 24.0 / 26 92.3%
LibreOffice Impress 42.96 / 47 91.4%
Thunderbird 13.0 / 15 86.7%
Multi-apps 78.81 / 93 84.7%
Chrome 35.93 / 46 78.1%
总计 325.59 / 361 90.2%

这张表很说明问题。

一方面,在确定性较强的桌面应用里,实在Agent 几乎打满:OS 100%,VLC 99.4%,Calc 97.9%,Writer 和 VS Code 都是 95.7%。这些任务通常有明确控件、稳定 UI、清晰状态,适合 Harness 做动作抽象、状态断言和错误恢复。

另一方面,真正拉低均分的是 Chrome 和 Multi-apps。Chrome 只有 78.1%,跨应用工作流 84.7%。这很符合真实落地体感:网页动态渲染、登录态、弹窗、验证码、DOM 变化、反自动化策略,远比本地桌面应用难;跨应用则要求 Agent 在多个窗口、多个数据源、多个状态机之间传递上下文,任何一步丢失都可能导致最终评估失败。

所以 90.2% 不是“电脑操作已经被解决”,而是“确定性桌面操作已经工程化,开放网页和跨应用仍是下一阶段主战场”。


三、为什么是 Harness?因为 Computer-Use Agent 不是模型单点问题

在 OSWorld 的语境里,一个 Computer-Use Agent 要完成真实任务,至少需要同时解决:

  • 看懂屏幕:截图、分辨率、图标、文字、控件、布局;
  • 知道点哪里:GUI grounding、坐标映射、元素定位;
  • 知道先做什么:长程规划、子目标分解、跨应用状态管理;
  • 真的能操作:鼠标、键盘、浏览器、Office、系统 API;
  • 做错能发现:状态验证、断言、异常检测;
  • 做错能回来:回滚、重试、检查点、替代路径;
  • 跑得够稳:上下文压缩、记忆、成本控制、并发、沙箱。

这些没有一个是基础模型单独能保证的。

这也是为什么 OSWorld 把 Agentic framework 单独列为一类。一个通用模型可以“会计算机操作”,但要把成功率从 60% 推到 90%,靠的是模型外面的那一整套 Harness。

所谓 Harness,可以理解成:

把模型装进真实计算机环境里的运行时、工具链、状态机、验证器和数据闭环。

模型是发动机,Harness 是底盘、传动、刹车、仪表盘和维修体系。没有 Harness,发动机再强,也上不了复杂路况。


四、实在智能的八年 Harness:从 RPA 到 Computer-Use Agent

实在智能并不是 2026 年才突然出现在榜单上的团队。如果从 2018 年算起,到 2026 年正好八年。这八年,恰好是一条从 RPA 到超自动化,再到 Computer-Use Agent 的 Harness 演进路径。

1. 2018—2020:RPA 时代,Harness 的雏形

RPA 本质上就是最早的“计算机使用自动化”。它要解决的是:

  • UI 元素选择器;
  • 流程录制与回放;
  • 异常捕获与重试;
  • 权限、审计、日志;
  • 跨系统流程编排。

这些东西后来几乎原封不动地进入了 Agent Harness。区别只是:RPA 靠人工画流程,Agent 靠模型动态规划。

2. 2021—2022:超自动化与 IDP,感知和连接器补全

这一阶段,实在智能在 RPA 之上叠加了 IDP、低代码、连接器和权限体系。对应到 Agent Harness,就是:

  • 文档理解;
  • 结构化信息抽取;
  • 业务系统连接;
  • 企业级权限与审计;
  • 人机协同兜底。

Computer-Use Agent 要落地企业,不可能只靠截图点击。它必须能读单据、连系统、走权限、留痕迹。这些能力不是 2024 年才长出来的,而是超自动化时代打的地基。

3. 2023:LLM 接入,自然语言成为新流程入口

大模型进来后,Harness 多了一层“规划器”。用户不再需要画流程图,而是用自然语言描述目标。Agent 负责拆解、调用工具、执行、验证。

但这一阶段很快暴露问题:纯文本 LLM 看不懂屏幕,纯 API 工具覆盖不了长尾软件。于是进入多模态 GUI 阶段。

4. 2024:多模态 GUI Agent,感知层重构

截图理解、Set-of-Marks、坐标点击、视觉 grounding、OCR、a11y tree、DOM 混合观测,成为 Harness 的新核心。

OSWorld 的分析也指出:

  • 更高截图分辨率通常带来更好表现;
  • 更长的文本轨迹历史比纯截图历史更有效;
  • 当前 VLM Agent 对 UI 布局和噪声仍不够鲁棒;
  • 不同 OS 之间的 Agent 表现强相关,方法论可迁移。

这些结论,基本就是 Harness 工程要逐条啃的问题。

5. 2025:OSWorld-Verified,评测工程成为一部分

2025 年 7 月,OSWorld 升级为 OSWorld-Verified:修复社区反馈样例,支持 AWS,把评测时间压到 1 小时内,并更新基准结果。2026 年 6 月,OSWorld 2.0 发布。

对 Agent 团队来说,这意味着 Harness 不仅要能执行任务,还要能适配统一评测协议、复现初始状态、跑执行式评估、输出可分析轨迹。评测不再是最后一步,而是工程体系的一部分。

6. 2026:实在Agent 90.2%,Harness 成熟度体现

最终在 OSWorld-Verified 361 任务上,实在Agent 交出 325.59/361,成功率 90.2%,Runs=1,Max Steps=100,登顶榜单。

这不是某个模型的单点胜利,而是一套跑了八年的 Harness 工程体系,在多模态规划、动作执行、状态验证、异常恢复、跨应用编排上同时到位。


五、一套成熟 Harness 的八个关键层

如果把实在Agent 背后的 Harness 拆开,大致可以分成八层:

1. 环境编排层

VM/容器池、快照、回滚、无头运行、并行评测、AWS 支持、初始状态注入。OSWorld 任务要求从中间状态启动,还要执行评估脚本,环境层必须稳。

2. 观测总线层

截图 + a11y tree + DOM + OCR + UI 解析。高分辨率截图、Set-of-Marks、元素候选框、文本历史轨迹。观测不是越多越好,而是要在成本、延迟、准确率之间做平衡。

3. 规划与分解层

把“帮我整理这份表格并发邮件”拆成:打开文件、读取数据、计算、保存、打开邮件、填写、附件、发送、验证。跨应用任务尤其依赖任务图和状态记忆。

4. 动作运行时层

鼠标、键盘、剪贴板、Shell、PowerShell、AppleScript、CDP、LibreOffice UNO、系统 API。纯点击不够,代码动作作为补充,才能覆盖长尾。

5. 技能库层

Chrome、GIMP、LibreOffice、Thunderbird、VLC、VS Code 的应用级技能。比如 Calc 的公式、Writer 的样式、Impress 的幻灯片对象、VS Code 的命令面板。技能库让 Agent 不必每次从零探索。

6. 验证器层

每步自检、状态断言、文件校验、UI 状态校验、执行式评估内化。做没做完,不靠模型“感觉”,靠可验证信号。

7. 恢复器层

错误分类、重试、回滚、检查点、替代路径。OSWorld 任务往往几十步,一步错不一定失败,关键是有没有恢复能力。

8. 数据与评测飞轮

真实轨迹、失败回放、人工修正、合成任务、评测驱动迭代。榜单成绩不是终点,而是数据飞轮的输入。

这八层里,任何一层短板都会限制最终成功率。90.2% 的意义,是这套体系已经能稳定覆盖大多数确定性任务,并把开放网页和跨应用的失败率压到可接受范围。


六、和纯模型路线相比,Agentic framework 赢在哪?

OSWorld 榜单把模型类型分得很清楚:

  • General model:通用模型,计算机使用只是能力之一;
  • Specialized model:专门训练成 Computer-Use Agent 的模型;
  • Agentic framework:把一个或多个模型组织成结构化工作流。

实在Agent 属于第三类。它的优势不在“模型参数最大”,而在:

  • 可插拔模型:规划、grounding、执行、验证可以用不同模型;
  • 工具增强:纯视觉点不动的地方,用 CDP、UNO、Shell 补;
  • 状态管理:长任务不丢上下文;
  • 错误恢复:失败可回滚、可重试、可换路径;
  • 评测对齐:直接面向 OSWorld 执行式评估优化。

这也解释了一个现象:通用模型最强 86.0%,专用模型最强 80.4%,而 Agentic framework 最强 90.2%。在 Computer-Use Agent 当前阶段,Harness 的边际收益仍然大于单纯换模型。


七、落地:企业要的不是榜单,是稳定可审计的“数字员工”

Computer-Use Agent 的落地场景,和 OSWorld 的任务域高度重合:

  • 财务:LibreOffice Calc 对账、Writer 生成报告、邮件发送;
  • 电商:Chrome 后台操作、订单处理、多系统录入;
  • 政务:跨应用表单填写、文件流转;
  • IT:VS Code 配置、系统设置、日志检查;
  • 办公:Thunderbird 邮件、VLC 媒体处理、GIMP 图片批处理。

但企业真正关心的不是 90.2% 这个数字,而是:

  • 成功率高不高;
  • 失败可不可见;
  • 每一步能不能审计;
  • 出错能不能回滚;
  • 权限能不能控制;
  • 模型能不能私有化替换;
  • 成本能不能算清楚。

这正是 Harness 工程体系的价值。它把“模型能力”转化为“可交付流程”。实在智能过去八年做 RPA 和超自动化,积累的流程引擎、权限审计、人机协同、连接器,恰好是 Computer-Use Agent 落地最缺的企业级底座。


八、冷静看:90.2% 之后,下一站是什么?

90.2% 是一个里程碑,但不是终局。

从分应用数据看,Chrome 78.1% 和 Multi-apps 84.7% 仍是明显短板。真实网页的动态性、登录态、验证码、反自动化、跨应用上下文传递,会继续考验 Harness。

同时,OSWorld 2.0 已经在 2026 年 6 月发布。下一代评测只会更开放、更长程、更接近真实工作流。当前 Verified 榜单的 361 任务口径,仍是重要可比基线,但不会永远代表上限。

对实在智能和实在Agent 来说,登顶意味着三件事:

  1. 八年 RPA/超自动化 Harness 积累,在 Computer-Use Agent 时代被验证;
  2. Agentic framework 路线,在当前阶段跑赢了纯模型路线;
  3. 企业级落地,有了一个可参考的成功率坐标。

Computer-Use Agent 的竞争,正在从“模型能不能看懂屏幕”,进入“系统能不能稳定完成工作”的阶段。

90.2% 的背后,不是一次模型升级,而是一套跑了八年的 Harness 工程体系,终于撑起了 Computer-Use Agent 的落地。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。