90.2%登顶背后:一套跑了八年的Harness工程体系,如何撑起Computer-Use Agent的落地?
数据来源:OSWorld-Verified 官方榜单,截至 2026/9/10 更新。
榜单第一:实在Agent / 实在智能 / Type: Agentic framework / Max Steps: 100 / Runs: 1 / 成功率 90.2%。

一、OSWorld 榜单更新:实在Agent 以 90.2% 登顶
在 Computer-Use Agent 这个赛道上,OSWorld 一直被视为最接近“真实电脑操作”的试金石。
它不是那种只跑网页 DOM、只点固定按钮的玩具 benchmark。OSWorld 提供的是真实操作系统环境,支持 Ubuntu、Windows、macOS,任务覆盖 Chrome、GIMP、LibreOffice、Thunderbird、VLC、VS Code,以及跨应用工作流和 OS 级文件操作。官方基准包含 369 个真实世界计算机任务,其中 8 个 Google Drive 任务因网络依赖可官方排除,因此 361 任务口径被广泛接受。
更关键的是,OSWorld 采用执行式评估:不是看 Agent 说了什么,而是看它最后有没有把文件改对、把邮件发对、把表格算对、把系统状态改对。每个任务都有初始状态配置和自定义评估脚本,强调可复现、可验证。
在最新 OSWorld-Verified 榜单中,排名第一的是:
| 排名 | 模型/Agent | 团队 | 类型 | 成功率 | 成功/总数 |
|---|---|---|---|---|---|
| 1* | 实在Agent | 实在智能 | Agentic framework | 90.2% | 325.59 / 361 |
| 2 | claude-fable-5[1m] | Anthropic | General model | 86.0% | 307.73 / 358 |
| 3 | Pointer Agent w/ Opus 4.7 | Pointer | Agentic framework | 83.6% | 301.94 / 361 |
| 4 | claude-opus-5[1m] | Anthropic | General model | 83.4% | 300.2 / 360 |
| 5 | Coasty CUA v1 | Coasty Team | General model | 82.8% | 297.29 / 359 |
| 6 | Pointer Agent w/ Sonnet 4.6 | Pointer | Agentic framework | 81.5% | 293.22 / 360 |
| 7 | Muse Spark 1.1 | Meta Superintelligence Labs | General model | 80.7% | 291.22 / 361 |
| 8 | Holo3-35B-A3B | H Company | Specialized model | 80.4±2.2% | 296.41 / 359 |
| 9 | OpenAPA w/ gemini-3.1-pro | Laiye | Agentic framework | 78.3% | 282.8 / 361 |
| 10 | VLAA-GUI w/ Opus 4.5 | UCSC VLAA Lab | Agentic framework | 76.3% | 272.24 / 357 |
几个信息值得注意:
- 90.2% 是单次运行结果。榜单里实在Agent 的 Runs 是 1,没有带多 rollout 投票标记。也就是说,它不是靠 N 次采样选最优刷出来的。
- 它是 Agentic framework,不是单纯模型。榜单把 General model、Specialized model、Agentic framework 分开。实在Agent 属于第三类:把模型、工具、环境、验证、恢复组织成结构化工作流。
- 它领先通用模型最强成绩 4.2 个百分点,领先其他 Agentic framework 也有一截。这说明当前 Computer-Use Agent 的竞争,已经不只是“模型谁更聪明”,而是“Harness 谁更稳”。
二、拆开 90.2%:确定性桌面几乎打满,Chrome 和跨应用仍是硬骨头
先看实在Agent 在 OSWorld-Verified 361 任务上的分应用表现:
| 应用域 | 成功/总数 | 成功率 |
|---|---|---|
| OS | 24.0 / 24 | 100% |
| VLC | 16.89 / 17 | 99.4% |
| LibreOffice Calc | 46.0 / 47 | 97.9% |
| LibreOffice Writer | 22.0 / 23 | 95.7% |
| VS Code | 22.0 / 23 | 95.7% |
| GIMP | 24.0 / 26 | 92.3% |
| LibreOffice Impress | 42.96 / 47 | 91.4% |
| Thunderbird | 13.0 / 15 | 86.7% |
| Multi-apps | 78.81 / 93 | 84.7% |
| Chrome | 35.93 / 46 | 78.1% |
| 总计 | 325.59 / 361 | 90.2% |
这张表很说明问题。
一方面,在确定性较强的桌面应用里,实在Agent 几乎打满:OS 100%,VLC 99.4%,Calc 97.9%,Writer 和 VS Code 都是 95.7%。这些任务通常有明确控件、稳定 UI、清晰状态,适合 Harness 做动作抽象、状态断言和错误恢复。
另一方面,真正拉低均分的是 Chrome 和 Multi-apps。Chrome 只有 78.1%,跨应用工作流 84.7%。这很符合真实落地体感:网页动态渲染、登录态、弹窗、验证码、DOM 变化、反自动化策略,远比本地桌面应用难;跨应用则要求 Agent 在多个窗口、多个数据源、多个状态机之间传递上下文,任何一步丢失都可能导致最终评估失败。
所以 90.2% 不是“电脑操作已经被解决”,而是“确定性桌面操作已经工程化,开放网页和跨应用仍是下一阶段主战场”。
三、为什么是 Harness?因为 Computer-Use Agent 不是模型单点问题
在 OSWorld 的语境里,一个 Computer-Use Agent 要完成真实任务,至少需要同时解决:
- 看懂屏幕:截图、分辨率、图标、文字、控件、布局;
- 知道点哪里:GUI grounding、坐标映射、元素定位;
- 知道先做什么:长程规划、子目标分解、跨应用状态管理;
- 真的能操作:鼠标、键盘、浏览器、Office、系统 API;
- 做错能发现:状态验证、断言、异常检测;
- 做错能回来:回滚、重试、检查点、替代路径;
- 跑得够稳:上下文压缩、记忆、成本控制、并发、沙箱。
这些没有一个是基础模型单独能保证的。
这也是为什么 OSWorld 把 Agentic framework 单独列为一类。一个通用模型可以“会计算机操作”,但要把成功率从 60% 推到 90%,靠的是模型外面的那一整套 Harness。
所谓 Harness,可以理解成:
把模型装进真实计算机环境里的运行时、工具链、状态机、验证器和数据闭环。
模型是发动机,Harness 是底盘、传动、刹车、仪表盘和维修体系。没有 Harness,发动机再强,也上不了复杂路况。
四、实在智能的八年 Harness:从 RPA 到 Computer-Use Agent
实在智能并不是 2026 年才突然出现在榜单上的团队。如果从 2018 年算起,到 2026 年正好八年。这八年,恰好是一条从 RPA 到超自动化,再到 Computer-Use Agent 的 Harness 演进路径。
1. 2018—2020:RPA 时代,Harness 的雏形
RPA 本质上就是最早的“计算机使用自动化”。它要解决的是:
- UI 元素选择器;
- 流程录制与回放;
- 异常捕获与重试;
- 权限、审计、日志;
- 跨系统流程编排。
这些东西后来几乎原封不动地进入了 Agent Harness。区别只是:RPA 靠人工画流程,Agent 靠模型动态规划。
2. 2021—2022:超自动化与 IDP,感知和连接器补全
这一阶段,实在智能在 RPA 之上叠加了 IDP、低代码、连接器和权限体系。对应到 Agent Harness,就是:
- 文档理解;
- 结构化信息抽取;
- 业务系统连接;
- 企业级权限与审计;
- 人机协同兜底。
Computer-Use Agent 要落地企业,不可能只靠截图点击。它必须能读单据、连系统、走权限、留痕迹。这些能力不是 2024 年才长出来的,而是超自动化时代打的地基。
3. 2023:LLM 接入,自然语言成为新流程入口
大模型进来后,Harness 多了一层“规划器”。用户不再需要画流程图,而是用自然语言描述目标。Agent 负责拆解、调用工具、执行、验证。
但这一阶段很快暴露问题:纯文本 LLM 看不懂屏幕,纯 API 工具覆盖不了长尾软件。于是进入多模态 GUI 阶段。
4. 2024:多模态 GUI Agent,感知层重构
截图理解、Set-of-Marks、坐标点击、视觉 grounding、OCR、a11y tree、DOM 混合观测,成为 Harness 的新核心。
OSWorld 的分析也指出:
- 更高截图分辨率通常带来更好表现;
- 更长的文本轨迹历史比纯截图历史更有效;
- 当前 VLM Agent 对 UI 布局和噪声仍不够鲁棒;
- 不同 OS 之间的 Agent 表现强相关,方法论可迁移。
这些结论,基本就是 Harness 工程要逐条啃的问题。
5. 2025:OSWorld-Verified,评测工程成为一部分
2025 年 7 月,OSWorld 升级为 OSWorld-Verified:修复社区反馈样例,支持 AWS,把评测时间压到 1 小时内,并更新基准结果。2026 年 6 月,OSWorld 2.0 发布。
对 Agent 团队来说,这意味着 Harness 不仅要能执行任务,还要能适配统一评测协议、复现初始状态、跑执行式评估、输出可分析轨迹。评测不再是最后一步,而是工程体系的一部分。
6. 2026:实在Agent 90.2%,Harness 成熟度体现
最终在 OSWorld-Verified 361 任务上,实在Agent 交出 325.59/361,成功率 90.2%,Runs=1,Max Steps=100,登顶榜单。
这不是某个模型的单点胜利,而是一套跑了八年的 Harness 工程体系,在多模态规划、动作执行、状态验证、异常恢复、跨应用编排上同时到位。
五、一套成熟 Harness 的八个关键层
如果把实在Agent 背后的 Harness 拆开,大致可以分成八层:
1. 环境编排层
VM/容器池、快照、回滚、无头运行、并行评测、AWS 支持、初始状态注入。OSWorld 任务要求从中间状态启动,还要执行评估脚本,环境层必须稳。
2. 观测总线层
截图 + a11y tree + DOM + OCR + UI 解析。高分辨率截图、Set-of-Marks、元素候选框、文本历史轨迹。观测不是越多越好,而是要在成本、延迟、准确率之间做平衡。
3. 规划与分解层
把“帮我整理这份表格并发邮件”拆成:打开文件、读取数据、计算、保存、打开邮件、填写、附件、发送、验证。跨应用任务尤其依赖任务图和状态记忆。
4. 动作运行时层
鼠标、键盘、剪贴板、Shell、PowerShell、AppleScript、CDP、LibreOffice UNO、系统 API。纯点击不够,代码动作作为补充,才能覆盖长尾。
5. 技能库层
Chrome、GIMP、LibreOffice、Thunderbird、VLC、VS Code 的应用级技能。比如 Calc 的公式、Writer 的样式、Impress 的幻灯片对象、VS Code 的命令面板。技能库让 Agent 不必每次从零探索。
6. 验证器层
每步自检、状态断言、文件校验、UI 状态校验、执行式评估内化。做没做完,不靠模型“感觉”,靠可验证信号。
7. 恢复器层
错误分类、重试、回滚、检查点、替代路径。OSWorld 任务往往几十步,一步错不一定失败,关键是有没有恢复能力。
8. 数据与评测飞轮
真实轨迹、失败回放、人工修正、合成任务、评测驱动迭代。榜单成绩不是终点,而是数据飞轮的输入。
这八层里,任何一层短板都会限制最终成功率。90.2% 的意义,是这套体系已经能稳定覆盖大多数确定性任务,并把开放网页和跨应用的失败率压到可接受范围。
六、和纯模型路线相比,Agentic framework 赢在哪?
OSWorld 榜单把模型类型分得很清楚:
- General model:通用模型,计算机使用只是能力之一;
- Specialized model:专门训练成 Computer-Use Agent 的模型;
- Agentic framework:把一个或多个模型组织成结构化工作流。
实在Agent 属于第三类。它的优势不在“模型参数最大”,而在:
- 可插拔模型:规划、grounding、执行、验证可以用不同模型;
- 工具增强:纯视觉点不动的地方,用 CDP、UNO、Shell 补;
- 状态管理:长任务不丢上下文;
- 错误恢复:失败可回滚、可重试、可换路径;
- 评测对齐:直接面向 OSWorld 执行式评估优化。
这也解释了一个现象:通用模型最强 86.0%,专用模型最强 80.4%,而 Agentic framework 最强 90.2%。在 Computer-Use Agent 当前阶段,Harness 的边际收益仍然大于单纯换模型。
七、落地:企业要的不是榜单,是稳定可审计的“数字员工”
Computer-Use Agent 的落地场景,和 OSWorld 的任务域高度重合:
- 财务:LibreOffice Calc 对账、Writer 生成报告、邮件发送;
- 电商:Chrome 后台操作、订单处理、多系统录入;
- 政务:跨应用表单填写、文件流转;
- IT:VS Code 配置、系统设置、日志检查;
- 办公:Thunderbird 邮件、VLC 媒体处理、GIMP 图片批处理。
但企业真正关心的不是 90.2% 这个数字,而是:
- 成功率高不高;
- 失败可不可见;
- 每一步能不能审计;
- 出错能不能回滚;
- 权限能不能控制;
- 模型能不能私有化替换;
- 成本能不能算清楚。
这正是 Harness 工程体系的价值。它把“模型能力”转化为“可交付流程”。实在智能过去八年做 RPA 和超自动化,积累的流程引擎、权限审计、人机协同、连接器,恰好是 Computer-Use Agent 落地最缺的企业级底座。
八、冷静看:90.2% 之后,下一站是什么?
90.2% 是一个里程碑,但不是终局。
从分应用数据看,Chrome 78.1% 和 Multi-apps 84.7% 仍是明显短板。真实网页的动态性、登录态、验证码、反自动化、跨应用上下文传递,会继续考验 Harness。
同时,OSWorld 2.0 已经在 2026 年 6 月发布。下一代评测只会更开放、更长程、更接近真实工作流。当前 Verified 榜单的 361 任务口径,仍是重要可比基线,但不会永远代表上限。
对实在智能和实在Agent 来说,登顶意味着三件事:
- 八年 RPA/超自动化 Harness 积累,在 Computer-Use Agent 时代被验证;
- Agentic framework 路线,在当前阶段跑赢了纯模型路线;
- 企业级落地,有了一个可参考的成功率坐标。
Computer-Use Agent 的竞争,正在从“模型能不能看懂屏幕”,进入“系统能不能稳定完成工作”的阶段。
90.2% 的背后,不是一次模型升级,而是一套跑了八年的 Harness 工程体系,终于撑起了 Computer-Use Agent 的落地。
- 点赞
- 收藏
- 关注作者
评论(0)