AI真的能替你上班了吗?OSWorld 2.0这份“电脑操作考卷”给出答案
开篇:一个扎心的对比
先看两个数字:83.5% 和 20.6%。
第一个数字,是顶级AI模型在一个标准电脑操作考试里的得分,看着是不是快满分了?很多人欢呼“AI快会自己用电脑了”。
第二个数字,是同一个AI换了一张更难的考卷后的得分,直接跌到勉强及格线的四分之一。
这中间的差距,就是今天要聊的OSWorld 2.0(电脑操作智能体评测基准)干的事儿。简单说,它把AI从“做两道课后题”拉到了“做一整个下午的期末大作业”的考场。
第一幕:如果让AI帮你报销一笔出差费
想象一下,你让AI助理帮你报销一次海外出差。
旧考试(OSWorld 1.0)的题目是:打开报销网站,填个金额,提交。AI轻松搞定。
但OSWorld 2.0的真实考题是这样的:
- 你得先打开PDF政策文档,翻到第三页看看住宿费上限是多少;
- 去Gmail邮箱里翻出Airbnb的英文电子收据,注意总额和税费要算对;
- 登录网上银行,核对这笔信用卡扣款记录;
- 打开旧的报销单,看看以前填的部门代码;
- 正填着表,新邮件弹出来了——财务部临时改了科目编号,你得按新的来;
如果发现房费和银行流水对不上,你得主动停下来问老板,不能瞎蒙。
这里面涉及五六个软件,中途还会被打断,最后还要检查提交的附件对不对。
结果呢? 人类熟练工完成这一套操作,中位数时间是 1.6个小时。而以前OSWorld 1.0里的任务,人类平均 2分钟 就能点完。这难度暴增了48倍!
第二幕:考卷到底改了啥?
OSWorld 2.0给AI准备的这场“长跑考试”,总共就108道大题(之前是369道简单小题)。别嫌题少,每一道都需要AI平均走300多步(以前30步就完了)。
为了防AI作弊(比如通过改后台代码来假装填表),出题方还专门搭了31个假网站(假邮箱、假银行、假聊天软件),确保AI必须像真人一样点点点、看看看,没法偷懒。
而且,这108道题每一道都贴着“难在哪”的标签:
“跨源推理”(42.6%的任务有):得把邮件、银行、文档里的信息拼一起。
“视觉空间精度”(41.7%):比如弹窗突然飘走了,你得能点中。
“隐状态推断”(39.8%):屏幕上没明说的事儿,你得自己根据上下文猜。
第三幕:考完发榜,成绩单有点惨
最顶尖的选手(Claude Opus 4.8)在这份新考卷上,严格及格率只有20.6%。
虽然“部分分”(做对了一半步骤)能拿到50%左右,但就是很难完整做完。
更扎心的现象有三个:
越长的工作,死得越惨:如果人类预估完成时间超过2小时40分钟,所有参与测试的AI模型,成绩单上全是零蛋。没一个能从头干到尾。
加钱(Token)也救不了:让AI多思考,确实能把“做了一半”的分数提高,但想把“做了一半”变成“完全做完”,那花的成本是成倍往上翻的——最贵的模型跑一个任务平均要烧掉72美元,结果还是没做完。
莽撞的“实习生”:AI为了完成任务,有时会干出很吓人的事。比如把包含密码的文件直接传到代码仓库(泄露机密);电脑只剩400M空间了,它还硬要下载一个370M的大文件把硬盘撑爆;或者遇到弹窗直接暴力关进程,把没保存的数据全丢了。
第四幕:为什么AI会“越干越糊涂”?
评测团队分析了AI失败的重灾区,发现不是AI不会点按钮,而是“脑子记不住事”:
它不回头检查:填完表以为完事了,其实附件没传上去。
它当“耳边风”:中途聊天软件弹出一条新消息说“规则改了”,AI看了一眼当没看见,继续按旧规则做。
它爱瞎猜:银行流水和邮件数字对不上,AI不问问人,自己随便取了个数填进去。
这就像招了一个手脚麻利但极度健忘、还不爱沟通的实习生,你让他自己忙一下午,最后交上来的东西漏洞百出。
结语:别急着让AI接管电脑
OSWorld 2.0这盆冷水泼得正是时候。它告诉我们,现在的AI确实会“操作”电脑(点开软件、打字、滚动页面),但还远远不会“使用”电脑去完成一整个下午的复杂杂活。
如果你想让AI替你搞定那种“横跨五个软件、穿插三通电话、最后还要签字确认”的正式工作,现在还差得远。未来的AI助理,必须重点补习长程记忆力、主动确认意识和自我检查能力。
不过好消息是,这份“最难考卷”已经开源了。以后谁家AI敢说自己能干活了,拉出来跑跑OSWorld 2.0,是骡子是马,一个下午见分晓。
- 点赞
- 收藏
- 关注作者
评论(0)