ScreenSpot-Pro全球前二背后:实在智能GUI定位技术与企业级落地路径

举报
yd_293602503 发表于 2026/09/10 15:40:26 2026/09/10
【摘要】 ScreenSpot-Pro最新榜单数据显示,实在智能以优异成绩位列全球前二,仅次于Anthropic Claude Opus 4.8,领先于OpenAI GPT-5.4、Google Gemini 3.1 Pro等国际一线模型。对于企业级AI智能体赛道而言,这一成绩的意义远超单纯的排名本身——它直接回答了企业最关切的命题:AI能否在真实的复杂软件界面中,像人一样精准理解和操作。一、从榜单到...

ScreenSpot-Pro最新榜单数据显示,实在智能以优异成绩位列全球前二,仅次于Anthropic Claude Opus 4.8,领先于OpenAI GPT-5.4、Google Gemini 3.1 Pro等国际一线模型。

对于企业级AI智能体赛道而言,这一成绩的意义远超单纯的排名本身——它直接回答了企业最关切的命题:AI能否在真实的复杂软件界面中,像人一样精准理解和操作。

1.png


一、从榜单到技术底座:ScreenSpot-Pro为何是GUI能力的硬标尺

GUI Grounding:智能体从“理解”到“执行”的最后一道门槛

GUI Grounding(图形界面定位)是智能体执行能力的根基:给定一条自然语言指令和一张完整的软件界面截图,模型需要精准定位目标UI元素的位置。ScreenSpot-Pro基准测试由1,581条专家标注指令构成,覆盖23款专业应用、5大行业领域、3类操作系统,测试界面均为真实高分辨率截图(最高达6016×3384),目标元素通常仅占图像面积的0.1%以下。基准测试论文指出,在ScreenSpot-Pro发布之初,最好的模型准确率仅为18.9%。

其评测逻辑的核心挑战可归纳为三个维度:

  • 分辨率与像素密度:专业软件界面元素密集,在超高分辨率显示器上,传统模型的特征提取能力急剧下降。
  • 界面复杂度:测试覆盖CAD工程图纸、开发IDE、创意设计工具、科学计算软件等,控件层级深、布局非标准化。
  • 跨平台泛化:同一模型需在Windows、macOS、Linux三套操作系统上均保持定位精度。

这也是ScreenSpot-Pro区别于早期GUI测试基准(如ScreenSpot)的关键所在:后者多使用简化网页截图和消费级应用场景,而前者聚焦专业软件的真实工作流,更接近企业日常业务环境的实际复杂度。

为什么这个榜单对企业级AI如此关键? 

企业智能体的核心痛点在于“理解易、操作难”——大模型能理解业务意图,却无法在老旧ERP、MES、自研系统中完成精准操作。ScreenSpot-Pro所测量的正是填补这一断层的底层能力。

能够在该榜单上位列前二,意味着模型具备在真实企业环境中“看得准、点得对”的基础执行力。

二、实在智能GUI定位能力的核心技术解析

实在智能在ScreenSpot-Pro上的领先表现,背后是完整的“感知—决策—执行—迭代”技术闭环。

架构层:三位一体技术底座

实在Agent的GUI定位能力构建于三层架构之上:

  • TARS垂直大模型(认知大脑) :基于千亿级行业优质数据训练,针对1,000余种企业软件和10,000余个常用场景做了专项预训练,具备界面语义解析与任务规划能力。
  • ISSUT智能屏幕语义理解(视觉引擎) :不依赖系统API或后台DOM结构,直接通过屏幕截图实时捕捉界面状态,融合计算机视觉与深度学习技术,实现从物理像素到逻辑意义的映射,识别按钮、输入框、下拉菜单、表格区域等可交互元素。
  • RPA自动化执行(执行手脚) :在精准定位目标元素后,模拟鼠标点击、键盘输入完成操作。

这一架构的核心突破在于:传统RPA依赖控件句柄和静态坐标,在动态渲染页面、无标准控件的客户端程序中拾取成功率不足60%;而实在Agent通过视觉与语义融合,实现了不依赖API的跨终端自动化操作能力。

模型层:专项微调与动态环境适应

  • 垂直领域微调:TARS大模型对界面元素进行业务语义级理解,而非仅做视觉层面识别。在面对多个视觉特征相似的控件时,能基于业务上下文选择正确目标。
  • 动态环境适应:不同于传统RPA依赖固定坐标,TARS能够根据屏幕画面的变化实时调整策略,显著提升自动化稳定性。
  • 高分辨率鲁棒性:即使在高分辨率或非标准DPI的屏幕环境下,识别准确率仍保持行业领先水平。

工程化层:五层闭环执行链路

实在Agent构建了“感知—融合—理解—执行—反馈”五层闭环技术架构,以多模态视觉融合拾取为核心底座。实测数据显示,在自研及国产系统中拾取准确率超过99%,长链路任务成功率96.2%。这一工程化能力,使得ScreenSpot-Pro榜单上测得的定位精度能够在实际业务场景中稳定复现。

三、行业落地能力:从实验室指标到产线实效

制造业:跨系统全链路自动化

以赛力斯为例,其财务部门部署实在Agent后,覆盖收款上账、银行流水对账、发票查验、费用报销审核、报表生成等90%以上高频场景。财务人员在飞书发一条指令,智能体自动登录NC系统获取流水账单,完成与DMS票 据比对,流程自动化率达95%,每月80小时工作缩短至10小时,处理准确率100%,累计运行超15,000小时。

三花控股的实践则验证了“全员开发者”模式的可行性:769名业务员工完成数字化认证,累计落地340余个自动化场景,累计节省超20万工时,平均每天一个自动化流程在生产一线投入使用,50%—60%的自动化需求由业务方自行开发完成,不再依赖IT排期。

工业与供应链:零漏洞级风控

上海中远海运重工年修理改装船舶超350艘,实在Agent打通EP、CIIP、SAP三个内部系统,从物料询价到合同签订全流程自动化,合同审核环节累计处理近600份,超期条款识别准确率97%、币种对比94%、自动续签条款识别99%,项目以零安全漏洞标准通过验收。

中小企业与电商:轻量化智能升级

恒东电器在电商运营中部署了自动开票、库存智能预警、销售数据归集等五大场景。整套方案无需改造现有业务系统,依托无侵入式跨系统协同能力,大幅降低中小企业的数字化改造门槛。

裕同科技在50余个业务环节实现自动化突破,业务平均增效48%,年节约人工耗时近20,000小时,该模式已从深圳总部复制到合肥、许昌、越南、九江等生产基地。

国家级认可与规模化验证

实在Agent入选工信部《2025年人工智能应用典型案例》,浙江省仅15个项目上榜,产品应用方向仅3个。公司获评国家 级专精特新“小巨人”企业,累计服务超5,000家行业头部客户,世界500强、央国企、上市公司占比超90%。

结语

ScreenSpot-Pro的成绩本质上是对AI“看屏幕办事”能力的一次极限压力测试。

实在智能在该榜单上的前二表现,验证了一条清晰的技术路径:以TARS大模型为认知核心、ISSUT屏幕语义理解为视觉引擎、RPA为执行末端的全栈架构,能够在高分辨率、跨平台、非标准化的专业软件环境中维持高精度的定位能力。

这种能力从实验室指标到产线实效的转化,已在制造业、电商、供应链等多个行业中获得了可量化的验证。随着企业级智能体从概念验证进入规模化部署阶段,屏幕理解能力将日益成为区分智能体产品竞争力的核心分水岭。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0)

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。