AI智能体

实在Agent 90.2%打破OSWorld纪录,AI智能体进入接管屏幕新阶段

发布时间:2026年07月29日 11:00:00

中国企业级AI团队实在智能研发的实在Agent以90.2%任务成功率打破OSWorld公开纪录,斩获总榜与Agentic Framework分榜双冠军,标志着智能体从演示级跨入超高可靠性阶段。


评测突破

全球AI智能体权威评测基准OSWorld迎来历史性一刻:由中国企业级AI团队实在智能研发的"实在Agent",以**90.2%**的任务成功率打破榜单纪录,一举斩获OSWorld总榜与Agentic Framework分榜"双冠军"。

OSWorld评测

OSWorld是当前AI领域公认含金量极高的"计算机驾驶执照考试":

  • 由香港大学、卡内基梅隆大学(CMU)、滑铁卢大学等机构发表于NeurIPS
  • 核心定位:让AI在真实操作系统中,完全模拟人类行为完成跨应用复杂任务
  • 评测范围:完整的真实桌面沙盒环境
  • 涵盖场景:办公自动化(LibreOffice)、代码开发(VS Code)、图像处理(GIMP)、底层系统运维
  • 任务数量:361个实战课题,由机器程序闭环客观判定

进化曲线

OSWorld的分数进化曲线反映了AI智能体的快速发展:

  • 2024年基准发布:最顶级智能体得分仅为12.2%
  • 2025年底:首次以72.6%突破人类基线(72.36%)
  • 2026年7月:实在Agent跑出90.2%,跨入超高可靠性新阶段

硬核实力

在OSWorld满分361分的硬核课题中,实在Agent最终拿下325.59分。在三大"地狱级"场景中表现突出:

跨应用长链路协同(78.81/93分)

任务量最大、最易产生累积错误的维度,智能体需要模拟真实办公中最繁琐的跨系统流程。实在Agent领先第二名近10个百分点。

非标GUI界面理解与微操(24.0/26分,成功率92.3%)

专业图像软件GIMP充满浮动面板、非标准工具栏和像素级微操。Agent攻下24个任务,证明了其对复杂非标UI界面的深厚解析积累。

底层系统运维(24.0/24分,100%满分)

在修改文件权限、进程管理、命令行等"错一步全盘皆输"的高危任务中实现零失误,反映了底层执行闭环的极高确定性。

技术范式转移

智能体技术正在发生的范式转移:

Agent = Model + Harness

  • Model是发动机,提供通用智力和原始动力
  • **Harness(工程套件与运行架构)**是方向盘、变速箱与安全系统

Stanford、清华等机构的研究证明,在相同底座模型前提下,单靠Harness工程架构的优化,在OSWorld等基准上的性能提升可高达6%-17%

实在智能的优势

第一性原理的动作抉择

API能跑通就跑API,跑不通就用GUI——像人类员工一样看屏幕、点击鼠标,把数据拿回来把事办成。

海量真实业务场景

已累计服务超6000家企业客户,通过真实业务场景"喂养"智能体,积累了丰富的企业级自动化经验。

可靠性保障

提供"操作撤销与回滚"能力,将可靠性推向99.99%。

行业意义

90.2%的成绩标志着:

  • 智能体从"不可用、演示级"正式跨入"超高可靠性"阶段
  • 中国团队在Computer-Use Agent赛道上取得全球领先
  • 企业级自动化经验正在转化为技术优势
  • AI智能体商业化进程加速