实在Agent 90.2%打破OSWorld纪录,AI智能体进入接管屏幕新阶段
发布时间:2026年07月29日 11:00:00中国企业级AI团队实在智能研发的实在Agent以90.2%任务成功率打破OSWorld公开纪录,斩获总榜与Agentic Framework分榜双冠军,标志着智能体从演示级跨入超高可靠性阶段。
评测突破
全球AI智能体权威评测基准OSWorld迎来历史性一刻:由中国企业级AI团队实在智能研发的"实在Agent",以**90.2%**的任务成功率打破榜单纪录,一举斩获OSWorld总榜与Agentic Framework分榜"双冠军"。
OSWorld评测
OSWorld是当前AI领域公认含金量极高的"计算机驾驶执照考试":
- 由香港大学、卡内基梅隆大学(CMU)、滑铁卢大学等机构发表于NeurIPS
- 核心定位:让AI在真实操作系统中,完全模拟人类行为完成跨应用复杂任务
- 评测范围:完整的真实桌面沙盒环境
- 涵盖场景:办公自动化(LibreOffice)、代码开发(VS Code)、图像处理(GIMP)、底层系统运维
- 任务数量:361个实战课题,由机器程序闭环客观判定
进化曲线
OSWorld的分数进化曲线反映了AI智能体的快速发展:
- 2024年基准发布:最顶级智能体得分仅为12.2%
- 2025年底:首次以72.6%突破人类基线(72.36%)
- 2026年7月:实在Agent跑出90.2%,跨入超高可靠性新阶段
硬核实力
在OSWorld满分361分的硬核课题中,实在Agent最终拿下325.59分。在三大"地狱级"场景中表现突出:
跨应用长链路协同(78.81/93分)
任务量最大、最易产生累积错误的维度,智能体需要模拟真实办公中最繁琐的跨系统流程。实在Agent领先第二名近10个百分点。
非标GUI界面理解与微操(24.0/26分,成功率92.3%)
专业图像软件GIMP充满浮动面板、非标准工具栏和像素级微操。Agent攻下24个任务,证明了其对复杂非标UI界面的深厚解析积累。
底层系统运维(24.0/24分,100%满分)
在修改文件权限、进程管理、命令行等"错一步全盘皆输"的高危任务中实现零失误,反映了底层执行闭环的极高确定性。
技术范式转移
智能体技术正在发生的范式转移:
Agent = Model + Harness
- Model是发动机,提供通用智力和原始动力
- **Harness(工程套件与运行架构)**是方向盘、变速箱与安全系统
Stanford、清华等机构的研究证明,在相同底座模型前提下,单靠Harness工程架构的优化,在OSWorld等基准上的性能提升可高达6%-17%。
实在智能的优势
第一性原理的动作抉择
API能跑通就跑API,跑不通就用GUI——像人类员工一样看屏幕、点击鼠标,把数据拿回来把事办成。
海量真实业务场景
已累计服务超6000家企业客户,通过真实业务场景"喂养"智能体,积累了丰富的企业级自动化经验。
可靠性保障
提供"操作撤销与回滚"能力,将可靠性推向99.99%。
行业意义
90.2%的成绩标志着:
- 智能体从"不可用、演示级"正式跨入"超高可靠性"阶段
- 中国团队在Computer-Use Agent赛道上取得全球领先
- 企业级自动化经验正在转化为技术优势
- AI智能体商业化进程加速