实在智能体以 90.2% 登顶 OSWorld 基准
中国企业实在智能在 OSWorld 基准测试中以 90.2% 任务成功率刷新公开纪录,超过海外厂商此前最高分。
由中国团队实在智能研发的「实在 Agent」,在 AI 智能体权威评测基准 OSWorld 中以 90.2% 的任务成功率刷新公开榜单纪录,同时拿下 OSWorld 总榜与 Agentic Framework 分榜第一名。该成绩超越了此前海外厂商保持的公开最高分,成为该基准自 2024 年发布以来的阶段性高点。
OSWorld:检验智能体操控真实桌面的考场
OSWorld 由香港大学、卡内基梅隆大学、滑铁卢大学等机构发表于 NeurIPS,是当前公认含金量较高的「计算机使用」评测基准。它为 AI 提供完整的真实桌面沙盒环境,覆盖 LibreOffice、VS Code、GIMP 等办公与开发软件,共 361 个跨应用复杂任务,所有结果由程序自动判定,不依赖人工打分。
OSWorld 自 2024 年发布以来,得分曲线持续抬升:发布之初最顶级智能体得分仅 12.2%,2025 年底行业首次以约 72.6% 突破人类基线(约 72.36%),此次实在 Agent 跑出的 90.2% 则把智能体的可靠性推进到新的量级。
实在 Agent 的分项表现
在 361 道题目中,实在 Agent 总得分 325.59 分。其拉开差距的关键集中在三个被业内视为「地狱级」的子任务上:
- 跨应用长链路协同(multi_apps):78.81 / 93 分,较第二名领先近 10 个百分点,考验长链路规划与上下文收敛能力。
- 非标 GUI 界面与像素级微操(GIMP):24 / 26 分,成功率约 92.3%,覆盖浮动面板、非标准工具栏等复杂视觉操作。
- 底层系统运维(os):24 / 24 分,100% 满分,覆盖文件权限、进程管理、命令行等高危任务。
Harness 工程:模型之外的决定性变量
这一成绩折射出智能体技术正在发生的范式转移。业内普遍将智能体能力拆解为:
- Agent = Model(底座大模型,提供通用智力)+ Harness(工程套件与运行架构,负责规划、记忆、错误恢复、安全围栏等)。
斯坦福、清华等机构的研究显示,在相同底座模型前提下,仅靠 Harness 工程优化,就能在 OSWorld 等基准上带来 6%–17% 的性能提升。当主流大模型的原始智力趋于接近,决定智能体能否真正「替人干活」的核心变量,越来越落在 Harness 工程化能力上。
实在智能长期深耕企业级 RPA 与自动化方向,服务超过 6000 家企业客户(其官方介绍中 90% 为世界 500 强、央国企及行业龙头),积累的真实业务场景、报错恢复机制与流程模板,被其视为构建高鲁棒性 Harness 的基础。
从考场高分到产业落地
OSWorld 榜单登顶是技术演进的重要节点,但要进入企业生产环境,智能体仍需跨越三道关:
- 可靠性从 90.2% 收敛到工业级 99.99%:在财务结算、HR 薪酬、供应链下单等关键流程中,残余失败率可能带来重大业务风险,需要在高风险节点触发人机协同与操作回滚机制。
- 抗干扰能力:真实办公环境中充斥着软件弹窗、版本更新、网络抖动等非标干扰,智能体需具备自主纠错与流程续跑能力。
- 可计算的 ROI 与合规:通过端侧轻量模型与云端高阶 VLM 的混合调度压低推理成本与延迟,并配套沙盒隔离、全轨迹审计日志,满足企业级安全合规要求。
AI 正在脱离「只会聊天」的对话框形态,向能接管屏幕、驱动复杂软件系统的「数字劳动力」演进。OSWorld 90.2% 是这场竞赛的一个里程碑,而非终点。
