来源:市场资讯

(来源:环球网资讯)

来源:环球网

日前,全球权威AI智能体测试基准“OSWorld”公布最新排名,由中国团队研发的智能体产品“实在Agent”以90.2%的成功率位列全球总榜首位,同时斩获Agentic Framework分榜第一,实现双项冠军。这是该测试自2024年设立以来,全球智能体首次突破90%大关,此前最高纪录由Meta、OpenAI、Anthropic等海外科技企业保持。

打开网易新闻 查看精彩图片

OSWorld测试由香港大学、卡内基梅隆大学、滑铁卢大学等高校学者联合发起,被业界视为衡量AI“计算机操作能力”的重要标尺。与侧重语言对话的传统测试不同,OSWorld要求智能体在真实操作系统中,独立完成文件编辑、表格处理、图像修改、邮件收发及跨应用协同等361项复杂任务,全程由机器自动判定结果,避免人为评分的主观偏差,因而被公认为贴近真实办公场景的AI能力“试金石”。

据测试数据,2024年OSWorld刚推出时,包括GPT-4o、Claude在内的顶级模型成功率仅约12%;至2025年底,行业最优成绩提升至72.6%,首次超过人类平均水平;2026年5月刷新至83.6%。此次“实在Agent”以90.2%的成绩再次大幅跃升,标志着AI在电脑操作任务上已迈入“超高可靠性”的新阶段。

在细分领域中,该智能体在图像处理(GIMP)、跨应用协同和多软件联动等公认高难度任务上表现突出,其中系统底层操作类任务获得满分。业内人士指出,跨应用协同考验智能体的长链路规划能力,图像处理反映其对非标准界面视觉理解的深度,而系统级零失误则体现了执行闭环的高稳定性,三项能力叠加构成其整体领先优势。

据了解,“实在Agent”由国内人工智能企业实在智能研发。该公司自2018年成立以来,已服务超过6000家企业客户,绝大部分为世界500强、央国企及行业龙头企业,在真实办公场景中积累了丰富的操作数据和工程经验。团队表示,智能体能力不仅依赖底层大模型的“智力”,更依赖整套工程调度系统(Harness)的可靠性——相当于汽车发动机与方向盘、制动系统的协同配合。长期的企业场景沉淀和工程迭代,是此次登顶的重要基础。

打开网易新闻 查看精彩图片

专家认为,中国智能体在权威测试中登顶,不仅表明国内AI产业在核心工程能力上取得实质性突破,也预示着AI正从“对话交互”的工具形态,加速向能够独立操作电脑、执行复杂任务的“数字员工”演进,为实体经济数字化转型提供了新的技术支撑。