本篇文章转载自公众号

CLI、MCP 等工具正在快速拓展智能体的能力边界,但大量既有的数字生态仍未被工具化,GUI (Graphical User Interface,图形用户界面)依然是数字世界最广泛、最通用的交互入口。

GUI 智能体有望成为现有数字设备上的通用执行器,只要有界面,它就能上手替你操作。为了让这一设想落地,我们期待的GUI 智能体基模应当具备这样几种能力:在真实设备上可靠运行;能力强大的同时,严守安全边界;跨手机、电脑执行个人工作流;将 GUI 交互与 CLI 执行有机结合;稳定高效完成长程任务;主动提供有用的个性化服务;在较少人工参与下由AI驱动模型能力迭代。

基于这一愿景,我们推出了 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,涵盖移动端、电脑端、网页端以及深度搜索(DeepSearch)环境。

技术报告:

https://arxiv.org/abs/2607.28227

项目主页

https://tongyi-mai.github.io/Qwen-UI-Agent

GitHub:

https://github.com/Tongyi-MAI/MAI-UI

性能表现

打开网易新闻 查看精彩图片

Qwen-UI-Agent在GUI任务上全面对标乃至超越业界旗舰模型:

  • 移动端: MobileWorld 82.1%,分别领先GPT-5.6 Sol、Claude Opus 4.8、Seed 2.1 Pro 12.0、14.6、8.9 个百分点;真机基准MobileWorld-Real 92.2%,超越Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol、Seed 2.1 Pro ;AndroidDaily高达 97.5%,接近满分。

  • 电脑端:OSWorld-Verified 79.5%,超越 GPT-5.5、Gemini 3.1 Pro、Seed 2.1 Pro;OSWorld-v2 Partial分数40.0%,同时相比基线节省58%执行步数。

  • 浏览器&DeepSearch:WebArena 73.6%,位列所有对比模型第一;BrowseComp-ZH 75.0%。

  • GUI Grounding:ScreenSpot-Pro 81.5%,在其余4个grounding评测基准也全部刷新SOTA。

  • 通用能力:通用和Agentic能力全面保持或超越训练基座模型,并在这两类任务上大幅领先GUI专用模型,从容应对真实世界的长尾需求。

(配图展示了部分核心 Benchmark 结果,更多分数及评测细节,可前往技术报告查阅)

核心亮点

01 真机训练,真机评测

搭建覆盖 100+ 台真实手机、150+ 应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建 MobileWorld-Real 真机基准(400+任务、100+应用),打通“从模拟到真实”的最后一公里。

☕️本地生活 + 咖啡探店

Prompt:我今天约了朋友去天目里喝咖啡,帮我在高德搜索查看详细地址,打开大众点找附近 1 公里内的咖啡馆,找人气最高的那家记下店名,再去小红书总结前五条笔记,看看大家推荐这家店的哪款咖啡。

打开网易新闻 查看精彩图片

高铁行程 + 会议安排

Prompt:下周三我从北京回来,帮我看一下 12306 最早到杭州西的那班高铁几点到。然后查一下杭州西坐地铁到阿里巴巴西溪园区要多久,算一下我几点能到公司。最后在钉钉安排一个到达后整点的会议。主题写"出差归来项目同步",参会人选我和张三。开一个小时,设置提前 5 分钟提醒。

打开网易新闻 查看精彩图片

02 严守安全边界

Qwen-UI-Agent 将安全判断贯穿任务执行全过程:面对违法或高风险请求,它会不执行任何界面操作,直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,则会在关键步骤主动停手,向用户说明情况,待获得明确确认后再继续。危险请求不执行,敏感操作不擅自决定,让模型既能执行,也懂得何时停手。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

03 GUI + CLI 混合动作空间,

支持Batched Actions(批量操作)

GUI操作之外,模型还能直接执行命令行操作,并在单次决策中批量输出多个动作。在电脑任务中,CLI动作占比近半,约40%动作以batched actions形式输出,大幅缩短执行轨迹、拓展能力边界、提升执行效率。比如跨网站调研产品、核对价格,生成比价方案。

规划居家办公桌面方案

Prompt:我有一张120厘米宽、60厘米长的书桌,想配一套适合居家办公的设备,总预算不超过4000元。帮我从公开网站上挑选显示器、显示器支架、键盘和台灯(有空间的话你自己再想想还要买什么 ),每类比较几款,注意显示器重量要在支架承重范围内,所有设备要能合理放在桌面上 。整理三套不同价位的方案,并做一张按实际比例绘制的桌面布局图,让我能直观看到每套方案放在桌上的效果。不要购买。(注意,附上推荐理由,而且要有一些产品评价跟对应的链接,我要性价比,最好给我1000,2000,4000的三套方案),最后展示一个html文件给我。

打开网易新闻 查看精彩图片

04 可扩展的长程在线强化学习

支持在超过100步的超长轨迹上进行在线 RL 训练,约 10000 个并发环境同时 rollout,配合模型自适应课程学习,持续攻克长程任务。

比如下面这一段数据分析的长程调研任务,总步数达170步。智能体采集并交叉核验数据,运行可复现分析,生成 Excel、PowerPoint 和 Word 交付物,再进行多轮视觉检查并修正可见的版式问题。

调研与报告生成

Prompt:请深度分析 Google(Alphabet)从 2019 年至今的增长轨迹,覆盖营收、营业利润、净利润、利润率、研发投入、资本开支、员工人数、主要业务板块及重大战略变化。使用统一的数据口径,计算同比增长率和复合年增长率,识别广告、云计算、AI、组织调整及基础设施投资等关键转折。

数据必须来自 Alphabet 财报、SEC 文件等权威来源,并通过可靠的第三方来源交叉核验。所有图表和结论均须标注出处。

请将原始资料、可复现分析脚本、Excel 工作簿、一份六页中文 PowerPoint 和一份简明 Word 摘要,统一保存到桌面的“Google Growth Analysis”文件夹中。

  • 调研分析

(GUI 负责网页检索与数据源定位,CLI 负责数据下载与分析)

打开网易新闻 查看精彩图片

  • 报告生成与视觉校验

(CLI 负责生成多项调研报告,GUI 负责检查视觉效果并指导提供修复反馈)

打开网易新闻 查看精彩图片

05 AutoResearch 式数据飞轮

要持续提升模型能力,需要一个迭代式、闭环式的流程,涵盖任务设计、环境构建、验证器开发、数据整理、模型训练、评估以及错误分析等多个环节。

当这些阶段主要由人类驱动时,迭代速度会变得缓慢,并且随着应用、平台和能力维度覆盖范围的不断扩大,也难以规模化。为了解决这一问题,我们提出了由AI驱动的数据飞轮,将人类从亲自执行每个阶段,转变为高层监督和干预关键节点。

打开网易新闻 查看精彩图片

06 主动服务 + 跨平台工作流Harness

通过强大的Harness能力,Agent不再被动等待指令,而是主动服务。比如收到航班取消通知,Agent 可主动识别受影响的行程、检索备选航班与高铁、结合日程给出改签方案,经用户确认后执行,并在手机与电脑之间无缝接力完成后续工作。

✈️航班取消后主动服务

场景: Harness检测到用户次日清晨的航班被取消,使其能否按时参加14:00的重要会议面临风险。在用户提出请求之前,主动服务 Harness 便开始搜索替代航班和高铁方案,评估哪些选项能够确保按时抵达,并提供可供直接决策的行程调整方案。

打开网易新闻 查看精彩图片

手机到电脑的跨端执行

Prompt:在手机相册中找到所有收据,将它们移动到远程桌面上的receipts文件夹,按日期重命名,并在该文件夹中创建一个 Excel 文件汇总账单。

打开网易新闻 查看精彩图片

GUI x DeepSearch

GUI 负责真实界面中的交互与执行,DeepSearch 负责跨来源检索、筛选和核验信息。二者协同,可将原本多个页面中反复点击、浏览和筛选的信息检索流程,简化为少量高效的API搜索请求,再返回界面完成后续操作,显著缩短执行路径、拓展信息获取范围并提升任务效率。

Prompt:帮我找出本届世界杯淘汰赛中,在落后的情况下最终完成反超、且反超前最大落后球数最多的一场比赛,然后打开小红书,查看过去一周内讨论度最高的相关帖子并点开。

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片