8 月 20 号阿里开源了个叫 Qwen-UI-Agent 的东西,技术圈一下子炸了。我看了技术报告和跑分数据——好消息和坏消息都有,别被"白送"两个字冲昏头。
简单说:它是一个GUI 智能体基座模型——不是只会聊天的模型,是能自己点屏幕的那种。一个模型,同时管手机、电脑、网页、还有深度搜索(DeepSearch)四块环境。
现在市面上绝大多数"电脑/手机自动操作"的 Agent,都是在模拟器里练出来的。模拟器多干净啊,界面固定、环境可控。但一上真机就露馅——真机 App 弹窗、广告、网络抖一下,它就傻了。
阿里这回不一样:搭了 100+ 台真手机、150+ 个真实 App 的环境去训练和评测。结果很说明问题——
模拟器榜单 MobileWorld:82.1%
真机榜单 MobileWorld-Real:92.2%
真机上反而比模拟器高,说明它不是"背答案",是真学会了操作逻辑。AndroidDaily 更是跑到 97.5%,接近满分。
WebArena 73.6%,所有对比模型里第一
OSWorld-Verified 79.5%(电脑端)
ScreenSpot-Pro 81.5%(界面定位)
模型还能把 GUI 点击和命令行(CLI)混着用,单次决策批量输出动作(约 40% 是批处理),比一步一步点快得多
以前"让 AI 替你操作电脑"这种能力,大厂基本是关起门来卖 API 的——你想用,得按调用量交钱。
阿里这回把权重放出来了:旗舰 27B,最小可以压到 2B 端侧跑(GitHub:Tongyi-MAI/MAI-UI)。这意味着什么?意味着做 RPA、做自动化小工具的人,门槛一下子塌了——不用再被一家 API 绑死,自己部署、自己改。
自动操作最怕"它自作主张"。Qwen-UI-Agent 设计了安全刹车:违法/高风险的请求直接拒;遇到付钱、删数据、隐私授权这种敏感操作,会停在关键步骤等你确认再继续。这一点不是噱头,是这种 Agent 能不能让人放心用的底线。
你现在直接用不上原模型。但它开源之后,很快会冒出一堆"帮你整理手机文件""替你在网页上比价""自动填表"的小工具——底层可能就是它。
一句话:阿里把"会操作界面的 AI"从黑盒 API 变成了开源权重,方向是对的,但离"替你全自动操作电脑"还差得远——别急着扔掉你的鼠标。
你觉得这种"会自己点屏幕的 AI",最先会在哪个场景落地?评论区聊聊。
#Qwen# #行业观察# #观点# #实时资讯# #AI工具#
*声明:本文配图由 AI 生成,仅供示意参考;内容为本人实测观点,转载请注明出处。*
热门跟贴