AI 快讯Qwen-UI-Agent让AI真正会用屏幕
模型上新

Qwen-UI-Agent让AI真正会用屏幕

2026-08-20T11:04:45.940Z
Qwen-UI-Agent让AI真正会用屏幕

8月20日,阿里发布Qwen-UI-Agent,统一覆盖手机、电脑、浏览器和DeepSearch环境。在MobileWorld、OSWorld-Verified、WebArena等测试中取得领先,但旗舰权重尚未完整开放,距离可靠接管真实设备仍有距离。

Qwen-UI-Agent让AI真正会用屏幕

8月20日,阿里正式发布Qwen-UI-Agent,把手机、电脑、网页和深度搜索放进了同一个GUI智能体基座模型里。

**GUI Agent是能够理解屏幕内容、规划下一步动作,并通过点击、滑动、输入或其他工具完成任务的模型。**过去这类模型往往各自擅长一个场景:有的会操作Android,有的专注浏览器,有的能控制桌面软件,但一旦任务跨越多个设备或应用,稳定性就会明显下降。Qwen-UI-Agent想解决的,正是这道“跨屏幕执行”的断层。

从目前公布的成绩看,它不是又一个只会识别按钮的视觉模型,而是在尝试成为一个统一的数字执行层:用户说出目标,模型自己判断应该打开哪个应用、查什么信息、用哪种操作完成,并在任务过程中持续观察结果、修正路线。

Qwen-UI-Agent跨手机、电脑、浏览器和DeepSearch环境执行任务的示意图

四类场景统一,Qwen这次比的是执行能力

Qwen-UI-Agent的核心定位是面向真实世界的基础GUI智能体模型,而不是单一设备自动化工具。

它覆盖四类环境:移动端、电脑端、浏览器,以及DeepSearch深度搜索环境。所谓深度搜索,是模型围绕一个目标连续检索、筛选、交叉验证并整理信息,而不是只返回一次搜索结果。换句话说,Qwen-UI-Agent不只要“看懂网页”,还要能在网页之间移动,并把搜索结果组织成可执行的结论。

官方公布的多项基准成绩显示,Qwen-UI-Agent在不少GUI任务上已经对标甚至超过了当前旗舰模型:

| 场景 | 基准测试 | Qwen-UI-Agent成绩 | 对比表现 | |---|---|---:|---| | 移动端 | MobileWorld | 82.1% | 领先GPT-5.6 Sol 12.0个百分点、Claude Opus 4.8 14.6个百分点、Seed 2.1 Pro 8.9个百分点 | | 移动端真机 | MobileWorld-Real | 92.2% | 超越Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol和Seed 2.1 Pro | | 移动端日常任务 | AndroidDaily | 97.5% | 接近满分 | | 电脑端 | OSWorld-Verified | 79.5% | 超越GPT-5.5、Gemini 3.1 Pro和Seed 2.1 Pro | | 电脑端长任务 | OSWorld-v2 Partial | 40.0% | 相比基线减少58%的执行步数 | | 浏览器 | WebArena | 73.6% | 在对比模型中排名第一 | | 中文深度搜索 | BrowseComp-ZH | 75.0% | 面向中文搜索任务取得较高成绩 | | 屏幕定位 | ScreenSpot-Pro | 81.5% | GUI Grounding基准刷新SOTA |

**GUI Grounding是模型把自然语言指令准确映射到屏幕具体元素或坐标的能力。**例如,用户说“点击订单页面右上角的导出按钮”,模型不仅要理解“导出”的语义,还要在页面布局、按钮样式和当前状态中找到正确目标。

这项能力很关键。一个Agent即使规划能力很强,只要把点击位置落在广告、删除按钮或付款入口上,整个任务就会从“自动化”变成“自动闯祸”。Qwen-UI-Agent在ScreenSpot-Pro上达到81.5%,并在其他4项grounding评测中全部刷新SOTA,说明阿里正在补齐GUI智能体最基础、也最容易被忽略的一环:准确点中该点的地方。

真机数据比榜单更重要

Qwen-UI-Agent最值得关注的地方,不只是成绩,而是阿里为训练和评测搭建的真实设备环境。

团队搭建了覆盖100多台真实手机、150多个应用的移动环境,用于任务构建、交互轨迹采集、模型训练和最终评测,并进一步建立MobileWorld-Real真机基准,包含400多个任务和100多个应用。

**MobileWorld-Real是真实手机环境中的GUI任务评测集,用来检验模型从模拟器迁移到真机后是否仍然有效。**这一步很重要,因为模拟器里的按钮位置、网络状态、权限弹窗和页面加载速度通常更加规整,而真实手机会同时面对分辨率差异、系统通知、登录状态、弹窗遮挡、应用更新和网络抖动。

很多GUI模型在演示视频里表现不错,但一进入真机就会遇到“看到了,却点不准;点对了,却不知道下一步;任务完成了,却没有验证结果”的问题。阿里把真机放进训练闭环,意味着模型不再只学习标准化页面,而是要适应真实应用里那些不稳定、琐碎但决定成败的长尾情况。

从公开信息看,这套体系还使用了超过1万个并行环境进行在线强化学习,并处理超过100步的长任务。在线强化学习是指模型在环境中实际执行动作,根据任务是否完成获得反馈,再持续更新策略。对于GUI Agent来说,这比单纯模仿人工操作更接近真实工作方式:一次任务不是固定脚本,而是一连串“观察—行动—确认—纠错”。

它不再只会点屏幕

Qwen-UI-Agent的另一个变化,是把GUI操作放进了更大的工具执行框架中。

在简单场景里,模型可以点击按钮、滑动页面、输入文字;遇到文件、表格和数据处理任务时,它还可以切换到命令行等工具空间。多个连续动作也可以在一次输出中生成,从而减少模型每一步都重新思考带来的延迟和错误累积。

这意味着它的行动空间不再只有“鼠标和手指”。**多模态Agent的行动空间是模型可以选择的执行手段集合,包括GUI点击、文本输入、命令行、文件操作、网页交互以及其他工具调用。**模型真正要学的,不是“看见按钮就点击”,而是判断什么时候应该操作界面,什么时候应该调用更可靠的工具。

例如处理一份表格时,逐个点击单元格可能需要几十步,调用命令行或表格工具则可能更快、更稳定;但在一个没有结构化接口的App里,模型又只能回到屏幕操作。优秀的GUI Agent不是把所有事情都变成点击,而是能够在不同执行路径之间做选择。

这也解释了为什么OSWorld-v2 Partial减少58%的执行步数值得关注。对于长任务来说,步数减少不仅意味着速度更快,也意味着出错机会减少。假设每一步的成功率为99%,连续执行100步的整体成功率只有约36.6%;如果通过更好的规划把任务压缩到42步,理论上的累计成功率会显著提高。实际结果还取决于错误恢复能力,但少走弯路本身就是Agent可靠性的重要组成部分。

两个跨应用任务,展示它想做什么

Qwen-UI-Agent给出的任务示例,已经不是传统的单应用自动化。

第一个任务要求模型完成一条跨应用信息链:用户先让它在高德搜索天目里的详细地址,再打开大众点评查找1公里内的咖啡馆,选出人气最高的一家,随后去小红书总结前五条笔记,最后归纳大家推荐的咖啡品类。

这个任务难点不在于打开某个App,而在于多个应用之间的信息接力。模型必须保存地点上下文,理解“附近1公里”的空间约束,把大众点评的店铺结果与小红书笔记关联起来,还要把非结构化内容整理成结论。它同时考验视觉定位、搜索规划、跨应用记忆和结果验证。

第二个任务则跨越出行查询、地图规划和办公协作:查询下周三从北京返回杭州西的最早高铁及到达时间,再计算杭州西站乘地铁到阿里巴巴西溪园区所需时间,估算最终到公司时间,最后在钉钉安排一个到达事项。

这类任务更接近真实助理工作,因为它包含动态信息、时间计算和外部副作用。高铁时刻可能变化,地铁耗时取决于线路和换乘,日程安排还涉及写入用户账户。模型不能只给出一个看起来合理的答案,还需要知道哪些信息应该再次确认,哪些动作必须经过用户授权。

这不是一次完整意义上的开源发布

Qwen-UI-Agent当前最容易被误读的一点,是“发布”不等于“旗舰权重全部开放”。

根据目前公开资料,阿里发布了项目介绍、技术报告和演示,但Qwen-UI-Agent旗舰模型权重尚未完整开放。此前作为相关技术路线前身的MAI-UI,已经公开了2B和8B两个规模的模型权重,并采用Apache 2.0许可证;更大的32B和235B版本并未同步开放。

**开放技术报告是让外界了解方法和结果,开放模型权重则意味着开发者可以直接下载、部署和进一步训练,两者不是同一件事。**对于开发者来说,这个区别决定了Qwen-UI-Agent目前更像一个能力上限展示和技术路线发布,而不是一款拿来即用的本地GUI模型。

这并不削弱它的价值。阿里前期通过MAI-UI降低了研究和实验门槛,这次则用Qwen-UI-Agent展示更强的跨设备能力。它形成了一种比较清晰的产品策略:先开放中小模型和基础组件,让社区验证路线,再用更大模型和更完整的训练系统证明能力上限。

但如果读者期待的是“今天下载,明天让模型接管手机”,目前还不是时候。真实部署还要面对模型规模、推理成本、设备权限、隐私保护、应用风控和失败后的责任边界。

阿里真正建立的是一套训练机器

Qwen-UI-Agent的长期意义,在于它证明阿里已经搭建起一套从环境、数据到评测的GUI智能体工程体系。

这套体系至少包括四个部分:第一,拥有100多台真机和150多个App的真实移动环境;第二,用模拟环境并行生成大量任务轨迹;第三,通过在线强化学习训练模型处理长链路任务;第四,用MobileWorld-Real等真机基准检验模型是否能从模拟环境迁移出来。

**GUI Agent的训练闭环是让模型在环境中执行任务、收集成功与失败轨迹、根据反馈更新策略,再回到真实设备验证的循环。**它的价值不只是产出一个模型,更重要的是持续生产“哪里点错了、为什么失败、如何恢复”的数据。

这类数据比普通问答数据昂贵得多。文本模型答错一句话,通常重新生成即可;GUI Agent点错一次付款按钮、误删一个文件,后果可能不可逆。因此,训练系统必须同时记录页面状态、动作序列、任务结果和失败原因,还要覆盖不同系统版本、网络状态以及应用UI变化。

阿里此前推出的GUI-Owl和Mobile-Agent-v3,已经在视觉理解、元素定位和跨平台操作方向积累了经验。Qwen-UI-Agent进一步把这些能力与更强的通用推理、Agentic规划以及多工具执行结合起来。官方称,其通用能力和Agentic能力整体保持或超过训练基座模型,并明显领先GUI专用模型,这一点决定了它不是一个“只会操作按钮”的窄模型。

但榜单领先不等于可以托付生活

Qwen-UI-Agent的成绩很亮眼,但真实任务中的失败案例同样值得重视。

公开技术材料中出现过这样的失败:让模型在朴朴超市直播间把10元以下的在售商品加入购物车,并收藏最贵商品时,模型反复打开面包、榴莲和抹茶蛋糕,却没有完成要求;另一个任务要求发完微信朋友圈后把可见范围改为“仅自己可见”,模型完成了发布,却没有完成权限修改。

这两个例子说明,GUI Agent最难的部分往往不是单次点击,而是任务末尾的状态确认。一个任务可能前99步都正确,最后一步却因为页面跳转、权限弹窗或语义理解偏差而失败。更麻烦的是,模型有时会把“已经执行了动作”误判成“目标已经完成”。

因此,Qwen-UI-Agent距离可靠产品还缺少几个关键能力:对高风险动作进行强制确认,对账号和支付权限进行细粒度隔离,对任务结果做可验证检查,以及在失败后向用户清楚解释发生了什么。

尤其是发帖、付款、改权限、删文件和发送工作通知等动作,不能只用“用户已经授权”来解决责任问题。用户授权的是目标,不一定授权了所有中间步骤;模型也需要知道哪些操作可以自动完成,哪些操作必须停下来询问。

从AI手机到通用执行层

Qwen-UI-Agent把AI手机的竞争,从系统入口问题推进到了模型基础设施问题。

此前的AI手机路线,更强调系统级权限:模型能够读取屏幕、模拟点击,并跨App完成操作。但这条路线会直接触碰超级App的流量入口、广告展示和数据权限,也容易引发账号安全与应用风控问题。

Qwen-UI-Agent采取了另一种更开放的思路:把“会操作设备”的能力拆成相对独立的模型和训练系统。它不必天然绑定某一款手机,也不必把所有能力封装在一个系统助手里,开发者可以研究如何把它接入不同设备、桌面环境和浏览器工作流。

这会让GUI Agent更像一种通用执行层。未来用户可能不再需要分别学习每个App的操作路径,而是直接描述目标;但真正决定商业化能否成立的,不只是模型能不能点,而是应用是否愿意提供结构化工具、系统是否允许安全执行,以及用户是否接受一个模型长期观察和操作自己的设备。

OpenAI Hub判断:能力上限已经出现,可靠性仍是主战场

Qwen-UI-Agent是目前国内GUI智能体路线中值得重点关注的一次发布,因为它把移动端、桌面端、网页端和DeepSearch放到同一套评测与训练框架里,并用真机数据验证跨环境迁移能力。

它的优势很明确:MobileWorld达到82.1%,MobileWorld-Real达到92.2%,AndroidDaily达到97.5%;OSWorld-Verified达到79.5%,WebArena达到73.6%,ScreenSpot-Pro达到81.5%。这些数字说明,GUI Agent已经从“能不能操作屏幕”进入“能否完成复杂长任务”的阶段。

但它的限制也同样明确:旗舰权重尚未完整开放,部分长任务仍会失败,真实世界里的权限、风控和责任问题也没有被模型分数解决。对开发者而言,现在最值得跟进的不是简单复刻一个点击机器人,而是研究三件事:如何构建真实交互环境,如何收集高质量失败轨迹,以及如何让模型在高风险步骤前停下来确认。

**Qwen-UI-Agent真正发布的不是一个会替用户点手机的助手,而是一套让模型学习如何使用数字世界的基础设施。**如果阿里能继续开放更完整的权重、评测工具和环境组件,它可能推动GUI Agent从演示型能力走向可复现、可部署的工程系统;如果不能,当前成果仍更接近一次强有力的能力宣示。

无论如何,模型竞争的下一块屏幕已经不再是聊天窗口。手机、电脑和网页,正在变成大模型必须学会使用的操作系统。

相关推荐

查看全部