阿里 Qwen-UI-Agent:真机多模态GUI智能体基座模型
Qwen-UI-Agent是阿里巴巴最近正式发布的以真实世界为中心的GUI智能体基座模型,基于Qwen 3.5系列基础模型打造,主力版本参数量仅27B,同时提供35B-A3B、4B参数量的不同版本,适配不同部署场景需求。 该模型全面覆盖移动端、桌面端、网页端及深度搜索环境,打破传统GUI智能体依赖模拟器测试的局限,可直接在复杂真实设备上无缝完成自动化操作任务。
传统GUI Agent多在模拟环境中测试,与真实设备存在巨大鸿沟。Qwen-UI-Agent以"真实世界为中心",在真机上训练,弥合"模拟与现实"的差距。
一、技术架构与训练体系
1. 真机训练体系
阿里搭建了覆盖100+台真实手机、150多款应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,自建MobileWorld-Real真机基准(400+任务真机基准),打通从模拟环境到真实设备的最后一公里,解决传统GUI智能体普遍存在的sim-to-real gap(模拟到真实的性能鸿沟)问题,适配国内超级应用功能深、入口杂、弹窗多的特殊生态场景。
2. 长轨迹强化学习
结合在线强化学习,持续攻克长周期任务:支持超过100步的超长轨迹在线强化学习训练,配合约10000个并发环境同时迭代,持续攻克复杂长程任务,大幅提升多步骤连续操作的稳定性。
3. GUI+CLI双引擎融合
模型支持GUI交互与命令行操作协同,电脑端任务中CLI动作占比近半,可融合视觉、文本、UI结构信息,可单次批量输出40多个动作,大幅减少不必要的交互步骤,提升整体执行效率。
二、基准测试核心性能
该模型在6个核心GUI基准测试中5项取得第一,全面超越GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro等国际旗舰模型:
- 移动端:MobileWorld基准得分82.1%,领先GPT-5.6 Sol 12.0个百分点;MobileWorld-Real真机基准成功率达92.2%;AndroidDaily测试得分97.5%,接近满分。
- 桌面端:OSWorld-Verified基准得分79.5%,超越GPT-5.5、Gemini 3.1 Pro等模型,相比基线大幅减少任务执行步数。
- 网页与深度搜索:WebArena基准得分73.6%,位列所有对比模型第一。
- GUI元素定位:ScreenSpot-Pro基准得分81.5%,其余4个评测基准全部刷新SOTA纪录。
三、全链路安全机制
模型将安全判断贯穿任务执行全流程:面对违法或高风险请求直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,会在关键步骤主动暂停,向用户说明情况并等待用户明确确认后才继续执行,形成双层安全防护体系,避免误操作带来的风险:
- 核心能力:命令行操作、批量动作输出、安全判断机制、100步以上在线强化学习
- 安全机制:违法/高风险请求直接拒绝;支付/数据删除/隐私授权等敏感场景暂停等待确认
四、应用场景
1. 移动端
真机上操作App完成复杂任务,如自动打开地图查找附近咖啡馆,跨平台搜索对应店铺评价,辅助用户完成消费决策;自动完成APP内的表单填写、信息查询等重复性操作。
2. 桌面端
跨网站完成产品调研、价格核对,自动生成比价方案;GUI负责网页检索与数据源定位,CLI负责数据下载与分析,协同完成深度搜索类复杂任务。
3. 跨端协同
同一模型覆盖移动端、桌面端、网页端,执行深度搜索,如支持手机电脑跨端执行任务,自动生成PPT报告,主动监控设备消息通知并向用户提供定制化推荐方案。
五、开源与生态
阿里同步公开了该模型的技术报告、项目主页与GitHub开源仓库,相关资源可通过以下渠道获取:
- Qwen-UI-Agent 技术报告 - arXiv: https://arxiv.org/abs/2607.28227
- Qwen-UI-Agent 项目主页: https://tongyi-mai.github.io/Qwen-UI-Agent
- Qwen-UI-Agent GitHub 开源仓库: https://github.com/Tongyi-MAI/MAI-UI
该模型的发布也推动整个行业的GUI智能体评测标准,从传统模拟器基准转向真机实测标准。
- arxiv.org
- Github