⚡ 前沿动态

阿里 Qwen-UI-Agent:真机多模态GUI智能体基座模型

🕐 2026.08.23 星期日 来源 · 媒体 🔥 2 次点击

Qwen-UI-Agent是阿里巴巴最近正式发布的以真实世界为中心的GUI智能体基座模型,基于Qwen 3.5系列基础模型打造,主力版本参数量仅27B,同时提供35B-A3B、4B参数量的不同版本,适配不同部署场景需求。 该模型全面覆盖移动端、桌面端、网页端及深度搜索环境,打破传统GUI智能体依赖模拟器测试的局限,可直接在复杂真实设备上无缝完成自动化操作任务。

传统GUI Agent多在模拟环境中测试,与真实设备存在巨大鸿沟。Qwen-UI-Agent以"真实世界为中心",在真机上训练,弥合"模拟与现实"的差距。

一、技术架构与训练体系

1. 真机训练体系‌

阿里搭建了覆盖100+台真实手机、150多款应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,自建MobileWorld-Real真机基准(400+任务真机基准),打通从模拟环境到真实设备的最后一公里,解决传统GUI智能体普遍存在的sim-to-real gap(模拟到真实的性能鸿沟)问题,适配国内超级应用功能深、入口杂、弹窗多的特殊生态场景。

2. 长轨迹强化学习‌

结合在线强化学习,持续攻克长周期任务:支持超过100步的超长轨迹在线强化学习训练,配合约10000个并发环境同时迭代,持续攻克复杂长程任务,大幅提升多步骤连续操作的稳定性。

3. GUI+CLI双引擎融合‌

模型支持GUI交互与命令行操作协同,电脑端任务中CLI动作占比近半,可融合视觉、文本、UI结构信息,可单次批量输出40多个动作,大幅减少不必要的交互步骤,提升整体执行效率。

二、基准测试核心性能

该模型在6个核心GUI基准测试中5项取得第一,全面超越GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro等国际旗舰模型:

  1. 移动端‌:MobileWorld基准得分82.1%,领先GPT-5.6 Sol 12.0个百分点;MobileWorld-Real真机基准成功率达92.2%;AndroidDaily测试得分97.5%,接近满分。
  2. 桌面端‌:OSWorld-Verified基准得分79.5%,超越GPT-5.5、Gemini 3.1 Pro等模型,相比基线大幅减少任务执行步数。
  3. 网页与深度搜索‌:WebArena基准得分73.6%,位列所有对比模型第一。
  4. GUI元素定位‌:ScreenSpot-Pro基准得分81.5%,其余4个评测基准全部刷新SOTA纪录。

三、全链路安全机制

模型将安全判断贯穿任务执行全流程:面对违法或高风险请求直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,会在关键步骤主动暂停,向用户说明情况并等待用户明确确认后才继续执行,形成双层安全防护体系,避免误操作带来的风险:

  • 核心能力:命令行操作、批量动作输出、安全判断机制、100步以上在线强化学习
  • 安全机制:违法/高风险请求直接拒绝;支付/数据删除/隐私授权等敏感场景暂停等待确认

四、应用场景

1. 移动端‌

真机上操作App完成复杂任务,如自动打开地图查找附近咖啡馆,跨平台搜索对应店铺评价,辅助用户完成消费决策;自动完成APP内的表单填写、信息查询等重复性操作。

2. 桌面端‌

跨网站完成产品调研、价格核对,自动生成比价方案;GUI负责网页检索与数据源定位,CLI负责数据下载与分析,协同完成深度搜索类复杂任务。

3. 跨端协同‌

同一模型覆盖移动端、桌面端、网页端,执行深度搜索,如支持手机电脑跨端执行任务,自动生成PPT报告,主动监控设备消息通知并向用户提供定制化推荐方案。

五、开源与生态

阿里同步公开了该模型的技术报告、项目主页与GitHub开源仓库,相关资源可通过以下渠道获取:

该模型的发布也推动整个行业的GUI智能体评测标准,从传统模拟器基准转向真机实测标准。

声明:文中数据及部分观点来源于网络,部分观点来源于个人分析和推理,仅供参考,不构成投资或商业决策建议。
资料来源
  1. arxiv.org
  2. Github
← 返回 [前沿动态]