⚡ 前沿动态

面向真实世界的浏览器智能体:Wuying Browser Agent

🕐 2026.08.20 星期四 来源 · 媒体 🔥 2 次点击

阿里云团队近日在arXiv发布论文,推出Wuying-Browser-Agent-27B,提出两项训练方法:RUIC-SFT(暴露模型于困难界面场景与失败-恢复轨迹)和 DAO-GRPO(在长序列中定位导致失败的具体步骤,进行步级信用分配)。

浏览器Agent的核心瓶颈不是短期任务,而是长程任务中的错误累积与恢复能力。Wuying通过训练恢复轨迹与步级奖励,试图解决“38步任务中第几步出错”的信用分配问题。这对真实企业流程自动化(如跨系统填报、订单处理、合规审查)有直接价值。

该框架将浏览器Agent执行建模为‌部分可观测序列决策问题‌:给定自然语言任务指令与初始浏览器状态,Agent最多执行Tmax步交互,每一步获取网页观测后生成结构化动作执行,最终达成任务目标。

整套交互完全依托阿里自研的‌Wuying AgentBay云原生沙箱服务‌实现,为每一个任务分配独立隔离的Linux浏览器沙箱,通过轻量化Model Context Protocol(MCP)接口暴露标准化浏览器原语,将全量浏览器状态获取、动作执行、环境反馈流程整合为统一调用,大幅降低长轨迹交互的通信开销,支撑大规模并行在线训练。

一、论文核心背景与定位

该论文针对真实网页环境中长周期浏览器Agent的三大结构性痛点提出统一解决方案:

  • 传统浏览器Agent训练数据几乎仅由成功轨迹构成,真实执行中常见的错误恢复、复杂UI交互场景完全缺乏监督信号,常规监督模型仅能从8.5%的错误步骤中完成自恢复。
  • 长轨迹任务中大量执行步骤共享相同前缀,仅少数关键分支步骤决定任务最终成败,传统统一轨迹级优化会把学习信号稀释在大量共享步骤中,导致信用分配失效。
  • 现有公开浏览器基准几乎全部是英文场景、任务平均步长偏短,完全无法覆盖真实部署中占比极高的中英双语、长周期网页交互场景,无法准确衡量Agent在真实环境中的鲁棒性。
  • 论文提出的Wuying-Browser-Agent完整框架,在执行层、监督层、优化层、评估层全链路对齐长周期真实网页部署需求,系列开源模型在主流浏览器测试基准上达到全新开源SOTA水平。

二、核心框架全模块细节

1. 底层共享Browser Harness层

作为全链路统一执行基底,覆盖监督训练、在线强化学习、评估全流程,完全消除不同阶段的接口异构性:

  • 结构化工具空间‌: 定义覆盖导航、交互、提取、文件操作、流程控制5大类的24个原子操作原语,所有模型输出自动经过Schema校验后才可执行,动作空间完全标准化。
  • 结构化反馈机制: Agent输出的非法动作、无效操作不会静默失败,而是直接返回带明确类型的结构化错误信息给Agent,让Agent主动感知执行异常并触发校正流程。
  • 面向决策的状态管理: 摒弃直接暴露全量增长的原始交互日志的传统设计,动态维护精简的决策相关上下文,自动过滤冗余过时信息,在降低Token开销的同时严格对齐离线训练、在线推理的信息输入一致性,完全避免训练-推理上下文不匹配问题。

2. RUIC-SFT(Reflection and UI-specialized Curriculum SFT)监督初始化模块

在通用成功轨迹数据之外,新增两类专项数据,通过三阶段渐进式课程学习策略完成模型初始化,避免直接引入恢复类数据破坏基础执行能力:

训练阶段 核心目标 数据占比分配
阶段1 稳定基础浏览器操作能力 以通用浏览器任务数据为主,少量UI专项数据,快速掌握导航、点击、输入等基础动作
阶段2 强化复杂UI交互能力 逐步提升UI专项组件数据占比,覆盖日期选择器、级联选择器、富文本编辑器等低曝光复杂控件的交互模式
阶段3 培养错误感知与自校正能力 延迟引入反思恢复类数据,既不会过早破坏已学习的基础执行策略,又能教会模型从错误执行状态中恢复到正确任务路径

两类专项数据细节:

  • 反思数据集: 每一个样本围绕错误步骤构建,记录错误操作、错误观测现象、自然语言错误归因、经过沙箱验证的可执行修正策略,覆盖导航错误、交互错误、状态误判等全量浏览器Agent常见失败模式,补全传统成功轨迹完全缺失的错误恢复监督信号。
  • 专项UI组件数据集: 通过自动化DOM扫描+人工标注全流程构建,针对日期选择器、级联选择器、富文本编辑器等低曝光复杂控件,生成覆盖基础操作、异常输入、加载延迟等边缘场景的交互样本,解决自然分布中复杂UI场景监督信号极度稀疏的行业痛点。

3. DAO-GRPO(Divergence-Aware Online GRPO)在线强化学习模块

针对长周期浏览器任务稀疏奖励下的信用分配难题做了三层针对性优化,完全对齐真实推理时的动态上下文环境:

  • 基于势能的奖励塑形(PBRS): 通过任务 conditioned 进度估计器将稀疏的终端0/1成功信号,转化为全轨迹的稠密进度奖励,同时严格保留最优策略不变,在不改变任务成功判定逻辑的前提下大幅提升长轨迹的监督信号密度。实测表明进度估计器与人工标注的Progress排序一致度达86%,Spearman相关系数为0.81,完全满足塑形需求。
  • divergence感知的步级信用分配: 同任务下多轨迹通常共享极长的公共前缀,仅在少数关键分支步出现语义分歧,该模块通过LLM分歧检测器自动定位决定任务成败的关键分支点,将核心优化权重集中在该类步骤,共享前缀步骤权重自动下调,成功轨迹分歧点后的步骤、失败轨迹分歧点后的步骤分别按不同不对称系数逐步衰减权重,彻底解决学习信号被长共享前缀稀释的问题。

实测LLM分歧检测器与人类标注的精确位置匹配度达61%,±1步匹配度达78%,±2步匹配度达89%,轨迹优劣分支划分准确率达94%,且算法对±2步以内的扰动鲁棒性极强,性能始终优于无差异化均匀加权的普通GRPO基线。

  • 响应级优化目标: 摒弃传统全拼接轨迹转录本的全局优化逻辑,利用Browser Harness的状态重建能力,每一步策略更新时都严格重现推理时刻Agent实际可获取的决策上下文,完全对齐离线训练与在线推理的信息输入,从根源消除浏览器动态状态场景下的训练-推理不一致问题。。

三、全新基准BrowserBench

论文发布了业界首个面向真实部署场景的中英双语长周期网页测试基准,核心参数如下:

1. 任务规模

总计350个真实网页任务,覆盖254个中英网站,中文任务191个占比54.6%,英文任务159个占比45.4%。

2. 任务难度

全量任务平均执行步数37.9步,单任务最大步数上限100步,中文任务平均步长41.13步,整体长周期属性远高于现有短序列基准。

3. 场景覆盖

包含电商产品信息、排行对比、批量数据提取、地图旅游、机构核验、学术知识搜索、通用多步浏览、新闻内容浏览8大类真实网页场景,且按实测Agent通过率划分为30%简单任务、40%中等任务、30%困难任务,困难占比显著高于现有主流基准,在能力天花板上的区分度更强。

四、实验结果与核心结论

1. 浏览器基准性能

Wuying-Browser-Agent-27B在WebVoyager上达到80.6%成功率,Online-Mind2Web上达到66.7%成功率,BrowserBench上达到65.1%成功率,平均70.8%的通过率刷新开源浏览器Agent的SOTA成绩,性能甚至超越部分闭源旗舰模型。 通用Agent能力迁移:该模型在Tau2-Bench、BFCL-v4、Claw-Eval三大通用Agent基准上平均得分73.8,显著超越同量级基础模型,说明面向浏览器的专项优化没有牺牲通用工具调用能力,反而强化了长周期任务下的通用Agent执行鲁棒性。

2. 消融实验验证

RUIC-SFT的三阶段课程设计比固定比例混合数据训练,整体成功率提升1.4个百分点,错误恢复成功率提升1.4个百分点,且单任务完成平均步数从29.3降至22.4,大幅减少冗余操作;DAO-GRPO的三层优化叠加后,9B模型在BrowserBench上的整体成功率从38.0%提升到42.9%,困难任务成功率提升超过12个百分点,且该增益随着轨迹长度增加而显著放大,在步数超过50步的超长任务场景下,成功率相比纯监督初始化实现翻倍。

3. 自增强数据飞轮

基于统一的Browser Harness层,所有训练、评估、部署产生的执行轨迹都可以自动分类、自动核验后回流到训练数据集,无需全量人工标注即可长期适配动态变化的真实网页环境,保持浏览器Agent的长期有效性:

  • 所有SFT训练、在线RL交互、基准评估、真实部署产生的全部轨迹都以完全统一的结构化格式自动回流。
  • 自动分诊模块自动区分环境瞬态错误与模型真实故障,将成功轨迹转化为通用训练样本、存在可定位错误的失败轨迹转化为反思恢复候选样本,集中在特定UI控件上的失败自动进入UI专项数据集池。
  • 候选样本必须经过沙箱重执行验证,确保修正策略确实能将任务拉回可执行路径,才可正式加入训练集,避免自训练过程中放大模型自身错误。
  • 从基准评估中聚合得到的分维度错误统计,自动指导下一轮的任务合成与样本采集方向,实现无需大量全量人工标注的持续迭代。

五、研究意义

该工作针对性打通了长期以来浏览器Agent落地的核心结构性痛点,从四个维度推动领域进展:

1. 填补真实部署场景的技术鸿沟

首次系统性识别出长周期浏览器Agent部署中三个相互关联的结构性挑战——训练数据仅由成功轨迹构成导致缺乏错误恢复监督、长轨迹中共享前缀稀释信用分配信号、现有评测基准以英文短任务为主缺乏双语长周期真实网页覆盖,通过端到端协同设计的全链路流水线系统性解决了性能与真实部署之间的差距,而非单纯堆叠模型参数规模。

2. 构建全链路统一执行底座

打造了结构化浏览器Harness层,在监督训练、在线强化学习、评估全阶段提供完全一致的稳定执行原语与面向决策的上下文管理,彻底消除不同训练阶段之间的接口异构性,大幅降低长网页交互的状态冗余与Token开销,保障离线学习、在线交互和线上部署之间的能力无缝迁移。

3. 提出两套创新训练范式

RUIC-SFT以渐进式课程学习融合错误恢复轨迹与复杂UI交互专项数据,解决了传统仅靠成功演示无法教会模型自纠错与复杂控件操作的问题;DAO-GRPO定制化长周期在线强化学习框架,通过势能奖励塑形、分歧感知步级信用分配、响应级动态上下文优化三重设计,大幅缓解稀疏终端奖励下的长轨迹信用分配失效难题。

4. 建立真实场景化评测基准

推出业界首个面向真实部署的双语长周期网页基准BrowserBench,覆盖350个真实网页任务、254个中英文网站,平均执行步数达37.9步,首次将中文互联网场景纳入浏览器Agent标准化评测体系,能够精准暴露传统短基准无法覆盖的长周期能力缺陷。

5. 形成可自增强的闭环数据飞轮

整套流水线依托统一Harness层可自动将线上所有执行轨迹(包括失败任务)分类回流至训练集,通过自动化分诊+沙箱验证机制过滤无效样本,无需全量人工标注即可持续适配不断动态变化的真实网页环境,解决固定演示数据集随时间快速贬值的行业共性问题。

6. 实现能力迁移溢出效应

浏览器专项优化并未以牺牲通用Agent能力为代价,最终开源的Wuying-Browser-Agent-27B在浏览器基准上取得开源SOTA的同时,在通用工具调用类基准Tau2-Bench、BFCL-v4、Claw-Eval上平均得分达73.8,显著超过同量级基础通用模型,证明面向长周期网页交互的优化能够泛化到更广的自主Agent场景中。

六、现存研究局限性

尽管整套框架在长周期真实网页场景中取得突破性进展,仍存在几处可进一步优化的边界:

1. 分歧估计器非绝对精准

依赖LLM实现的轨迹分歧估计器仅能做到近似正确,标注对齐率为精确匹配61%、±1步匹配78%、±2步匹配89%,若将检测到的分歧点随机偏移±4步以上,整体性能会略低于无差异化权重的普通均匀优化方案,极端情况下会降低硬任务上的优化效率。

2. 进度估计器存在残差噪声

同样由LLM实现的进度估计器Φ与人类标注的Spearman相关系数为0.81,存在平均0.11的单位区间平均绝对误差,仅能对任务前缀按完成度进行相对排序,无法输出完全精确的绝对进度量化值,不过基于势能的奖励塑形设计天然对这类噪声有一定鲁棒性,不会改变最优策略。

3. 高难度超长任务上限仍有提升空间

在轨迹长度超过50步的极端长周期任务中,9B模型的最高成功率仅为26.7%,仍有超过7成的超复杂长任务无法完成,长周期下累计的状态漂移、多轮操作决策误差叠加问题尚未被完全解决。

4. 视觉感知路径未深度打通

当前框架以结构化DOM状态作为主要观测输入,截图仅在需要视觉接地的场景中作为可选补充,并未把端到端多模态网页交互作为核心优化目标,对仅靠截图完成操作的视觉原生网页、Canvas动态渲染页面的适配能力仍有不足。

5. 基准评测仍存在部分场景缺口

BrowserBench仅覆盖8大类主流真实网页场景,对交互逻辑高度定制化的小众垂直站点、需要复杂跨域账号鉴权的深度业务场景的覆盖度有限,难以通过单轮100步预算覆盖部分超超长端到端任务。

声明:文中数据及部分观点来源于网络,部分观点来源于个人分析和推理,仅供参考,不构成投资或商业决策建议。
资料来源
  1. arxiv.org
← 返回 [前沿动态]