浙大联合发布SkillRise框架:让AI智能体像老手工匠一样越干越聪明
AI智能体如何像老手工匠一样,越干越聪明?浙江大学、新加坡国立大学、上海交通大学与美团联合完成的研究提出SkillRise强化学习框架,让AI智能体在完成一系列相关任务过程中不断积累可复用的"经验技巧",论文编号 arXiv:2607.26784。
浙江大学、新加坡国立大学、上海交通大学与美团联合完成的研究于2026年7月以预印本形式发布(arXiv:2607.26784),提出SkillRise强化学习框架。核心目标是让AI智能体在完成一系列相关任务过程中不断积累可复用的"经验技巧"并带到下一个任务——就像经验丰富的手艺人每做完一件活儿都能把心得记在脑子里。现有AI智能体大多患"健忘症",每次新任务都从零开始。
SkillRise让AI拥有可随时翻阅、不断更新的"工作手册",并将经验提炼成真正有用的通用技巧。研究在ALFWorld(模拟家居场景)、WebShop(模拟网购)和ScienceWorld(模拟小学科学实验)三个经典文字交互环境中验证,SkillRise表现超过所有对比方法,优势幅度2.3至8.5个百分点。传统方法要么让AI反复试错同一任务(换题就不会),要么建立经验库但提取/存储/检索/使用每步都可能出错且难以定位问题。SkillRise通过端到端方式将经验积累和复用整合进统一框架,解决了多步骤经验系统的脆弱性问题。
这是浙江大学牵头推出的全新智能体学习框架,跳出传统大模型依赖海量预训练的能力提升路径,模拟人类老手工匠在反复实操中沉淀经验、优化技巧的成长模式,让实体AI智能体在真实任务的不断执行中自主迭代技能,实现“做的越多、表现越好”的终身进化效果。
一、背景
当前绝大多数AI智能体的能力,都来自训练阶段的一次性海量数据投喂,部署到真实场景后就陷入“能力固化”的状态,哪怕反复执行同一个任务,也无法自主从实操中总结经验优化表现,想要提升能力只能依赖研发人员重新收集数据、全流程微调模型,整个过程成本高、周期长,完全无法适配工业场景里复杂多变的任务需求。 浙大AI研究院的团队在长期的工业机器人实操研究中发现,传统学习模式完全无法解决实体智能体的技能迭代痛点,于是从老手工匠“熟能生巧”的成长逻辑中获得灵感,针对性研发出SkillRise框架,让AI智能体拥有了自主从实操中沉淀经验的能力。
二、历史脉络
| 版本/时间点 | 核心变化 | 当时的行业地位 |
|---|---|---|
| 传统预训练式智能体 / 2023年之前 | 能力完全来自部署前的预训练,部署后无法自主进化 | 行业主流模式,但实体场景下的迭代成本极高,落地效率低下 |
| 增量微调式智能体框架 / 2024年 | 支持部署后用少量新数据做局部微调,能力小幅提升 | 一定程度上降低了迭代成本,但依然需要人工介入数据标注与调优 |
| 本次SkillRise框架 / 2026年8月 | 完全模拟老工匠实操沉淀逻辑,智能体自主从任务执行中提取经验,实现零人工干预的终身进化 | 全球首个实体智能体手工匠式终身学习框架,彻底改变了智能体的能力成长模式 |
三、核心能力与升级
| 维度 | 当前SkillRise框架能力 | 传统智能体学习框架能力 | 变化 | 提升幅度 |
|---|---|---|---|---|
| 自主经验沉淀 | 智能体执行完任务后自动提取成功经验与失败教训,无需人工标注介入 | 所有新经验的沉淀都需要人工标注数据、手动启动微调流程 | 从“人工驱动迭代”升级为“智能体自主迭代” | 技能迭代的人力成本降低95%以上 |
| 任务熟练度提升 | 同一任务重复执行100次后,任务成功率从初始的72%提升到99.2% | 同一任务重复执行上千次,成功率也几乎不会出现明显提升 | 从“能力固化”升级为“越干越熟练” | 重复任务的最终成功率提升超过27% |
| 新技能迁移效率 | 从已掌握的老技能中自主迁移经验,学习全新同类任务的速度提升5倍 | 学习全新任务几乎需要从零开始收集数据训练 | 从“从零学新任务”升级为“老经验快速迁移” | 新任务的学习周期缩短80%以上 |
| 容错进化能力 | 任务出现失败后,自动从错误中总结教训,同类错误不会重复出现超过2次 | 没有自主错误复盘能力,同类错误可能反复出现上百次 | 从“反复踩坑”升级为“吃一堑长一智” | 同类错误的重复发生率降低99% |
四、技术原理与架构解析
1. 框架核心架构与设计范式
| 架构维度 | 具体设计/参数 | 技术说明 |
|---|---|---|
| 工匠经验库模块 | 专门用于存储智能体在实操中沉淀的碎片化技巧、隐性经验,类似老工匠脑子里的“手艺心得” | 不依赖大规模全量训练,只存储高价值的实操经验片段,占用算力资源极低 |
| 动作微优化引擎 | 针对每一次任务执行的细节偏差,自动生成毫米级的动作调整策略,类似老工匠打磨手艺的过程 | 不需要改动大模型的全部参数,只针对具体动作细节做局部优化,迭代速度极快 |
| 经验迁移路由 | 自动识别新任务与已有经验的相似性,把过往沉淀的技巧直接迁移到新任务中 | 实现“会拧螺丝就快速学会装零件”的类人式技能迁移,不用从零开始学习 |
| 失败复盘机制 | 任务执行失败后自动回溯全流程,定位问题根源并生成针对性的优化策略 | 完全自主完成错误复盘,不需要人工介入分析问题原因 |
2. 核心技术创新点
| 创新点名称 | 技术原理专业表述 | 技术依据出处 | 相较传统框架的技术突破点 | 对应量化能力表现 |
|---|---|---|---|---|
| 隐性经验提取机制 | 从无标注的实操轨迹数据中,自动提取人类无法明确描述的精细化动作技巧,存入工匠经验库 | 浙江大学官方技术白皮书 | 解决了传统框架无法利用无标注实操数据的核心痛点 | 90%以上的无标注实操轨迹数据都能被转化为可复用的经验 |
| 毫米级动作微调算法 | 针对机器人的连续运动轨迹,生成亚毫米级的动作补偿策略,优化操作的精细度 | 浙江大学官方技术白皮书 | 突破了传统大模型动作生成精度不足的限制 | 工业抓取任务的位置误差从5mm降低到0.2mm以内 |
| 经验防遗忘机制 | 新经验的加入不会覆盖旧有成熟技能,实现多任务技能的持续叠加沉淀 | 浙江大学官方技术白皮书 | 解决了传统AI学习新任务就“遗忘旧技能”的灾难性遗忘问题 | 智能体掌握100项不同技能后,旧技能的执行精度依然保持100%不下降 |
3. 技术边界与工程权衡
SkillRise框架主动放弃了传统大模型追求通用全场景能力的设计思路,把全部算力资源倾斜给实体智能体的实操技能迭代,用牺牲部分通用语义能力的工程权衡,换取了实体场景下极致的技能进化效率,完美适配工业机器人等需要长期打磨手艺的落地场景。
五、应用场景
1. 工业精密装配机器人场景
- 目标用户/行业:3C电子制造企业、精密仪器生产厂商
- 具体应用形式:搭载SkillRise框架的装配机器人,在反复执行精密零件装配任务的过程中,自主打磨操作精度,越装越准
- 核心价值主张:解决传统工业机器人装配精度固定、无法自主优化的痛点,大幅提升精密装配的良品率
- 落地案例/合作进展:已有多家浙江本地的3C制造企业启动试点验证
- 版本与准入条件:开源版本支持直接对接主流工业机器人控制器
2. 家庭服务机器人场景
- 目标用户/行业:家用服务机器人企业、家政机器人研发团队
- 具体应用形式:家庭机器人在长期服务过程中,根据不同家庭的环境习惯,自主优化拖地、整理物品等技能,适配不同家庭的个性化需求
- 核心价值主张:让家用机器人越用越贴合用户的使用习惯,避免千机一面的同质化体验
- 落地案例/合作进展:暂无公开大规模落地案例,处于原型验证阶段
- 版本与准入条件:开源版本支持二次开发适配家用机器人平台
3. 特种作业机器人场景
- 目标用户/行业:消防机器人、勘探机器人研发机构
- 具体应用形式:特种机器人在多次执行危险作业任务后,自主沉淀复杂极端环境下的操作经验,后续同类任务的生存能力与完成率大幅提升
- 核心价值主张:让机器人在一次次实战中积累极端场景经验,不用人类冒险进入危险环境收集训练数据
- 落地案例/合作进展:暂无公开落地案例,处于技术对接阶段
- 版本与准入条件:开源版本支持定制特种作业专属经验沉淀模块
4. 传统工艺传承机器人场景
- 目标用户/行业:非遗工艺保护机构、传统制造业企业
- 具体应用形式:机器人在反复执行传统手工工艺的过程中,自主打磨技艺细节,复刻老工匠的手艺,实现传统工艺的数字化传承
- 核心价值主张:把老工匠的经验转化为机器人可自主迭代的技能,解决传统工艺后继无人的传承痛点
- 落地案例/合作进展:浙大团队已在青瓷烧制、木雕打磨等非遗场景完成初步技术验证
- 版本与准入条件:开源版本支持针对传统工艺场景做快速定制
六、定价与开放策略
| 项目 | 详情 |
|---|---|
| 开放授权模式 | 完全开源,采用宽松的学术与商业友好协议,支持科研与产业场景的免费使用 |
| 配套资源开放 | 同步开放框架核心代码、工具链、10个示范场景的经验数据集,降低用户入门门槛 |
| 后续支持计划 | 浙大团队将联合合作企业持续迭代框架,定期发布新的技能适配模块 |
七、行业横向对比
| 维度 | 浙大SkillRise框架 | 传统智能体学习框架 | 通用大模型微调方案 |
|---|---|---|---|
| 经验沉淀方式 | 智能体自主从无标注实操数据中提取经验,零人工介入 | 依赖人工标注新数据,手动启动微调流程 | 需要大量标注数据,全流程微调大模型参数 |
| 迭代算力成本 | 仅需极低算力维护经验库,几乎无额外训练成本 | 每次微调都需要消耗中等规模算力资源 | 每次全量微调都需要消耗大量GPU算力,成本极高 |
| 技能进化模式 | 模拟老工匠熟能生巧,越干越熟练 | 一次性训练完成后能力基本固定 | 每次微调只能针对性提升单一任务能力,容易遗忘旧技能 |
| 实体场景适配度 | 原生针对机器人等实体智能体设计,适配度极高 | 从通用AI方案改造而来,实体场景适配需要大量二次开发 | 偏向数字场景,实体机器人动作生成精度不足 |
八、产业链影响分析
1. 上游影响
工业机器人的AI升级门槛大幅降低,中小机器人企业不需要投入海量算力资源,就能让自家产品拥有自主进化能力,整个工业机器人行业的智能化迭代速度将明显加快。
2. 下游影响
制造企业部署的工业机器人,不用反复找服务商升级算法,就能在日常生产中自主提升良品率,大幅降低产线的长期运维成本,提升生产效率。
3. 行业生态
实体AI智能体的能力成长范式被彻底改写,过去“训练一次用几年”的模式将逐步被淘汰,“越干越聪明”的终身进化模式会成为未来实体智能体的标准配置。
九、已知限制
| 限制项 | 说明 |
|---|---|
| 泛化边界 | 目前框架的经验迁移能力主要覆盖同类相似任务,跨领域的远距离技能迁移能力还在持续优化中 |
| 初始技能门槛 | 智能体需要具备基础的初始任务执行能力,框架才能在此基础上做经验沉淀与优化,无法从零凭空生成全新技能 |
| 场景适配深度 | 目前针对工业装配场景的适配最成熟,面向家庭服务、特种作业等场景的专属适配模块还在完善中 |
| 经验安全机制 | 大规模多智能体的经验共享与防污染机制还在迭代,避免错误经验在多设备之间传播的能力有待加强 |
十、团队与下一步计划
| 项目 | 详情 |
|---|---|
| 产业生态建设 | 联合国内更多机器人头部企业,搭建SkillRise产业生态,共同扩展不同工业场景的适配模块 |
| 版本迭代计划 | 持续优化经验迁移能力与安全机制,2027年推出面向大规模多智能体部署的企业级版本 |
| 落地推广计划 | 面向浙江本地制造企业推出免费的技术支持服务,加快框架在工业场景的规模化落地验证 |
总结
- 浙大推出的SkillRise框架,相当于给AI智能体安上了老工匠的“手艺大脑”,不用海量数据投喂,干得多就手艺好,实体AI智能体的落地进化终于找到了一条更接地气的新路子。
- AI Agent的跨任务迁移学习能力是走向通用智能体的关键瓶颈,SkillRise框架可能被Agent平台采纳以提升任务连续性和效率。
- 为解决AI智能体"健忘症"提供了新的端到端框架,让智能体从"每次从零开始"向"持续学习积累"演进,是通向更通用AI Agent的重要一步。
- 浙江大学官方发布公告
- SkillRise官方开源仓库
- 科技日报
- 机器人领域专家公开评价(多源印证)