黎曼动力联合光轮智能、诺亦腾冲刺全球首个100万小时具身智能数据底座
黎曼动力联合光轮智能、诺亦腾共同启动全球首个100万小时具身智能数据底座建设项目,通过三家企业在机器人硬件、动捕技术、AI算法领域的能力协同,采集覆盖多类真实场景的高质量具身行为数据,为通用人形机器人的训练提供规模化数据支撑。
刚拿下仿真与真机双SOTA的黎曼动力联合光轮智能与诺亦腾机器人,宣布共建具身智能数据底座。三方分工明确:黎曼动力负责机器人“大脑”与模型训练,光轮智能提供仿真基础设施,诺亦腾通过动作捕捉将人类动作迁移至机器人。联盟目标是到2026年底完成100万小时机器人训练数据采集,力争成为全球首个突破该规模的企业。据亿欧智库估算,当前全球高质量具身交互数据仅约50万小时,黎曼动力的目标相当于现有行业存量的两倍。
此前,黎曼动力已用23.2万小时数据训练出Riemann-1.0,初步验证了数据驱动具身模型的技术路线。该联盟试图将长期分散的采集、仿真、训练与评测环节打通,回答“机器人能否实现Scaling Law”这一核心命题。
一、发布背景
当前全球具身智能行业普遍面临高质量训练数据稀缺的痛点,公开可用的具身数据集总时长不足10万小时,远无法满足通用人形机器人的泛化能力训练需求,三家企业依托各自技术积累,联合攻坚百万小时级数据底座以填补行业空白。
二、核心升级
1. 数据规模升级
从当前行业主流的万小时级数据集,直接跃升至100万小时总时长,数据规模达到现有公开具身数据集总和的10倍以上。
2. 数据采集维度升级
从单一摄像头视觉采集,升级为动捕数据、多视角视觉、力觉传感器、关节力矩等多模态数据同步采集,单条数据的信息密度提升5倍以上。
3. 场景覆盖升级
从仅覆盖实验室单一场景,拓展至家庭、工业车间、户外巡检、办公等12类真实复杂场景,覆盖人形机器人90%以上的主流落地任务类型。
4. 数据标注标准升级
从人工简单标注,升级为AI辅助+动捕基准校准的高精度标注,动作轨迹标注误差控制在亚毫米级,远高于行业常规厘米级标注精度。
三、应用场景
1. 通用人形机器人基础运动能力训练场景
依托百万小时的行走、抓取、避障等基础动作数据,让机器人快速掌握基础运动技能,大幅缩短训练周期。
2. 复杂场景任务泛化训练场景
通过多场景的行为数据,提升机器人在非结构化环境下的自主决策能力,减少在新场景下的重新调试成本。
3. 具身大模型预训练场景
作为基础训练数据集支撑具身大模型的大规模预训练,提升模型的动作生成合理性与环境适配性。
4. 机器人行为安全对齐场景
通过海量合规安全的行为数据,训练机器人规避危险动作,降低实际落地运行中的安全事故概率。
四、三家企业技术分工与能力优势对照表
| 参与企业 | 核心技术分工 | 独家能力优势 | 负责项目环节 |
|---|---|---|---|
| 黎曼动力 | 具身智能算法框架设计、数据底座整体架构搭建 | 拥有自研人形机器人本体平台,可直接完成数据的闭环验证,是国内少数具备全栈具身算法研发能力的团队 | 数据底座的顶层设计、数据清洗标注算法开发、数据集最终的算法适配与测试 |
| 光轮智能 | 移动机器人采集硬件部署、多场景实地数据采集执行 | 拥有覆盖全场景的移动机器人采集车队,可快速完成家庭、工业、户外等复杂场景的规模化数据采集,采集效率是行业常规方案的6倍 | 12类真实场景的实地数据采集、多模态传感器的硬件校准与部署 |
| 诺亦腾 | 高精度动作捕捉技术支持、动作数据基准校准 | 拥有全球领先的亚毫米级动捕技术,可提供动作轨迹的绝对基准,解决行业内长期存在的动作数据标注精度不足的痛点 | 动捕数据同步采集、全数据集的动作精度校准、标注标准体系制定 |
项目协作核心逻辑补充
- 三家企业形成了“算法-硬件-精度校准”的完整闭环,避免了传统数据采集项目中“采集硬件与算法需求脱节”的常见问题。
- 所有采集到的数据会先通过诺亦腾的动捕基准校验,再进入光轮智能的多模态数据融合环节,最后由黎曼动力完成算法侧的适配与入库,全流程保障数据质量。
- 该项目的分工模式也为国内具身智能产业链的跨企业协作提供了可参考的样本,打破了此前各家企业数据封闭、重复采集的行业现状。
- 黎曼动力官方合作公告
- 光轮智能官方技术发布会信息
- 诺亦腾动捕技术公开介绍