⚡ 要闻简报

Gemini Robotics 2实现人形机器人全身控制

🕐 2026.07.31 星期五 来源 · Google 🔥 39 次点击

谷歌DeepMind发布Gemini Robotics 2三模型栈,实现对人形机器人从头到脚的全身控制、多步骤任务规划、多机器人协同及边缘设备快速适配,是谷歌十年机器人战略重启以来最重要发布。

Gemini Robotics 2实现人形机器人全身控制

Google DeepMind通过官方博客正式官宣发布Gemini Robotics 2,是继2025年Gemini Robotics初代、1.5版本后的重大迭代,被业界视为通用机器人“大脑”的核心突破,谷歌借此推进“机器人界的Android”开放生态战略。

Gemini Robotics 2包含三个模型:

核心VLA模型Gemini Robotics 2负责将视觉+语言指令直接映射为全身电机控制;

Gemini Robotics ER 2作为高层推理系统,负责任务分解、进度追踪、多机器人协同与人机沟通;

Gemini Robotics On-Device 2则是面向本地运行的低延迟VLA模型,可在数小时内用少于200个样本适配全新机器人硬件。


一、三个模型的分工与核心能力

1.Gemini Robotics 2(VLA执行模型)‌

核心定位‌:机器人的“执行系统”,将视觉信息和自然语言指令直接转化为电机控制指令。

核心突破‌:首次实现人形机器人从头到脚的全身控制,覆盖行走、下蹲、伸展、物体操控等全动作,前代仅支持上半身控制。

精细操作能力‌:可驱动22自由度五指灵巧手完成打结、封拉链袋等任务,“拧下灯泡”任务成功率达‌92%‌。

面向工业场景的高精度单机器人作业,比如工厂内的精密零件装配、物料全流程转运,可直接完成从行走取物到精准放置的连贯动作。

2.Gemini Robotics ER 2(具身推理模型)‌

核心定位‌:机器人的“高层大脑”,负责理解物理世界、规划多步骤任务、协调多机器人协作。

核心能力‌:可管理持续数分钟、涉及数百次决策的长流程任务,动作出错时能自主调整,还原生支持调用Google Search获取外部信息。

安全性能‌:安全指令遵循准确率达‌97.9%‌,1米范围内人体检测准确率达93.0%,人员靠近时可自动停机。

面向复杂多任务场景的全局调度,比如多台机器人协同完成仓储分拣、家庭环境下自主规划全屋清洁+物品整理的长流程任务,还能实时应对突发干扰调整执行路径。

3.Gemini Robotics On-Device 2(端侧本地模型)‌

核心定位‌:面向离线场景的轻量化运行模型,无需联网即可在机器人硬件本地运行。

核心优势‌:大幅降低运行延迟,仅需几小时数据和不到200个示例,就能快速将模型迁移至全新机器人本体,实现“一套大脑适配任意机器人”的通用性。

二、生态开放与合作进展

开发者开放渠道‌:ER 2已通过Gemini API、Google AI Studio向公众开放,企业级版本在Gemini Enterprise Agent Platform提供私有预览。

合作伙伴范围‌:Robotics 2和On-Device 2率先向早期合作伙伴及100多家受信任测试机构开放,合作方包括Apptronik、波士顿动力、Agile Robots SE等头部机器人企业。

实测演示效果‌:搭载该系列模型的人形机器人Apollo 2,可独立完成“穿过房间→拿起洒水壶→绕过障碍物→放到低层架子”的全流程任务。

面向无稳定网络的离线场景,比如户外巡检机器人、特种作业机器人,无需依赖云端即可完成全部感知与动作决策,保障作业稳定性。


在官方演示中,Apptronik Apollo 2人形机器人在单一自然语言指令"把洒水壶放到下层架子的绿色箱子里"下,完成行走、拾取、下蹲、放置等全流程动作。系统对"拧下灯泡"任务成功率达92%,但在扎垃圾袋、封密封袋等精细灵巧操作中成功率仍较低。DeepMind同步发布ASIMOV-Agentic安全基准与安全报告,评估机器人识别不确定性和拒绝高风险指令的能力。

资料来源
  1. Google
← 返回 [资讯]