谷歌DeepMind发布Gemini Robotics 2,人形机器人进入“全身智能”新阶段
8月4日,谷歌DeepMind发布新一代机器人基础模型Gemini Robotics 2,包含三款模型,首次实现人形机器人全身控制、精细操作与多机协作,并配套端侧模型与安全基准。在Apptronik的Apollo 2人形机器人上,该系统已能完成从行走、搬运到拧灯泡等复杂任务,具身智能从“上半身演示”走向“全身作业”。
8月4日,谷歌DeepMind正式推出Gemini Robotics 2,定位为面向人形机器人及多类型机器人的AI模型系列,强调全身控制、精细操作与多机器人协作能力。该系统目前在Apptronik公司的Apollo 2人形机器人上进行演示,机器人已能执行完整的全身自主动作,包括行走、蹲下、弯腰以及物体操控等复杂任务。
此次发布包含三款模型:
- Gemini Robotics 2:视觉-语言-动作(VLA)模型,将视觉和语言指令转化为机器人动作,支持对完整人形机器人及双臂系统的控制;
- Gemini Robotics ER 2:具身推理模型,负责多步骤任务规划、人机交互和多机器人协同作业,可对任务执行进行数分钟级的持续管理,并在执行过程中监控进度、从失败中恢复;
- Gemini Robotics On-Device 2:优化后的端侧VLA模型,可直接在机器人硬件本地运行,仅需不到200个训练样本和数小时即可适配新的双臂机器人平台,适合云端连接受限的工业场景。
在能力层面,Gemini Robotics 2相比早期版本有三项关键升级:
- 全身控制:早期模型主要聚焦上半身操控,新模型可协调从“脚趾到指尖”的全身动作,在演示中,Apollo 2能够根据“将浇水壶放入底层货架上的绿色垃圾桶”的指令,自主完成跨房间行走、抓取和放置等动作;
- 精细操作:搭载五指SharpaWave仿人手的Apollo 2,在模型控制下可完成系垃圾袋、拧下灯泡等精细操作,也支持工业常见的平行夹爪,完成精密插件装配和物品打包;
- 多机协作:Gemini Robotics ER 2支持不同类型机器人之间的通信与协调,可共同完成复杂工作流程,并对任务执行过程进行持续管理,包括应对动态变化和异常恢复。
在安全性方面,谷歌DeepMind推出ASIMOV-Agentic基准测试,用于评估机器人在“拒绝不安全操作”“判断任务是否可安全完成”以及“请求人工干预”等方面的能力,同时Gemini Robotics ER 2具备人体感知能力,能在人员进入作业区域时自动触发安全停机。
从产业角度看,Gemini Robotics 2的发布有三层含义:
- 对于机器人本体厂商,可以更专注于硬件和执行机构,而把“大脑”交给基础模型提供商,软硬件解耦加速;
- 对于工业和服务场景,机器人从“完成单一动作”升级为“完成多步骤任务”,应用场景从搬运、装配扩展到维护、巡检等更复杂流程;
- 对于AI平台厂商,机器人基础模型正成为继云侧大模型之后的新战场,谁能在“跨本体适配、安全性和易部署”之间取得平衡,谁就更有可能成为行业“安卓”。
对应用企业而言,这类基础模型的出现,意味着部署和迭代机器人系统的门槛进一步降低。未来,更多中小型机器人公司可以通过适配通用基础模型,快速进入工业和服务场景,而不必从零训练“机器人大脑”。
来源:未来智机NexAIrobo官网
声明
仅提供信息展示服务,不对内容的真实性、准确性、完整性或合法性承担任何担保责任,在浏览、使用或引用此内容时,应自行判断内容的真实性和适用性,并承担由此产生的风险和责任。
