Google DeepMind 发布 Gemini Robotics 2:大模型长出“手“和“脚“,AI 正式进入物理世界
Google DeepMind 推出了 Gemini Robotics 2,将 AI 的能力从虚拟屏幕延伸到了现实的物理空间。这个模型能感知、理解并操控真实物体,DeepMind 研究者将其称为"物理 AGI"的开端。
技术实现:多模态模型加上"身体"
Gemini Robotics 2 基于 Gemini 多模态大模型,但针对物理交互做了深度微调。输入包括视觉、触觉、语言等多模态信号,输出为动作指令、抓取策略和路径规划。
相比前代,它在理解三维空间、物体物理属性和实时反馈上的提升显著。通过大规模模拟训练配合少量真实数据,模型能快速适应陌生场景——从未见过的工具,试几次之后就能学会正确使用。
物理 AGI 意味着什么?
AGI 是否必须在物理世界实现,业界一直有争议。文字和图像领域的 AI 已经很强了,但一碰到需要真正动手的事就卡壳。Gemini Robotics 2 在这个方向撕开了一道口子:模型知道杯子易碎,拿起时会轻放;能理解"把螺丝刀递给旁边的人"这种社会性指令。这种对物理属性和人类意图的整合,被认为是通往 AGI 的关键一步。
WIRED 科技编辑 Will Knight 认为这不只是机器人技术的进步,而是 AI 理解世界方式的转向。
真实世界的风险
AI 进了物理世界,出错的代价就变了。模型"幻觉"不再只是生成错误文字,而是可能撞翻东西、误伤人类。滥用风险同步升级——如果这类模型被用于自主武器系统或非法侵入设施,后果不是写检讨能解决的。数据隐私也更紧迫,机器人摄像头可以360度记录家庭和工厂里的人与物。
Google DeepMind 在论文中明确表示,Gemini Robotics 2 目前还处于研究阶段,部署需要配合安全外壳(力矩限制、急停开关)和社会监管框架。
信任比功能更重要
当 AI 真正长出"手"和"脚",面对的就不只是技术问题。伦理、法律、就业结构都会受到冲击。在追求 AGI 的路上,不能只盯着智力,还要给它穿上铠甲。一次失误就可能让公众对 AI 的信任崩塌。未来十年,物理与数字的融合会加速到来,但风险管控的优先级应该高于功能堆叠。
