谷歌的“机器人之脑”:Gemini Robotics ER 2与“物理AGI”的进击 2026年7月30日Google DeepMind正式发布Gemini Robotics ER 2模型。官方博客用一句话概括了它的定位——“一个高级大脑”。同一天谷歌在社交平台X上抛出了更直白的九个字“一个大脑。适用于任何机器人。”当特斯拉、Figure AI等玩家在机器人本体赛道上竞速时谷歌选择了一条截然不同的路径不造机器人只造机器人的“大脑”。Gemini Robotics ER 2的发布标志着这场“物理AGI”竞赛进入了一个全新的阶段。一、三层架构让机器人“思考”与“行动”分离Gemini Robotics 2并非单一模型而是一个由三个模型组成的分层系统。第一层是Gemini Robotics 2——视觉-语言-动作模型VLA将摄像头画面和自然语言指令直接转换为电机控制指令能够控制整个人形机器人从脚到指尖的每一个关节。与此前主要控制机器人上半身的模型不同Gemini Robotics 2实现了真正意义上的“全身控制”——机器人可以行走、下蹲、伸展、抓取完成“穿过房间、拿起洒水壶并将其放到架子上”这样需要全身协调的完整任务。第二层是Gemini Robotics ER 2——具身推理模型也就是本次发布的核心。它不直接控制电机而是充当机器人的“高级大脑”理解物理环境、规划多步骤任务然后将执行指令交给底层的VLA模型。官方演示中ER 2驱动Boston Dynamics的Spot机器人仅凭语音指令即可完成导航和物体抓取。第三层是Gemini Robotics On-Device 2——轻量级VLA模型经过优化可在机器人本地运行只需几小时数据就能适配全新的机器人本体。三层各司其职动作、规划、部署——这个架构本身就是谷歌的竞争宣言。二、连续视频理解从“停-想-动”到“边想边动”Gemini Robotics ER 2相比前代ER 1.6的核心突破在于连续视频流处理能力。传统机器人推理模型采用“停-想-动”模式——机器人必须先停下来思考再执行动作再停下来思考下一步。这种模式在物理世界中造成了明显的卡顿和不自然。ER 2通过接入Gemini Live API的双向流式端点实现了同步推理——机器人在执行当前动作的同时已经在规划后续步骤。在性能数据上ER 2交出了一份扎实的答卷任务进度分类准确率达57.4%帮助机器人在不重启整个工作流的情况下修正失败步骤关键时刻定位准确率达91.3%平均时间误差仅0.96秒——比如判断“何时停止向杯中倒咖啡”执行速度是ER 1.6的4倍满足现实机器人安全运行所需的亚秒级延迟要求128,000 Token的上下文窗口足以处理数分钟连续视频流更值得注意的是ER 2可以原生调用Google Search或开发者自定义函数。这意味着机器人遇到不确定的情况时可以直接“上网查”——这是具身智能走向实用化的关键一步。三、多机器人协作第一次让不同的“身体”共享同一个“大脑”Gemini Robotics ER 2首次引入了多机器人协作机制。在官方演示中Apptronik公司的Apollo 2人形机器人与Franka F3 Duo机械臂平台成功展示了跨设备协同作业。不同类型的机器人借助ER 2提供的共享语义理解可以实时沟通、分工配合、交接任务完成单台设备无法独立完成的复杂工作流。这一能力的意义远超技术演示本身。它揭示了一个趋势未来的机器人生态可能不是“一个机器人干所有事”而是“一群各有所长的机器人共享同一个智能系统协同作战”。而谷歌想要的正是这个“共享的智能系统”。四、安全从“可选项”到“必答题”当AI模型开始控制物理世界中的人形机器人时安全不再是锦上添花而是生死攸关。谷歌在ER 2上采取了多层次安全防护策略。ER 2被官方称为“迄今为止最安全的机器人模型”——它能更好地检测人类是否靠近触发安全工具调用并在有人过于接近时将机器人带至安全停止状态。谷歌还推出了名为ASIMOV-Agentic的安全评测基准专门测试推理模型作为“编排者”时是否安全——能否拒绝不安全的工具调用、判断物理可行性、在不确定时寻求人类帮助。不过谷歌在模型卡中明确禁止开发者将机器人模型用于医疗和交通运输等安全关键领域。这说明即便技术突飞猛进“物理AGI”距离真正进入高风险场景仍有距离。五、行业变局谷歌押注“Android时刻”Gemini Robotics ER 2的发布本质上是谷歌对整个机器人行业的一次战略卡位。当前人形机器人赛道的主流玩家——特斯拉、Figure AI——走的是垂直整合路线自研模型、自研执行器、自建工厂。而谷歌的选择截然相反做一个开放的、适用于任何机器人的智能层。DeepMind负责人Demis Hassabis曾表示他希望为机器人构建一个类似Android的操作系统。如果这一愿景实现任何机器人硬件厂商都可以搭载谷歌的“大脑”就像任何手机厂商都可以搭载Android一样。谷歌不参与机器人本体的制造竞赛却可能成为所有机器人背后的平台级赢家。在商业落地层面ER 2已通过Gemini API和Google AI Studio向开发者公开提供并在Gemini企业智能体平台开启私密预览。首批合作伙伴包括Apptronik、Agile Robots SE、Boston Dynamics等。第一波应用场景将集中在仓库分拣、设施巡检、实验室任务等风险相对可控的领域。 结语Gemini Robotics ER 2的发布标志着具身智能从“实验室玩具”向“可部署系统”迈出了实质性的一步。连续视频理解、同步推理、多机器人协作、工具调用——这些能力叠加在一起正在将一个曾经只存在于科幻中的概念变成现实一个能看、能想、能规划、能协作的机器人“大脑”。谷歌不造机器人但谷歌想成为所有机器人的“大脑”。这条路能否走通尚需时间检验但有一点已经清晰物理世界与AI的交汇正在以前所未有的速度加速。而当这场加速发生时谁掌握了“大脑”谁就掌握了主动权。