模型与研究

谷歌DeepMind发布 Gemini Robotics 2:机器人开始学会全身协作

谷歌 DeepMind 发布 Gemini Robotics 2,推出 ER 2、VLA 与 On-Device 版本,旨在将多模态理解扩展到全身协作与多机器人协同的现实世界控制。DeepMind 强调分层安全与部署挑战,同时展示了在多平台(如人形与机械手)上的演示与企业化路径。

谷歌DeepMind发布 Gemini Robotics 2:机器人开始学会全身协作

谷歌 DeepMind 发布 Gemini Robotics 2,推出 ER 2、VLA 与 On-Device 版本,旨在将多模态理解扩展到全身协作与多机器人协同的现实世界控制。DeepMind 强调分层安全与部署挑战,同时展示了在多平台(如人形与机械手)上的演示与企业化路径。

谷歌 DeepMind 在 2026 年 7 月 30 日发布 Gemini Robotics 2,试图把 Gemini 的能力从屏幕里的问答和内容生成,进一步推进到现实世界里的机器人控制。按照 Google DeepMind 官方博客 的说法,这套更新的重点不再只是让机器人“看懂”环境,而是让它们能够在更长链路上进行规划、协作,并完成全身动作;模型页则把它概括为“the intelligence layer to power any kind of robot”。

这次发布最受关注的部分是 Gemini Robotics ER 2。DeepMind 把它定义为一款 embodied reasoning 模型,负责接收指令、理解物理空间、拆解步骤,并在任务执行过程中与人类和其他机器人协同。与之配套的 Gemini Robotics 2 则是 vision-language-action(VLA)模型,负责把视觉和语言输入转化为具体动作控制;Gemini Robotics On-Device 2 则面向本地设备,强调快速适配不同机器人硬件。

机器人从“会动”走向“会想”

DeepMind 在官方说明里举出的例子,已经明显超出了传统机器人“固定路线、重复动作”的边界。公司称,Gemini Robotics 2 可以让 humanoid 机器人完成走路、下蹲、伸展、搬运和整理等组合动作,也可以在多机器人之间分工协作,把一项复杂任务拆成多个连续步骤。

在更具体的演示里,Google 说 Gemini Robotics 2 现在可以控制 Apptronik 的 Apollo 2 人形机器人,在房间里走动、拿起水壶,并把它放到指定位置;它也能控制五指、22 自由度的 SharpaWave 手,完成打结或封装密封袋这类细致操作。对于传统机器人更擅长的双指夹爪,模型也可以在 Franka Duo 平台上执行更复杂的抓取与打包任务。

DeepMind 同时表示,Gemini Robotics ER 2 已经可以在 Google AI Studio 上使用,并在 Gemini Enterprise Agent Platform 上处于私有预览;VLA 和 On-Device 版本则先向早期合作伙伴开放。Google Developers Blog 也在一篇配套文章里解释了,Gemini 2.5 的编码、推理和多模态能力,如何帮助开发者把空间理解、代码生成和机器人 API 连接起来,构建更复杂的机器人应用。那篇文章可见 Google Developers Blog

这条路线并不是突然出现的

从 Google 的公开节奏看,这次发布是过去一年多逐步推进的结果。2025 年 3 月,DeepMind 先推出 Gemini Robotics 与 Gemini Robotics-ER,强调让 Gemini 2.0 的多模态理解进入物理世界;随后在 2026 年 4 月,Google 又发布 Gemini Robotics-ER 1.6 推出,把重心放在空间逻辑、多视角理解、任务规划和仪表读数等能力上。AIFlux 在 迎来具身化的Gemini时代 一文里也曾梳理过 Google 在 I/O 2026 前后的全栈 AI 路线,机器人只是这条路线中的一个延伸方向。

这意味着 Gemini Robotics 2 不是单点升级,而是 Google 试图把通用模型、具身推理和机器人控制统一进同一套技术叙事:先让模型看懂物理环境,再让它决定下一步该怎么做,最后让它把决策变成动作。

安全、部署与商业化仍是关键问题

Google 在官方博客里把安全放在了很靠前的位置,表示其采取了从低层运动控制到高层语义理解的分层安全策略,并继续通过内部责任审查机制和外部专家合作来推进 embodied AI 研究。这个提醒并不意外:越接近现实世界的机器人系统,越容易把感知误差、空间判断失误和动作执行风险直接带到物理环境里。

外部媒体也基本沿着这一脉络解读这次发布。 Bloomberg 将其概括为 Google 把 Gemini 进一步推向“physical AGI”的尝试;WIRED 则把关注点放在了这种能力进入真实世界后的风险和约束上。

对 Google 来说,Gemini Robotics 2 的商业意义不只是展示更炫的演示视频,而是要证明这类能力能否稳定迁移到不同机器人本体、不同场景和不同任务里。DeepMind 这次把“whole body intelligence”“multi-robot collaboration”和“on-device adaptation”放在同一条产品线上,说明它希望机器人不再只是实验室里的单一平台,而是可以逐步走向通用硬件生态。

但在真正进入工厂、仓储、家庭或医疗等场景之前,这套系统还要回答几个现实问题:它在复杂环境下是否足够稳定,面对突发情况能否可靠重规划,部署成本是否可控,以及安全机制能否跟上能力扩展的速度。对机器人行业来说,Gemini Robotics 2 重要的不只是它现在能做什么,更是它把“机器人应该学会什么”这个问题,重新往前推了一步。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读