跳到正文
原文
Google DeepMind·· 2026-07-28精选AI 评分69

Gemini Robotics 2 为机器人带来全身控制、灵巧操作与多机协作

Gemini Robotics 2 brings whole body intelligence to robots

AI 导读

Google DeepMind 推出 Gemini Robotics 2,把视觉和语言输入转成电机控制,让完整人形机器人和双臂机器人完成从脚到指尖的全身动作与灵巧操作。

推荐理由

这次更新把原先的桌面上半身操作扩展到全身协调、灵巧操作和多机协作,并说明端侧模型可用数小时数据适配新机体。

正文 · AI 翻译

2026年7月30日 模型

Carolina Parada

从脚到指尖——我们正在教机器人掌握智能全身控制、精细灵巧操作与团队协作,以完成广泛的复杂任务

几十年来,我们一直梦想着机器人能够无缝融入我们的世界并伸出援手。如今,这一愿景向前迈出了重要一步。

大多数机器人都是为狭窄、重复的任务序列预先编程或远程操控的。它们缺乏真正自主学习或适应不可预测环境的能力。此外,将已学技能从一个机器人身体迁移到另一个仍然极其困难。要大规模应对最棘手的问题,各种形态和尺寸的机器人都需要 AI 模型,使其能够思考、行动并智能交互,从而安全地完成任务。

我们曾展示 Gemini 的多模态理解如何借助 Gemini Robotics 驱动现实世界中的行动。今天,我们推出 Gemini Robotics 2——为下一代真正可适应的机器人提供动力的智能层。随着它迈出字面意义上的第一步,这一重大进展解锁了智能全身控制、高级灵巧操作以及多机器人协作。

Gemini Robotics 2 使机器人能够对每一个动作进行推理,从而解锁广泛的任务。例如,它可以让人形机器人行走、蹲下、伸展并操控物体,以清理杂乱的房间。它甚至可以与其他机器人组队,更快地完成工作。而且,这种深厚的智能也可以在设备本地运行,同时在短短几小时内无缝适应全新的机器人身体。

我们通过三个能力强大的模型实现这一点:

  • Gemini Robotics 2:我们最先进的视觉-语言-动作模型(VLA),可将视觉和语言输入转换为电机控制,使机器人能够采取行动。该模型能够控制完整的人形机器人(从脚到指尖)以及其他双臂机器人。它还在双手和夹爪上带来了新水平的灵巧操作。
  • Gemini Robotics ER 2:我们能力最强的具身推理(ER)模型。它是一个视觉语言模型(VLM),充当我们的智能体,使机器人能够与人类交流、理解物理世界,并规划持续数分钟的多步骤任务。我们还引入了机器人作为团队协同工作的能力。
  • Gemini Robotics On-Device 2:我们最高效的视觉-语言-动作模型(VLA),经过优化可在机器人设备上本地运行。该模型现在只需数小时的数据,即可快速适应全新的机器人本体。

我们的推理模型 Gemini Robotics ER 2 现已在 Google AI Studio 上提供,并在 Gemini Enterprise Agent Platform 上进行私人预览。我们的 VLA 和 On-Device 模型向 抢先体验合作伙伴 开放。请在我们的 开发者博客 上阅读如何将这些模型引入你的硬件。

运动中的人形机器人:管理全身任务

这个世界是为人类的动作而建造的;它要求我们在狭窄、杂乱的空间中伸手、弯腰并保持平衡。虽然我们之前的模型控制人形机器人的上半身来完成桌面任务,但 Gemini Robotics 2 将物理 AI 扩展到了全身运动。

我们的模型首次能够控制整台人形机器人,将意图转化为智能的全身控制。例如,在控制 Apptronik 的 Apollo 2 人形机器人时,我们可以要求它“把浇水壶放进底层搁架上的绿色箱子里。” Apollo 会处理该指令,走到桌子旁,拿起浇水壶,再走几步到搁架处,并将其精确放到目标位置。虽然我们的机器人在移动速度上仍有提升空间,但这是迈向完成更复杂、需要全身协调的现实世界任务所需技能的重要一步。

为机械手与夹爪带来先进的灵巧能力

要在家庭和工作场所真正派上用场,机器人需要精细的操作能力。Gemini Robotics 2 在不同末端执行器上开启了全新水平的身体灵巧度,无论机器人使用的是机械手还是夹爪,都能让机器人比以往更加实用。

该模型现在可以控制 Apollo 2 机器人上的五指、22 自由度 SharpaWave 机械手,完成打结或封上自封袋等精细动作。它还可以操作 Franka Duo 平台上的标准双指平行夹爪,执行复杂的灵巧任务(例如紧密装箱)。我们正持续提升精度与速度,以实现人类水平的灵巧度。

借助智能体推理与多机器人协作,解锁高级任务

大多数现实世界任务都需要在较长时间内完成多个步骤。为应对这种复杂性,我们的具身推理(ER)模型 Gemini Robotics ER 2 充当机器人的高层大脑,处理用户指令并与人类沟通。它观察房间,推理完成任务所需的步骤,与 VLA 协调以执行动作,并跟踪进度直至任务完成。这一设置使机器人能够执行复杂的多步骤任务,在某一步失败时自我纠正,并泛化到新的情境与目标。

在此次更新中,我们让机器人能够更可靠地执行更长的任务序列,持续数分钟并涉及数百次决策。Gemini Robotics ER 2 现在能够理解任务何时开始与结束,并能精确定位关键事件发生的时刻,标志着进度理解方面的阶跃式进展。

此外,我们正在引入多机器人协作。这使不同类型的机器人能够相互沟通、协同工作,以解决单个机器人无法独自完成的复杂工作流程。

为任意机器人快速适配端侧模型

许多机器人应用需要在没有网络延迟或互联网连接的情况下运行。Gemini Robotics On-Device 2 专为应对这些限制而打造——它是我们最高效的视觉-语言-动作模型(VLA),经过优化可在机器人设备上本地运行。

该模型原生支持多本体,并继承了我们来自 Gemini Robotics 1.5 的先进“运动迁移”技术。我们现在只需数小时的适配时间,通常不到 200 个示例,就能适配新的双臂机器人本体。即使新本体在外形、传感器和自由度上差异极大,也同样适用,如下所示,Dexmate、SO101 和 Trossen 平台正在执行多样化的任务。

推进我们对安全、负责任机器人技术的承诺

安全是我们机器人研究的基础。随着机器人获得更多物理能力,我们致力于确保端到端的安全与对齐。在每次发布中,我们都采取了多层方法,将传统的物理安全措施与稳健的 AI 安全框架相结合。

Gemini Robotics 2 专门推进机器人安全,以应对现实世界的不确定性并与人类协作。

我们推出 ASIMOV-Agentic,这是一项用于智能体安全编排与不确定性消解的新基准。例如,它衡量具身推理智能体拒绝来自 VLA 的不安全工具调用的能力。它还衡量智能体预测任务是否可行、并在不确定时主动请求人类干预的能力。

此外,凭借增强的具身推理,Gemini Robotics ER 2 是我们迄今在安全约束遵循和人类接近度基准上最安全的机器人模型。它能更好地检测附近是否有人,触发安全工具调用,并在有人过于接近时使机器人安全停止。这是协作安全标准中的一项关键要求。阅读我们的 Gemini Robotics 2:安全技术报告 了解更多详情。

迈向通用物理 AI

Gemini Robotics 2 标志着在物理世界中解决 AGI 之路上的一个重要里程碑。释放机器人的真正潜力,需要从单任务自动化迈向通用智能。通过构建这一核心智能,我们的目标是让物理世界中的 AI 能够与人类并肩工作,解决复杂挑战。

探索 Gemini Robotics 2

致谢
本工作由 Gemini Robotics 团队开发:Abhijit Ogale、Abhishek Jindal、Adil Dostmohamed、Adrian Collister、Alan Thompson、Alessio Quaglino、Alex Bewley、Alex Hofer、Alex Taeho Kim、Alex X. Lee、Alex Zihao Zhu、Allen Chai、Amaris Paryag、Amit Hampaul、Amy Nommeots-Nomm、Amy Shen、Andre Araujo、Andrew Gallagher、Anirudha Majumdar、Anna Volosina、Annie S. Chen、Annie Xie、Anthony Brohan、Antoine Laurens、Arunkumar Byravan、Asaf Revach、Assaf Hurwitz Michaely、Baruch Tabanpour、Ben Moran、Benoit Landry、Bingyi Cao、Bogdan Mazoure、Brandon Hernaez、Brijen Thananjeyan、Bryan Anenberg、Caden Lu、Carl Doersch、Carolina Parada、Caroline Pantofaru、Charles Shu、Chengda Wu、Christine Chan、Christy Koh、Chuyuan Fu、Claire Cui、Clare Lee、Claudio Fantacci、Connor Schenck、David Rendleman、Deepali Jain、Demetra Brady、Dennis Li、Dhruv Shah、Dimple Vijaykumar、Dirk Ehrlich、Divya Garikapati、Dmitry Kalashnikov、Dre Mahaarachchi、Dushyant Rao、Erik Frey、Fangchen Liu、Federico Casarini、Francesco Nori、Francesco Romano、Frankie Garcia、Gabor Simko、Gautam Salhotra、Giulia Vezzani、Grace Popple、Grace Vesom、Graziano Misuraca、Guangyao Zhou、Hagen Soltau、Hanzi Mao、Hao-Tien Lewis Chiang、Harris Chan、Hila Noga、Howard Zhou、Ian Storz、Idan Lev-Yehudi、Ignacio Rocco、Inessa Konstanz、Isaac Reid、Ishita Prasad、Ivan Kapelyukh、J. Chase Kew、Jacky Liang、Jake Varley、James Susilo、Jasmine Hsu、Jerad Kirkland、Jeremy Plassmann、Jessica Lo、Jie Tan、Jimmy Yan、Jingwei Zhang、Jinyu Xie、Jose Enrique Chen、Joshua Ainslie、Joss Moore、Juanita Bawagan、Junkyung Kim、Justin Lidard、Kanishka Rao、Kathryn Quinn Shea、Kaustubh Sridhar、Keerthana Gopalakrishnan、Ken Caluwaerts、Kenneth Oslund、Khimya Khetarpal、Konstantinos Bousmalis、Krista Reymann、Krzysztof Choromanski、Ksenia Konyushkova、Kun Zhang、Kunal Aneja、Laura Graesser、Leen Verburgh、Leonard Hasenclever、Li-Heng Lin、London Chappellet-Volpini、Lucie Kerley、Maria Attarian、Maria Bauza Villalonga、Marissa Giustina、Max McCabe、Meet Kirankumar Dave、Mehdi S. M. Sajjadi、Metin Tokosz-Exley、Michael Neunert、Michael Noseworthy、Michiel Blokzijl、Miguel Rivas、Mithun George Jacob、Mitsuhiko Nakamoto、Mo Dawoud、Mohan Kumar Srirama、Mohit Sharma、Mohit Shridhar、Muinat Abdul、Murilo F. Martins、Nadav Olmert、Nathan Batchelor、Nicolas Heess、Niko Milonopoulos、Norman Di Palo、Oliver Groth、Ouais Alsharif、Padmini Copparapu、Parth Parekh、Paul Ruiz、Paul Wohlhart、Peide Huang、Peng Xu、Pengfei Xing、Peter Pastor、Petko Yotov、Phil Duffy、Philemon Brakel、Rachel Sterneck、Rajkumar Vasudeva Raju、Ravin Kumar、Razvan Surdulescu、René Wagner、Reza Sanatinia、Robert Baruch、Robert McDonald、Robert Moreno、Rohan Thakker、Roland Hafner、Ryan Doss、Sajjad Zafar、Sally Jesmonth、Sam Haves、Saminda Abeyruwan、Sandy Han Huang、Scott Crowell、Seliem El-Sayed、Sergey Yaroshenko、Sergio Martinez Abad、Serkan Cabi、Sharath Maddineni、Shuang Li、Sichun Xu、Silvia Cruciani、Skanda Koppula、Skye Yang、Soo Sung、Stefan Welker、Stefani Karp、Stefano Saliceti、Steven Hansen、Stuart Bowers、Sumeet Singh、Svetlana Grant、Takahiro Miki、Takuma Yoneda、Thomas Buschmann、Thomas Lampe、Thomas Power、Thor Schaeff、Tim Hertweck、Tingnan Zhang、Todd McInally、Todor Davchev、Tong Zhao、Travers Rhodes、Tsang-Wei Edward Lee、Vika Koriakin、Vikas Sindhwani、Wenhao Yu、Wentao Yuan、Xiaolin Fang、Yahav Nussbaum、Ying Sheng、Ying Xu、Yuheng Kuang、Yuxiang Yang、Yuxiang Zhou

感谢他们对此项工作的领导与支持:Jean-Baptiste Alayrac、Zoubin Ghahramani、Koray Kavukcuoglu 和 Demis Hassabis。我们谨向 Google 和 Google DeepMind 中为这项工作做出贡献的众多团队致以敬意,包括法务、市场营销、传播、责任与安全委员会、负责任开发与创新、政策、战略与运营,以及我们的业务与企业发展团队。我们要感谢机器人团队中上文未明确提及的每一位成员持续给予的支持与指导。最后,我们要感谢我们的合作伙伴:Apptronik、Boston Dynamics 和 Agile Robots 团队的支持。

来源:Google DeepMind · deepmind.google