Google DeepMind 发布 Gemini Robotics-ER 1.6,强化具身推理与仪表读数
Gemini Robotics-ER 1.6: Powering real-world robotics tasks through enhanced embodied reasoning
Google DeepMind 发布 Gemini Robotics-ER 1.6,将其作为机器人的高层推理模型,强化空间与物理推理、多视角理解及任务成功检测,并新增仪表读数。
新版相对 Gemini Robotics-ER 1.5 与 Gemini 3.0 Flash 强化了空间指向、物体计数、多视角成功检测以及仪表读数能力,开发者现可在 Gemini API 与 Google AI Studio 中直接配置调用。
2026年4月14日 模型
Laura Graesser 和 Peng Xu
要让机器人真正在日常生活和各行各业中发挥作用,它们不能只是听从指令,还必须对物理世界进行推理。从在复杂设施中导航,到解读压力表上的指针,机器人的“具身推理”正是使其能够弥合数字智能与物理行动之间差距的关键。
今天,我们推出 Gemini Robotics-ER 1.6,这是对我们以推理为核心的模型的一次重大升级,使机器人能够以前所未有的精度理解其所处环境。通过增强空间推理和多视角理解能力,我们正在为下一代物理智能体带来全新水平的自主性。
该模型专注于机器人技术至关重要的推理能力,包括视觉与空间理解、任务规划以及成功检测。它充当机器人的高层推理模型,能够通过原生调用 Google Search 等工具来查找信息、调用视觉-语言-动作模型(VLA)或任何其他第三方用户定义函数来执行任务。
Gemini Robotics-ER 1.6 相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 均有显著提升,尤其增强了指向、计数和成功检测等空间与物理推理能力。我们还解锁了一项新能力:仪表读数,使机器人能够读取复杂的仪表和视镜——这一用例是我们与合作伙伴 Boston Dynamics 紧密协作中发现的。
即日起,Gemini Robotics-ER 1.6 已通过 Gemini API 和 Google AI Studio 向开发者开放。为帮助你快速上手,我们分享了一个开发者 Colab,其中包含如何配置该模型并针对具身推理任务进行提示的示例。
图 1:Gemini Robotics-ER 1.6 与 Gemini Robotics-ER 1.5 及 Gemini 3.0 Flash 模型的基准测试结果对比。仪表读数评估在启用智能体视觉的情况下运行(Gemini Robotics-ER 1.5 除外,因其不支持该功能)。所有其他评估均在禁用智能体视觉的情况下运行。单视角与多视角成功检测评估包含不同示例,因此不可比较。
指向:空间推理的基础
指向是具身推理模型的一项基础能力,并随每一代模型不断演进。点可用于表达多种概念,包括:
- 空间推理:精确的物体检测与计数
- 关系逻辑:进行比较,例如识别一组物品中最小的物品;定义“从-到”关系(例如将 X 移动到位置 Y)
- 运动推理:映射轨迹并识别最佳抓取点
- 约束遵循:对复杂提示进行推理,例如“指出每一个小到足以放入蓝色杯子中的物体”
Gemini Robotics-ER 1.6 可以将点作为中间步骤,对更复杂的任务进行推理。例如,它可以用点来计数图像中的物品,或识别图像上的显著点,以帮助模型执行数学运算,从而改进其度量估计。
下面的示例展示了 Gemini Robotics-ER 1.6 在指向多个元素,以及知道何时该指向、何时不该指向方面的优势。
Gemini Robotics-ER 1.6 正确识别出锤子的数量(2)、剪刀(1)、画笔(1)、钳子(6),以及一组园艺工具,这些工具既可被解释为单一群组,也可被解释为多个点。它不会指向图像中并不存在的所请求物品——独轮手推车和 Ryobi 电钻。相比之下,Gemini Robotics-ER 1.5 未能识别出正确数量的锤子或画笔,完全漏掉了剪刀,幻觉出一辆独轮手推车,并且在指向钳子时缺乏精度。Gemini 3.0 Flash 接近 Gemini Robotics-ER 1.6,但对钳子的处理不如后者。
成功检测:自主性的引擎
在机器人领域,知道一项任务何时完成,与知道如何开始它同样重要。成功检测是自主性的基石,充当关键的决策引擎,使智能体能够在重试失败的尝试与推进到计划的下一阶段之间做出智能选择。
在机器人领域实现视觉理解颇具挑战,需要将精密的感知与推理能力同广博的世界知识相结合,以应对遮挡、照明不佳和指令含糊等复杂因素。此外,大多数现代机器人配置都包含多个相机视角,例如俯视画面和腕部安装的画面。这意味着系统需要理解不同视角如何组合,从而在每一时刻以及跨越时间形成一幅连贯的画面。
Gemini Robotics-ER 1.6 推进了多视角推理,使系统能够更好地理解多路相机视频流及其相互关系,即便在动态或存在遮挡的环境中也是如此,如下方典型的多视角场景所示。
Gemini Robotics-ER 1.6 从多个相机视角获取线索,以判断任务“把蓝色笔放入黑色笔筒”何时完成。
仪表读数:真实世界的视觉推理
要理解 Gemini Robotics-ER 1.6 的一项关键优势,我们必须看看它如何将空间推理和世界知识等能力结合起来,以解决复杂的真实世界问题。一个完美的例子就是仪表读数。
这项任务源于设施巡检需求,这是我们在 Boston Dynamics 的合作伙伴的一个关键关注领域。工业设施中包含许多仪器——温度计、压力表、化学品视镜等——需要持续监测。Spot,一款 Boston Dynamics 机器人产品,能够走访设施各处的仪器并拍摄它们的图像。
Gemini Robotics-ER 1.6 使机器人能够解读各类仪器,包括圆形压力表、垂直液位指示器和现代数字读数显示。
仪表读数需要复杂的视觉推理。必须精确感知各种输入——包括指针、液位、容器边界、刻度线等——并理解它们彼此之间的关系。对于视镜而言,这涉及在考虑相机视角所造成畸变的情况下,估计液体填充视镜的程度。仪表通常带有描述单位的文字,必须加以读取和解读;有些仪表还有多根指针,分别对应不同的小数位,需要加以合并。
诸如仪表读数和更可靠的任务推理等能力,将使 Spot 能够完全自主地看见、理解并应对真实世界的挑战。
Marco da Silva
Boston Dynamics 旗下 Spot 副总裁兼总经理
Gemini Robotics-ER 1.6 通过使用 智能体视觉 实现高精度仪表读数,该方法将视觉推理与代码执行相结合。模型会采取中间步骤:首先放大图像,以更好地读取仪表中的细微细节,然后利用指向和代码执行来估算比例与间隔并得出准确读数,最终运用其世界知识来解释含义。
图 2:Gemini Robotics-ER 1.6 的不同要素如何共同促成仪表读数任务达到高水平表现。
精确读取模拟仪表
本示例展示了模型如何利用指向和代码执行进行缩放,从而将仪表读数精确到亚刻度。
我们迄今最安全的机器人模型
安全被融入我们具身推理模型的每一层级。Gemini Robotics-ER 1.6 是我们迄今最安全的机器人模型,在对抗性空间推理任务上,相较以往所有代际,它对 Gemini 安全政策 的遵循表现更优。
该模型在遵守物理安全约束方面的能力也大幅提升。例如,它会通过指向等空间输出,就夹爪或材料约束下哪些物体可以安全操作做出更安全的决策(例如,“不要处理液体”,“不要拾取重于 20kg 的物体”)。
我们还基于真实伤害报告,测试了模型在 文本和视频场景 中识别安全隐患的能力。在这些任务上,我们的 Gemini Robotics-ER 模型在准确感知伤害风险方面优于基线 Gemini 3.0 Flash(文本 +6%,视频 +10%)。
图 3:在检验遵守物理安全约束能力的安全指令遵循方面,Gemini Robotics-ER 1.6 相较 Gemini Robotics-ER 1.5 有显著提升。在指向上,它优于 Gemini 3.0 Flash,且两个模型在文本上的准确率都非常高。Gemini 3.0 Flash 在边界框上表现更好。
与我们合作,提升机器人的具身推理
我们致力于确保 Gemini Robotics-ER 为机器人社区提供最大价值。如果当前能力对你的专业应用存在局限,我们邀请你 提交此表单,并附上 10–50 张标注图像以说明具体失败模式,帮助我们构建更稳健的推理功能。我们期待与你合作,在后续版本中增强这些能力。
来源:Google DeepMind · deepmind.google