The Keyword (blog.google)

Introducing Gemini Robotics ER 2

8.5内容质量
Introducing Gemini Robotics ER 2

TL;DR · AI 摘要

Google推出Gemini Robotics ER 2,通过视频理解与多机器人协作提升机器人在物理世界的任务执行能力。

核心要点

  • Gemini ER 2支持实时空间推理和多步骤任务规划
  • 通过视频流自我调整,提升机器人适应能力
  • 提供API和平台,开发者可构建物理AI代理

结构提纲

按章节快速跳转。

  1. 宣布推出Gemini Robotics ER 2模型,作为机器人领域的突破性进展。

  2. 模型实现实时空间推理、多步骤任务规划和跨机器人协作。

  3. 相比ER 1.6版本,新增视频流自我调整和多机器人协作功能。

  4. 支持复杂物理任务执行和多机器人协同工作流程。

  5. 通过Gemini API、AI Studio和企业平台开放访问。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Gemini Robotics ER 2
    • 核心功能
      • 空间推理
      • 任务规划
      • 多机器人协作
    • 技术特性
      • 视频流自适应
      • 工具调用能力
    • 获取途径
      • Gemini API
      • AI Studio
      • 企业平台

金句 / Highlights

值得收藏与分享的关键句。

#Gemini#机器人#AI模型#Google
打开原文

Gemini Robotics ER 2

介绍 Gemini Robotics ER 2

2026年7月30日

|

分享下拉菜单

  • x.com
  • Facebook
  • LinkedIn
  • 邮件
  • 复制链接

Gemini Robotics ER 2 在通过视频理解、任务编排和多机器人协作来驱动机器人方面实现了重大突破,使机器人在物理世界中能够更加高效地协助人类。

Steven Hansen

高级软件工程师

Peng Xu

软件工程师

分享

阅读AI生成的摘要

我们推出了 Gemini Robotics ER 2,这是一个专为机器人设计的新型模型,可作为机器人的高级“大脑”。它能够实现实时空间推理、多步骤任务规划以及不同机器人之间的协作。您现在可以通过 Gemini API、Google AI Studio 或 Gemini Enterprise Agent Platform 访问该模型,开始构建自己的物理AI代理。

摘要由 Google AI 生成。生成式AI尚处于实验阶段。

Google 刚推出了 Gemini Robotics ER 2,它就像机器人的智能大脑一样。它帮助机器人快速思考、规划多步骤任务,甚至与其他机器人协作。该模型使机器人能够观看视频流以跟踪自身进度,并在实时环境中纠正错误。它的设计目标是让机器人在现实世界中更加安全和有用。

#### 探索其他风格:

  • 一般摘要
  • 基础说明

文章正文

为了让机器人在日常环境中协助人类,精确的空间推理是不够的。机器人还必须快速思考,以物理世界实时的速度进行决策和推理。

这就是我们今天推出 Gemini Robotics ER 2 的原因,这是我们最强大的“具身推理”模型。将 Gemini Robotics ER 2 视为机器人的高级大脑。它使机器人能够与人类交流、理解物理世界并规划多步骤任务。然后,它会将运动执行交给任何给定的低级视觉-语言-动作(VLA)模型。Gemini Robotics ER 2 还可以原生调用 Google 搜索等工具来查找信息,或任何其他用户定义的函数。Gemini Robotics ER 2 的设计使机器人能够在执行动作的同时“思考”下一步该做什么。

Gemini Robotics ER 1.6 相比,Gemini Robotics ER 2 有了显著的升级。通过观看连续的视频流,机器人现在可以跟踪自己的进度,如果出现问题可以进行调整,并准确知道何时进入下一步。我们还引入了多机器人协作功能,使机器人能够在共享空间中协作,完成单个机器人无法独立完成的复杂工作流程。

现在,开发者可以通过 Gemini API、Google AI Studio 以及 Gemini Enterprise Agent Platform 的私有预览版访问 Gemini Robotics ER 2。为了帮助您入门,我们将分享如何配置模型并提示它以实现更有用的物理AI任务的示例。

提升物理代理能力

物理世界中的大多数任务都很复杂,需要多个步骤才能完成。Gemini Robotics ER 2 是一个物理代理,它为机器人编排步骤,使其能够自我纠正,并推广到更多新颖的情况。要构建一个代理设置,开发者可以将低级控制接口(如视觉-语言-动作(VLA)模型或导航API)声明为工具,并直接将多模态视频、音频或文本流式传输到模型中。

Gemini Robotics ER 2 改进了这一工具协同工作流程。我们可以通过仿真环境中的机器人评估其性能,使用真实世界的机器人控制,甚至可以与远程控制机器人的人员配合。

Gemini Robotics ER 2 在三种控制模式(真实 VLA、仿真 VLA 和人工远程操作)中,始终优于 ER 1.6 的工具协同表现。

在机器人领域,高层推理依赖于执行速度。Gemini Robotics ER 2 集成到 Gemini Live API 中,使用专为低延迟任务优化的双向流式端点。结果实现了流畅的协同操作:Gemini Robotics ER 2 指挥动作模型和机器人 API 完成多步骤任务,无需出现令人不适的“停止-思考”暂停。为说明这一点,我们与波士顿动力公司的合作伙伴共同开发了一个演示。我们使用 Gemini Robotics ER 2 协同 Spot 的 API(如导航和机械臂移动),创建了一个交互式机器人,可以为您取物。

Gemini Robotics ER 2 驱动波士顿动力 Spot 机器人,通过自然语言指令获取零食。

代码可在 GitHub 上获取,附带其他示例。

为稳健的任务完成解锁时间智能

机器人领域最具挑战性的难题之一是判断任务何时完成。Gemini Robotics ER 2 在视频理解和进度跟踪方面实现了重大突破,能够验证复杂任务(如拧紧灯泡或系紧垃圾袋)是否按规范完成,然后再切换到下一个任务。

在此次更新中,我们在任务进度理解的两个基础能力上取得了进展:进度分类和关键帧识别。

连续进度分类

进度分类是指机器人追踪任务完成进度的能力。在我们的评估中,我们将视频流中的每一帧分配到五个进度等级(0-20%、20-40%、40-60%、60-80%、80-100%)。通过量化任务进度,Gemini Robotics ER 2 为机器人提供实时态势感知,使其能够随时调整动作或重试失败步骤,而无需重启整个工作流程。

Gemini Robotics ER 2 在进度分类任务中实现了 57.4% 的准确率,优于前代模型和竞品前沿模型。

精确关键帧识别

关键帧识别衡量模型识别关键事件发生的确切视频帧的能力(例如何时停止向杯子倒咖啡)。Gemini Robotics ER 2 在关键帧识别任务中实现了显著的性能提升,使机器人能够精确切换任务、验证成功并提出修正建议。

在关键帧识别任务中,Gemini Robotics ER 2 的准确率达到 91.3%,平均绝对距离为 0.96 秒。它与更大规模的模型类别表现相当,但计算成本仅为它们的几分之一,执行速度是它们的 4 倍——这种亚秒级延迟实际上是安全操作物理机器人所需的真正延迟。

多机器人协作

没有一种机器人能胜任所有任务——轮式探测器在室内表现优异,而人形机器人可能在复杂地形中更胜一筹。Gemini Robotics 2 实现了多机器人协作,使不同机器能够通过共享语义理解进行通信,实现任务交接和完成复杂任务。点击此处查看 Gemini Robotics ER 2 如何使 Apptronik 的 Apollo 2 和 Franka F3 Duo 协同工作。

提升通用空间智能

Gemini Robotics ER 2 在三项基准测试中显著提升了核心空间推理能力:

  • 成功/失败检测:现在通过实时视频流而非静态截图进行分析,可及时捕捉执行过程中的中间失败情况(如液体泼洒、滑倒或对齐错误)。
  • 通用仪器读取:突破传统圆形仪表盘和液位计的限制,新增对数字显示屏、线性刻度尺、量规和液体温度计的支持。我们已在10种不同仪器上进行了验证。
  • 增强型空间视觉问答:通过Gemini在多模态理解方面的突破,显著提升视觉问答(VQA)能力。

Gemini Robotics ER 2 在所有核心能力指标上均保持最高准确率,尤其在成功检测(图像/视频)问答能力(ERQA)通用仪器读取方面表现突出。

为具身智能提升安全性

Gemini Robotics ER 2 是目前最安全的模型,在安全指令遵循人类 proximity(接近度)基准测试中取得显著进展。这两个基准测试评估模型在推理任务中遵守物理约束的能力,以及空间感知检测人类的能力。我们发现,当检测到人类靠近时,Gemini Robotics ER 2 能够自动停止人形机器人,且仅在确认区域安全后才会恢复工作。为提升物理智能体的安全性,我们推出了新基准测试,用于评估基础模型作为安全VLA(视觉-语言-动作)协调器的能力,包括安全约束执行、环境监控、物理可行性评估和请求人工澄清等能力。详见我们的安全技术报告。

Gemini Robotics ER 2 在安全指令遵循人类 proximity(接近度)基准测试中优于 ER 1.6 和其他前沿模型。

展望未来,我们将推动这些模型承担更复杂的任务,加速有益机器人的发展,并支持机器人技术社区。

订阅谷歌最新资讯

订阅我们的电子报,获取产品更新、活动信息、特别优惠等资讯。

订阅完成,只需再确认一步。

请查看邮箱确认订阅。

您也可以使用其他邮箱地址订阅。

您的信息将按照Google隐私政策使用,您可随时取消订阅。

发布于: /