2026 年 7 月 30 日,Google DeepMind 宣布 Gemini Robotics ER 2,8 月正式发布并经 Gemini API、Google AI Studio 向开发者开放,企业级 Gemini Enterprise Agent Platform 为私有预览。这不是一台你能买到的机器人,而是机器人的"大脑"。波士顿动力那个后空翻很震撼,但那是工程师逐帧写死的机械体操,换个环境立马歇菜;ER 2 解决的是另一层问题:该干什么、干得对不对、下一步怎么办。一句话,从遥控木偶到能边干边想的自主员工。这是本站 Mistral Robostral 单摄像头导航方案 之后具身智能赛道的又一条路,值得拆清楚。
先说清边界:本文基于 Google 官方博客、DeepMind 模型卡、Pulse2.0 等公开资料整理,截至 2026-08-11。文中 91.3% 等成功率数据为供应商自评估,非独立第三方测试结果;ER 2 属实验性质的早期能力,最终以官方披露为准。本文做趋势解读,非内部资料。
一、ER 2 是什么:不是机器人,是机器人的"项目经理"
先破除一个误区:Gemini Robotics ER 2 不是实体机器人。它是具身推理模型(Embodied Reasoning Model),负责帮机器人"想事情"。你可以把它理解成机器人的项目经理--接收摄像头画面、麦克风音频、传感器数据,判断现在该干什么、上一步做对了吗、下一步怎么走,然后输出决策指令交给机器人的身体(VLA 动作模型或机械臂)去执行。
根据官方模型卡,ER 2 基于 Gemini 3.5 Flash 构建,支持文本、图像、视频、音频交错输入,上下文窗口 128K tokens,输出可达 64K tokens。这意味着它能像看连续剧一样理解实时视频流,而不是看一帧做一次决策、间歇性失忆。它能记住几分钟前发生了什么,据此调整当前动作。
要特别强调一个区分:ER 2 是推理模型,输出的是决策指令("把红色方块放到蓝盒子里"),不是电机控制信号。把指令变成关节转动,还需要动作模型(VLA 2)这一层,而 VLA 2 目前仍受限。别把 ER 2 当成能直接驱动机器人的全套方案。
二、三个核心升级:连续视频流、多机器人协作、流式推理
| 能力维度 | ER 1.6(前代) | ER 2(当前) | 实际意义 |
|---|---|---|---|
| 视频理解 | 静态图像+短片段 | 连续视频流实时分析 | 机器人能看着自己干活,实时纠错 |
| 任务编排 | 单任务执行 | 多步骤复杂任务规划 | 能完成"煮咖啡再端给你"这类复合指令 |
| 协作能力 | 单机独立 | 多机器人协同 | 多台机器人共享空间、分工配合 |
| 进度追踪 | 无 | 91.3% 时刻定位准确率 | 精确知道进行到哪一步 |
| 自我纠错 | 有限 | 实时识别异常并调整 | 东西掉了能捡起来继续干 |
| 工具调用 | 不支持 | 支持 Google Search 与自定义函数 | 遇到不懂的能现查再干活 |
第一,连续视频流实时理解是这次最大的单点突破。以前的机器人视觉模型看静态帧,ER 2 看的是连续流,能追踪自己的进度、出错时自我调整、精确判断何时进入下一步。第二,多步骤任务编排加多机器人协作,让 ER 2 天然适合工厂、仓库这类多设备场景。第三,91.3% 的时刻定位准确率需打一个标注:这是供应商自评估,不是独立第三方测试,真实场景的长尾分布会让实际数字往下走,别直接拿去当量产承诺。
还有一项容易被忽略但很关键的升级--流式推理(Streaming Reasoning)。传统机器人规划完再执行、执行完再规划,中间全是停顿;ER 2 能在执行当前动作的同时预判下一步,边走边想、脚下不停。这对工业场景的流畅度是质的提升。叠加 Google Search 与自定义函数调用,机器人遇到不认识的物件能现查资料再干活。
举个具体场景:仓库里两台机器人,一台分拣、一台码垛。以前的方案要么各干各的互不感知,要么靠中央调度器硬编排。ER 2 让两台机器人共享同一个推理上下文,自己协调谁先谁后、谁让谁过道,等于把项目经理装进了每台机器里。这对多设备产线意味着可以用更轻的中央调度、更重的端侧自主,降低单点故障的连锁影响。
三、谷歌的算盘:不做硬件,做大脑供应商
谷歌这步棋很清楚:它不造机器人本体。特斯拉死磕 Optimus 的硬件量产,Figure AI 绑定 OpenAI 做垂直整合,谷歌选了第三条路--把 ER 2 做成开放平台,谁都能用。
| 维度 | 谷歌 ER 2 | 特斯拉 Optimus | Figure AI |
|---|---|---|---|
| 核心优势 | 基础模型+开放生态 | 硬件量产+工厂自研 | 垂直整合+场景聚焦 |
| 商业模式 | 卖大脑(API/平台) | 卖身体(人形机器人) | 卖整体解决方案 |
| 开放程度 | API+AI Studio 开放 | 封闭自用 | 半开放、企业合作 |
| 关键短板 | 不碰硬件,依赖第三方本体 | 模型能力相对单一 | 生态不够开放 |
这个定位的野心在于"机器人领域的安卓时刻":安卓不造手机却统治了手机操作系统,谷歌想成为所有机器人的统一大脑。一旦跑通,护城河比卖硬件深得多--硬件会迭代、会降价,但嵌进本体的推理模型换一次成本极高。
四、安全牌与冷思考
机器人大脑再聪明,安全不过关就是定时炸弹。谷歌同步推出 ASIMOV-Agentic 安全基准,专门测机器人在不确定性下的决策:是否拒绝不安全的工具调用、能否预判任务可行性、不确定时会不会主动请求人类介入。ER 2 在人类接近检测上也有提升,能感知人靠近并触发安全停止--这是从实验室走向工厂的协作安全通行证。
冷思考要泼三盆水。第一,ER 2 是推理层,动作模型 VLA 2 仍受限,"想得对"不等于"做得稳",手眼协调的最后一公里还没合龙。第二,官方成功率是供应商自评估,基准环境再难也是可控设定,真实世界的长尾场景无穷无尽,实验室数字到产线必然打折。第三,这些都是实验性质的早期能力,家庭场景离落地还远--成本、安全、可靠性三座大山都没翻过去。近期现实的落地集中在 B 端:工业上下料装配、物流分拣码垛、实验室样品处理,这类容错率相对高、泛化需求强的场景正好是 ER 2 的甜区。工业场景容错机制成熟,一次失败可以重来,且有围栏、急停等物理防护兜底;家庭场景一次失误可能伤人,安全冗余完全不是一个量级。所以别被模型能力唬住就畅想家庭管家,B 端才是这一代推理模型的用武之地。
五、对开发者的实际影响
开发者现在就能通过 Gemini API 和 Google AI Studio 调用 ER 2,企业级功能走 Gemini Enterprise Agent Platform 私有预览。上手时记住三件事:ER 2 输出的是决策指令,你得自己写一层转换逻辑把文本指令映射到机器人动作;生产部署必须配安全约束(人类接近检测、急停逻辑),别裸奔上线;别把 ER 2 的推理能力等同于整套机器人方案,动作层、感知层、安全层各自有独立门槛。
对做技术选型的人,谷歌"大脑供应商"路线意味着你可以专注本体和场景,把推理外包给 ER 2。但命脉握在别人手里的风险也要掂量--API 定价、模型迭代节奏、可用性都取决于谷歌。和 Mistral Robostral 对照看更有意思:Mistral 7 月中走的是单摄像头压低感知成本的路线,谷歌走的是多机器人协作加流式推理的大脑路线,两条路都在解同一个问题--让机器人别再当木偶。
如果你已经在用 Gemini 生态(Gemini API、Vertex AI),接入 ER 2 的迁移成本最低,模型卡和官方示例都现成。如果用的是其他大模型栈,要评估的是多模态视频理解这一项 ER 2 是否真的领先到值得跨栈--别为了一个能力全家桶迁移。另外盯紧谷歌的定价策略:推理模型按 token 计费,连续视频流输入的 token 消耗远高于文本,工业场景长时间跑产线前先算清账。
六、常见问题
Q:ER 2 是机器人吗?能买到吗? A:不能。ER 2 是具身推理模型,不是实体机器人。它负责"想",执行靠 VLA 动作模型和机械臂。目前经 Gemini API 和 Google AI Studio 开放,企业级功能在 Gemini Enterprise Agent Platform 私有预览。
Q:91.3% 准确率靠谱吗? A:要打折看。这是供应商自评估,非独立第三方测试。基准环境是可控设定,真实世界长尾场景会让实际数字往下走。别直接拿去当量产承诺。
Q:ER 2 和 VLA 2 是什么关系? A:ER 2 是推理模型,输出决策指令(该干什么);VLA 2 是动作模型,负责把指令变成电机控制信号(怎么动)。ER 2 开放调用,VLA 2 目前仍受限。"想得对"不等于"做得稳"。
Q:流式推理是什么,为什么重要? A:传统机器人规划完再执行、执行完再规划,中间停顿多。流式推理让模型在执行当前动作的同时预判下一步,边走边想,减少停顿。对工业场景的流畅度是质的提升。
Q:谷歌和特斯拉 Optimus、Figure AI 比有什么不同? A:谷歌不造硬件,做"大脑供应商",把 ER 2 通过 API 开放给所有开发者;特斯拉走硬件量产路线,Figure AI 做垂直整合。谷歌赌的是"机器人领域的安卓时刻"--不造手机,统治操作系统。
参考来源
- Google 官方博客:Introducing Gemini Robotics ER 2 — https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-2
- Google DeepMind 模型卡:Gemini Robotics ER 2 Model Card — https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-Robotics-ER-2-Model-Card.pdf
- DeepMind 博客:Gemini Robotics 2 brings whole body intelligence to robots — https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots
- Pulse2.0:Google Gemini Robotics ER 2 Adds Multi-Robot Collaboration — https://pulse2.com/google-gemini-robotics-er-2-adds-multi-robot-collaboration-and-91-3-moment-finding-accuracy
- 本站相关:Mistral Robostral 单摄像头导航方案 | AI agent 工具调用横评 | CUA 开源资源 | Computer Use Agent 构建 SOP