前沿热点
前沿热点

Google 不造机器人做大脑:Gemini Robotics ER 2 让机器人边干边想

Google DeepMind 2026-07-30 发布 Gemini Robotics ER 2,8 月经 Gemini API/AI Studio 开放。具身推理模型让机器人边干边想:连续视频流理解、多机器人协作、流式推理、91.3% 进度定位(供应商自评非独立测试)。谷歌不造硬件做"大脑供应商",对标特斯拉 Optimus、Figure AI。

发布于 2026年8月11日7 分钟阅读
<!-- gemini-robotics-er-2-hotspot | hotspot | Google 不造机器人做大脑:Gemini Robotics ER 2 让机器人边干边想 -->

2026 年 7 月 30 日,Google DeepMind 宣布 Gemini Robotics ER 2,8 月正式发布并经 Gemini API、Google AI Studio 向开发者开放,企业级 Gemini Enterprise Agent Platform 为私有预览。这不是一台你能买到的机器人,而是机器人的"大脑"。波士顿动力那个后空翻很震撼,但那是工程师逐帧写死的机械体操,换个环境立马歇菜;ER 2 解决的是另一层问题:该干什么、干得对不对、下一步怎么办。一句话,从遥控木偶到能边干边想的自主员工。这是本站 Mistral Robostral 单摄像头导航方案 之后具身智能赛道的又一条路,值得拆清楚。

先说清边界:本文基于 Google 官方博客、DeepMind 模型卡、Pulse2.0 等公开资料整理,截至 2026-08-11。文中 91.3% 等成功率数据为供应商自评估,非独立第三方测试结果;ER 2 属实验性质的早期能力,最终以官方披露为准。本文做趋势解读,非内部资料。

一、ER 2 是什么:不是机器人,是机器人的"项目经理"

先破除一个误区:Gemini Robotics ER 2 不是实体机器人。它是具身推理模型(Embodied Reasoning Model),负责帮机器人"想事情"。你可以把它理解成机器人的项目经理--接收摄像头画面、麦克风音频、传感器数据,判断现在该干什么、上一步做对了吗、下一步怎么走,然后输出决策指令交给机器人的身体(VLA 动作模型或机械臂)去执行。

根据官方模型卡,ER 2 基于 Gemini 3.5 Flash 构建,支持文本、图像、视频、音频交错输入,上下文窗口 128K tokens,输出可达 64K tokens。这意味着它能像看连续剧一样理解实时视频流,而不是看一帧做一次决策、间歇性失忆。它能记住几分钟前发生了什么,据此调整当前动作。

要特别强调一个区分:ER 2 是推理模型,输出的是决策指令("把红色方块放到蓝盒子里"),不是电机控制信号。把指令变成关节转动,还需要动作模型(VLA 2)这一层,而 VLA 2 目前仍受限。别把 ER 2 当成能直接驱动机器人的全套方案。

二、三个核心升级:连续视频流、多机器人协作、流式推理

能力维度ER 1.6(前代)ER 2(当前)实际意义
视频理解静态图像+短片段连续视频流实时分析机器人能看着自己干活,实时纠错
任务编排单任务执行多步骤复杂任务规划能完成"煮咖啡再端给你"这类复合指令
协作能力单机独立多机器人协同多台机器人共享空间、分工配合
进度追踪91.3% 时刻定位准确率精确知道进行到哪一步
自我纠错有限实时识别异常并调整东西掉了能捡起来继续干
工具调用不支持支持 Google Search 与自定义函数遇到不懂的能现查再干活

第一,连续视频流实时理解是这次最大的单点突破。以前的机器人视觉模型看静态帧,ER 2 看的是连续流,能追踪自己的进度、出错时自我调整、精确判断何时进入下一步。第二,多步骤任务编排加多机器人协作,让 ER 2 天然适合工厂、仓库这类多设备场景。第三,91.3% 的时刻定位准确率需打一个标注:这是供应商自评估,不是独立第三方测试,真实场景的长尾分布会让实际数字往下走,别直接拿去当量产承诺。

还有一项容易被忽略但很关键的升级--流式推理(Streaming Reasoning)。传统机器人规划完再执行、执行完再规划,中间全是停顿;ER 2 能在执行当前动作的同时预判下一步,边走边想、脚下不停。这对工业场景的流畅度是质的提升。叠加 Google Search 与自定义函数调用,机器人遇到不认识的物件能现查资料再干活。

举个具体场景:仓库里两台机器人,一台分拣、一台码垛。以前的方案要么各干各的互不感知,要么靠中央调度器硬编排。ER 2 让两台机器人共享同一个推理上下文,自己协调谁先谁后、谁让谁过道,等于把项目经理装进了每台机器里。这对多设备产线意味着可以用更轻的中央调度、更重的端侧自主,降低单点故障的连锁影响。

三、谷歌的算盘:不做硬件,做大脑供应商

谷歌这步棋很清楚:它不造机器人本体。特斯拉死磕 Optimus 的硬件量产,Figure AI 绑定 OpenAI 做垂直整合,谷歌选了第三条路--把 ER 2 做成开放平台,谁都能用。

维度谷歌 ER 2特斯拉 OptimusFigure AI
核心优势基础模型+开放生态硬件量产+工厂自研垂直整合+场景聚焦
商业模式卖大脑(API/平台)卖身体(人形机器人)卖整体解决方案
开放程度API+AI Studio 开放封闭自用半开放、企业合作
关键短板不碰硬件,依赖第三方本体模型能力相对单一生态不够开放

这个定位的野心在于"机器人领域的安卓时刻":安卓不造手机却统治了手机操作系统,谷歌想成为所有机器人的统一大脑。一旦跑通,护城河比卖硬件深得多--硬件会迭代、会降价,但嵌进本体的推理模型换一次成本极高。

四、安全牌与冷思考

机器人大脑再聪明,安全不过关就是定时炸弹。谷歌同步推出 ASIMOV-Agentic 安全基准,专门测机器人在不确定性下的决策:是否拒绝不安全的工具调用、能否预判任务可行性、不确定时会不会主动请求人类介入。ER 2 在人类接近检测上也有提升,能感知人靠近并触发安全停止--这是从实验室走向工厂的协作安全通行证。

冷思考要泼三盆水。第一,ER 2 是推理层,动作模型 VLA 2 仍受限,"想得对"不等于"做得稳",手眼协调的最后一公里还没合龙。第二,官方成功率是供应商自评估,基准环境再难也是可控设定,真实世界的长尾场景无穷无尽,实验室数字到产线必然打折。第三,这些都是实验性质的早期能力,家庭场景离落地还远--成本、安全、可靠性三座大山都没翻过去。近期现实的落地集中在 B 端:工业上下料装配、物流分拣码垛、实验室样品处理,这类容错率相对高、泛化需求强的场景正好是 ER 2 的甜区。工业场景容错机制成熟,一次失败可以重来,且有围栏、急停等物理防护兜底;家庭场景一次失误可能伤人,安全冗余完全不是一个量级。所以别被模型能力唬住就畅想家庭管家,B 端才是这一代推理模型的用武之地。

五、对开发者的实际影响

开发者现在就能通过 Gemini API 和 Google AI Studio 调用 ER 2,企业级功能走 Gemini Enterprise Agent Platform 私有预览。上手时记住三件事:ER 2 输出的是决策指令,你得自己写一层转换逻辑把文本指令映射到机器人动作;生产部署必须配安全约束(人类接近检测、急停逻辑),别裸奔上线;别把 ER 2 的推理能力等同于整套机器人方案,动作层、感知层、安全层各自有独立门槛。

对做技术选型的人,谷歌"大脑供应商"路线意味着你可以专注本体和场景,把推理外包给 ER 2。但命脉握在别人手里的风险也要掂量--API 定价、模型迭代节奏、可用性都取决于谷歌。和 Mistral Robostral 对照看更有意思:Mistral 7 月中走的是单摄像头压低感知成本的路线,谷歌走的是多机器人协作加流式推理的大脑路线,两条路都在解同一个问题--让机器人别再当木偶。

如果你已经在用 Gemini 生态(Gemini API、Vertex AI),接入 ER 2 的迁移成本最低,模型卡和官方示例都现成。如果用的是其他大模型栈,要评估的是多模态视频理解这一项 ER 2 是否真的领先到值得跨栈--别为了一个能力全家桶迁移。另外盯紧谷歌的定价策略:推理模型按 token 计费,连续视频流输入的 token 消耗远高于文本,工业场景长时间跑产线前先算清账。

六、常见问题

Q:ER 2 是机器人吗?能买到吗? A:不能。ER 2 是具身推理模型,不是实体机器人。它负责"想",执行靠 VLA 动作模型和机械臂。目前经 Gemini API 和 Google AI Studio 开放,企业级功能在 Gemini Enterprise Agent Platform 私有预览。

Q:91.3% 准确率靠谱吗? A:要打折看。这是供应商自评估,非独立第三方测试。基准环境是可控设定,真实世界长尾场景会让实际数字往下走。别直接拿去当量产承诺。

Q:ER 2 和 VLA 2 是什么关系? A:ER 2 是推理模型,输出决策指令(该干什么);VLA 2 是动作模型,负责把指令变成电机控制信号(怎么动)。ER 2 开放调用,VLA 2 目前仍受限。"想得对"不等于"做得稳"。

Q:流式推理是什么,为什么重要? A:传统机器人规划完再执行、执行完再规划,中间停顿多。流式推理让模型在执行当前动作的同时预判下一步,边走边想,减少停顿。对工业场景的流畅度是质的提升。

Q:谷歌和特斯拉 Optimus、Figure AI 比有什么不同? A:谷歌不造硬件,做"大脑供应商",把 ER 2 通过 API 开放给所有开发者;特斯拉走硬件量产路线,Figure AI 做垂直整合。谷歌赌的是"机器人领域的安卓时刻"--不造手机,统治操作系统。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-11

常见问题

ER 2 是机器人吗?能买到吗?
不能。ER 2 是具身推理模型,不是实体机器人。它负责"想",执行靠 VLA 动作模型和机械臂。目前经 Gemini API 和 Google AI Studio 开放,企业级功能在 Gemini Enterprise Agent Platform 私有预览。
91.3% 准确率靠谱吗?
要打折看。这是供应商自评估,非独立第三方测试。基准环境是可控设定,真实世界长尾场景会让实际数字往下走。别直接拿去当量产承诺。
ER 2 和 VLA 2 是什么关系?
ER 2 是推理模型,输出决策指令(该干什么);VLA 2 是动作模型,负责把指令变成电机控制信号(怎么动)。ER 2 开放调用,VLA 2 目前仍受限。"想得对"不等于"做得稳"。
流式推理是什么,为什么重要?
传统机器人规划完再执行、执行完再规划,中间停顿多。流式推理让模型在执行当前动作的同时预判下一步,边走边想,减少停顿。对工业场景的流畅度是质的提升。
谷歌和特斯拉 Optimus、Figure AI 比有什么不同?
谷歌不造硬件,做"大脑供应商",把 ER 2 通过 API 开放给所有开发者;特斯拉走硬件量产路线,Figure AI 做垂直整合。谷歌赌的是"机器人领域的安卓时刻"--不造手机,统治操作系统。

相关文章