機器人缺的常常不是「會動」,而是「知道自己做到哪、下一步該不該換手、旁邊有人時該不該停」。Google DeepMind 把答案拆成一層公開可呼叫的高層大腦:推出 Gemini Robotics ER 2(embodied reasoning),定位為機器人與人類對話、理解物理世界、規劃可長達數分鐘的多步驟任務,再把馬達執行交給下層 vision-language-action(VLA)或其他控制 API。開發者可透過 Gemini API、Google AI Studio 直接呼叫;Gemini Enterprise Agent Platform 則提供私有預覽。
這不是一場硬體發表會。它比較像把 Android 式「連接層」往工廠與實驗室推進:本體廠繼續做機構與伺服,Google 嘗試成為「決定下一步」的共用推理入口。
三模型家族:公開的是大腦,手脚仍分級開放
同批敘事裡其實有三個模型,存取權重不同:
| 模型 | 角色 | 誰能用 |
|---|---|---|
| Gemini Robotics ER 2 | 具身推理 VLM/高層代理 | 公開預覽(API/AI Studio);企業 Agent 平台私有預覽 |
| Gemini Robotics 2 | 全身控制 VLA | 早期合作夥伴 |
| Gemini Robotics On-Device 2 | 本機 VLA,少樣本適配 | Trusted Testers |
MarkTechPost 等整理的 model card 資訊:ER 2 基於 Gemini 3.5 Flash,接受交錯文字/影像/影片/音訊,上下文至約 128k,文字輸出至約 64k tokens;AI Studio 模型字串為 gemini-robotics-er-2-preview。也就是說,多數外部團隊今天能立刻試的,是「規劃與調度層」,不是完整的全身動作權重。
官方強調 ER 2 相對 ER 1.6 的跳躍:連續看影片追進度、出錯能調、知道何時進下一步;並首度把多機器人協作寫進產品敘事——不同機型共享語義理解、交接子任務,完成單機做不到的流程。示範包括 Apptronik Apollo 2 與 Franka F3 Duo 協作,以及用 ER 2 調度 Boston Dynamics Spot 的導航與操作臂 API,用自然語言叫它去拿東西。
為什麼「進度」突然變成 headline 指標
實體世界最難的一題是:任務何時算完成。鎖緊燈泡、綁垃圾袋這類事,差幾秒就會灑、會夾、會損料。ER 2 把時間智能拆成兩塊,並給出可核對數字。
連續進度分類:把影像每一幀標成五檔進度(0–20%…80–100%),讓機器人即時知道走到哪、要不要重試而不是整段重來。官方數字:57.4% 準確率,勝過前代與部分競品 frontier 模型。
關鍵時刻定位(moment-finding):找出「該停倒咖啡」這類事件發生的精確幀。官方:91.3% 準確率,平均絕對距離約 0.96 秒;強調以遠低於更大模型類別的算力與約 4 倍執行速度,換到實體機器人真正需要的次秒級延遲。
空間側則升級三塊:成敗偵測改吃原始影片而非靜態快照(抓灑、滑、對不齊);儀表讀取從圓形錶與窺鏡擴到數位顯示、線性尺、液體溫度計等約 10 類;以及強化空間 VQA。工具編排上,ER 2 在真實 VLA、模擬 VLA、人類遙操三種控制模式下都勝過 ER 1.6。
延遲面綁上 Gemini Live API 雙向串流端點:一邊動作一邊想下一步,減少「停住想很久再動」的頓挫。這對開發者工作流很實際——你把低層控制介面宣告成 tools,把多模態串流餵進去,ER 2 當編排代理。
安全敘事:人靠近就停,基準上 Hugging Face
實體 AI 出事代價與聊天框不同。官方稱 ER 2 是目前最安全的一版,在 Safety Instruction Following 與 Human Proximity 基準上明顯進步:人靠近人形機器人時能成功停住,區域清空後再自主恢復。他們另推一套評估「安全 VLA 編排者」的基準(約束執行、環境監測、物理可行性、向人澄清),並把相關安全技術報告/基準開放到 Hugging Face(報導稱 ASIMOV-Agentic,CC-BY-4.0)。Ars Technica 等第三方也點出:影片示範仍不及人類速度與流暢,但即時畫面已比過去猶豫感低。
商業化仍有未寫進發表稿的摩擦。虎嗅等中文分析提醒:預覽階段延遲、幻覺、空間輸出誤差仍在;工廠若持續把產線影像與任務資料送進外部模型,同意與控制權會卡住導入。官方開發者文件亦要求:機器人可能錄到個人資料時,營運方須事先告知並取得同意、盡量減少蒐集。雲端大腦越強,本體廠與工廠 IT 越要想清楚資料邊界——這與同週微軟把 harness 與模型拆開賣的企業語言,其實是同一條採購題的不同場景。
和競品戰場怎麼對位
具身智能這兩年被拆成「大腦/小脑/本機」分層。Google 公開 ER 2,等於先佔領「可 API 呼叫的高層規劃」;全身 VLA 與 On-Device 仍鎖在夥伴與 Trusted Tester——複製的是雲端先滲透、硬體後綁定的老劇本。對 Apptronik、Boston Dynamics、Franka 這類出現在 demo 裡的廠商,短期是曝光與整合樣本;長期要問的是:語義交接協議會不會變成事實標準,讓換大腦比換手臂便宜。
也要對照同週另一條完全不同的主線:Anthropic 披露三起 Claude 評測誤連公網入侵。一邊是軟體代理在虛擬靶場打穿真公司;一邊是實體代理被要求在工廠與走廊「看著進度、人近則停」。兩者提醒同一件事:代理能力往前走時,隔離、監測與中止條件必須跟著升級——差別只在於,一個中止的是 session,一個中止的是一噸級機械臂。
開發者現在能做什麼、還不能做什麼
能做:用 gemini-robotics-er-2-preview 試多步驟編排、接 Live 串流、把導航/夾爪 API 當 tools、複現 Spot/雙臂協作類 demo 的提示結構。官方提供配置與 prompt 範例、GitHub robotics-samples。
還不能假設:公開 API 等於你已有 Gemini Robotics 2 全身控制;也不能假設 57.4%/91.3% 會在你的光照、遮擋、產線節奏下原樣成立。多指靈巧度在相關報導中仍是弱軸(區間可低至約三成、高至九成以上,視任務而定)——ER 2 再懂進度,抓不穩仍會失敗。
採購與產品經理可把問題收成三句:我們缺的是高層規劃還是動作策略?資料能不能出廠?安全停機要落在模型層、控制器層還是兩者都要?ER 2 適合回答第一句;後兩句仍是系統工程,不是換一個 model string 就結束。
對硬體整合商,公開大腦也改變報價結構。過去客製規劃堆疊常綁死在單一系統整合商;現在客戶可以要求「規劃層可換成 Gemini API、動作層保留你們的 VLA」。這會壓低切換成本,也逼整合商把差異化寫回資料、工藝與現場調校——虎嗅所說「API 降低門檻後更要有不可替代壁壘」,指的就是這件事。對新創機器人隊,好處是少養一支規劃研究組;風險是路線圖被雲端模型改版節奏牽著走,以及工廠客戶一問資料出境就卡住 POC。
同週還有現代汽車加深 Boston Dynamics 布局這條實體 AI 產線敘事:工廠要的是可預測節拍與責任歸屬,不是只看 demo 能不能拿零食。ER 2 的進度分類與人近停機,正好對上產線採購常問的兩句——「它知不知道自己做完了」與「人走進工作半徑會怎樣」。數字漂亮仍要現場驗證,但至少問題開始能量化。
Google 這次沒有假裝「單一模型包辦身體」。它公開的是可調度的腦,把手脚留給分級合作夥伴。對實體 AI 產業,這意味著下一輪競爭可能不在誰的後空翻影片更炫,而在誰的進度估計夠穩、誰的多機語義交接夠通用、誰的「人靠近就停」在真實廠房裡不會誤觸或漏觸。
