Gemini Robotics 2 深度解讀:Agentic AI 從桌面抓取走向全身控制(2026)

最後更新: ·
Gemini Robotics 2 從桌面抓取走向全身控制的官方機器人畫面

2026 年 7 月 30 日,Google DeepMind 在官方部落格發布了〈Gemini Robotics 2 brings whole body intelligence to robots〉。這次不是再讓機械臂多會抓幾樣東西,而是一次推出 Gemini Robotics 2、Gemini Robotics ER 2 與 Gemini Robotics On-Device 2 三個模型。Google 在整體展示中把機器人能力推進到行走、蹲下、雙手與多指操作,並宣稱 ER 2 可編排數分鐘長序列與異質機器人協作;後兩項尚未公布量化可靠度。

這場發布很快點燃技術社群:截至 2026 年 7 月 31 日 08:24 UTC,Hacker News 討論串的即時快照已累積 549 points、437 則回覆。興奮是有理由的——Google 展示的 action space,確實從桌面延伸到整個身體;但官方數據也同時寫著另一個故事:從地面取物只有 45.7%,五項多指任務有四項落在 32%–44%,真正輸出動作的兩個 VLA 仍未向一般開發者開放。

先把原文放在桌上。點擊下面的截圖會在新分頁打開 DeepMind 公告;接下來我會先忠實整理三個模型與展示,再把 benchmark、先例、可用性與安全邊界逐一對上,最後說明這一步究竟離「可用的通用機器人」還有多遠。

Google DeepMind Gemini Robotics 2 原始公告頁面截圖
Google DeepMind〈Gemini Robotics 2 brings whole body intelligence to robots〉原文;點擊圖片可前往閱讀。

一、Gemini Robotics 2 一次發布三個模型,角色其實完全不同

「三個模型」最容易被讀成三種尺寸,其實它們分工完全不同:一個負責把感知轉成動作,一個負責看懂任務、規劃與叫工具,另一個則是為本地部署最佳化、可直接輸出動作的 VLA。

模型角色輸出2026/7/31 可用性
Gemini Robotics 2旗艦 VLA;把視覺與語言轉成全身、雙手與夾爪控制機器人動作Private preview/early-access waitlist
Gemini Robotics ER 2高階具身推理 VLM;理解場景、拆任務、追蹤進度、呼叫 VLA 或其他工具文字與工具呼叫AI Studio、Gemini API public preview;Enterprise private preview
Gemini Robotics On-Device 2高效率、為本地部署最佳化的 VLA;可低延遲輸出動作並適配新的雙臂機體機器人動作Trusted Testers only

最重要的分界是:ER 2 是「高階腦」,VLA 才是「肌肉」。ER 2 的官方頁面明確寫著,它把馬達執行交給較低階 VLA;公開 model card 的輸出也是文字,不是關節控制值。換句話說,一般開發者目前可以從 Gemini API 試用「看懂與規劃」,卻還不能普遍取得官方影片裡真正驅動 Apollo 2 的旗艦 VLA。

官方把高階理解與規劃交給 ER 2,把動作執行交給低階 VLA;碰撞避免、平衡與力控仍需更底層控制器。這可理解為高階決策與即時控制的分層,但官方未公開各層控制頻率。


二、最大變化:從上半身桌面操作,走向全身控制

DeepMind 對這次跨越的定義很準確。原文寫道:

“While our previous models controlled the humanoid’s upper-body to achieve table-top tasks, Gemini Robotics 2 expands physical AI into whole-body motions.”

中文:「前代模型控制的是人形機器人的上半身,用來完成桌面任務;Gemini Robotics 2 則把 physical AI 擴展到全身動作。」

— Carolina Parada,Google DeepMind

這不只是多加兩條腿。人形機器人要從桌邊走到架子、彎腰撿起物件、再站穩放入低處收納格,整個機器人系統必須共同處理重心、落腳點、視角變化、手臂可達範圍與抓取。原文展示的 Apollo 2 會走、蹲、伸展,再拿著澆水壺移動;DeepMind 還稱同一個 checkpoint 可控制 Apollo 2 搭配兩種手,以及 Franka Duo 雙臂夾爪平台。

Gemini Robotics 2 全身操作內部成功率:桌面 68.4%、地面 45.7%、架上 76.3%
圖/Google DeepMind:Apollo 2 搭配 Inspire hands 的全身取物內部成功率;誤差棒定義與試驗次數未公開。

值得肯定的是,DeepMind 沒有只放剪輯影片,也把失敗面露了出來。官方內部評估中,從桌面取物是 68.4%,從架上取物 76.3%,但從地面取物只有 45.7%。這張公司內部圖顯示,模型在其未完整披露的全身取物評估中已能成功完成部分 rollout,但還不能證明跨任務穩定性或量產可靠度;而且柱狀圖是多個未逐項揭露任務的平均值。截至 2026 年 7 月 31 日,發布頁沒有列出 rollout 次數、誤差棒定義、reset 次數或每小時介入率,因此不能從一段成功影片反推出量產可靠度。

也要把「突破」放回領域脈絡。Figure 的 Helix 02 在 2026 年 1 月已展示由像素到全身的走路、平衡與操作,並公布一段四分鐘連續任務。所以 Gemini Robotics 2 不是全身 VLA 的世界首例;它更有辨識度的地方,是Google 把全身 VLA、具身推理、異質機器協作與本地適配放進同一模型家族


三、五指手最吸睛,也最誠實地暴露距離

Gemini Robotics 2 可以控制 22 自由度的 SharpaWave 五指手,完成鎖燈泡、綁垃圾袋、使用畚箕與封夾鏈袋等任務。這比平行夾爪困難得多:手指要共享有限摩擦力,接觸點會滑動,物件還會因一次小偏差改變後續狀態。

Gemini Robotics 2 多指操作成功率:鎖燈泡 36%、解燈泡 92%、綁垃圾袋 44%、畚箕 32%、夾鏈袋 40%
圖/Google DeepMind:Apollo 2 搭配 SharpaWave 手的五項多指任務內部成功率;四項落在 32%–44%,解燈泡為 92%。

數字非常有教育性:解開燈泡達 92%,反向的鎖燈泡卻只有 36%;綁垃圾袋 44%、使用畚箕 32%、封夾鏈袋 40%。在這套內部評估中,解燈泡與鎖燈泡的成功率比值約 2.56 倍,顯示任務間表現非常不均。這不是「通用靈巧手已完成」;由於官方沒有控制兩項任務的難度差異,公開資料也不足以把落差單獨歸因於接觸動力學。

Gemini Robotics 2 夾爪操作成功率:取放 74.2%、工具配套 78.9%、精密插入 89.6%
圖/Google DeepMind:Franka Duo 搭配 Robotiq gripper 的三類內部成功率;每一柱是多個未逐項揭露任務的平均值。

對照之下,兩指夾爪的三類成功率是 74.2%–89.6%。公開結果與多指接觸控制更難的直覺一致;但兩張圖的機體與任務集不同,不能把成功率差距單獨歸因於自由度。更值得注意的是,Gemini Robotics 2 的獨立模型頁使用「human-level dexterity」這種強措辭,發布文章卻說仍在提升精度與速度、朝人類靈巧度前進。同一天兩個官方頁面的語氣並不一致;目前公開結果支持後者,而不是完成式的「人類級」。


四、Agentic AI 進入物理世界:真正難的是錯一次後怎麼回來

ER 2 才是這次「agentic」的核心。Google 把它設計成持續讀取影片、追蹤進度並編排 VLA 或其他工具,也展示了重試與雙機交接;但沒有公布失敗偵測、恢復或協作的獨立成功率。Google 稱它能處理數分鐘、涉及數百個決策的任務;官方五段式進度分類內部評估為 57.4%。在 Google 的 physical-agent tool-orchestration 內部評估中,ER 2 搭配 real VLA 的 success rate 是 60%,把執行端換成人類 tele-op 時則是 74%,任務組成與試驗分母未公開。

這些數字說明了物理 agent 與軟體 agent 最根本的差別:文字 agent 答錯,可以回到原檔重跑;機器人抓歪、撞倒或灑出後,世界已經被它改變。下一步看到的不再是訓練資料裡的乾淨起始狀態,錯誤會沿著任務往後放大。

用一個純數學示意就能感受這個壓力:假設 100 個關鍵決策每一步都有 99% 機率正確,而且彼此獨立,整段一次無錯的機率只有 0.99100 ≈ 36.6%。真實系統可以靠偵測、重試與人類介入打破這個簡化模型,但代價會轉成恢復時間、碰撞風險與新的狀態辨識問題。因此接下來最值得追的不是「能不能做一次」,而是每小時介入次數、失敗偵測率、恢復成功率與連續運作時間

多機器人協作也是同一件事。Gemini 展示 Apollo 2 與 Franka Duo 共享語意、依各自身體優勢分工與交接,這比兩台同型機器人更有平台感;但「協作」本身不是首次出現,Figure 在 2025 年的 Helix 已展示單一 VLA 控制兩台人形機器人共同完成任務。Gemini 真正需要補上的,是交接成功率、通信延遲、其中一台失敗時能否重新分工,以及雙機是否真的比單機更省時間。


五、「少於 200 個例子」很重要,但不是任何身體都能即插即用

Gemini Robotics On-Device 2 的商業意義,可能比最華麗的人形影片更大。若每換一台機器、相機或夾爪,都要重新收集數萬次示範,foundation model 就沒有規模經濟。DeepMind 稱,On-Device 2 適配新的雙臂機體時,通常使用少於 200 個例子與幾小時的資料/適配時間;公開文件未拆分資料蒐集與實際訓練各需多久。官方 model card 在最高資料點標示,SO101 成功率為 53.3%、Dexmate 為 75.6%,都明顯高於前代。

Gemini Robotics On-Device 2 在 Dexmate、Trossen、SO101 等新機體與機械臂平台的官方展示
圖/Google DeepMind:On-Device 2 在不同新機體、機械臂配置與任務上的官方展示;畫面中的 Autonomous 與倍速標籤為原始素材的一部分。

但「少於 200」有三道邊界:第一,這是 Google 在公告中的第一方說法,公開圖表的 x 軸是每項任務平均資料小時數,沒有逐點列出 example 數,外部無法由圖表核對這個計數;第二,它描述的是雙臂機體適配,不是任意移動人形機器人;第三,適配後的 53.3% 或 75.6% 代表資料效率進步,不等於量產可靠度。

“The Gemini Robotics On-Device model is limited in its ability to generalise to out of distribution tasks as well as controlling high-degree-of-freedom robots.”

中文:「Gemini Robotics On-Device 對分布外任務的泛化,以及高自由度機器人的控制能力,仍然有限。」

— Gemini Robotics On-Device 2 Model Card

官方 model card還把評估範圍寫得更清楚:主要是站立式雙臂操作,移動平台與全身控制風險不在目前範圍。Trusted Testers 取得的 On-Device 2 checkpoint 可透過官方 SDK 部署到本地運算主機推論;ER 2 對一般開發者的公開使用路徑則是 AI Studio/Gemini API。官方 SDK 公開記錄的一條適配流程包含上傳資料、提出訓練/微調請求,再下載 checkpoint。官方資料目前只足以確認低階 VLA 可本地推論,未證明 ER+VLA 的端到端 agent stack,或從資料到訓練、部署的完整生命週期,都能離線完成。


六、安全 benchmark 有進展,但不能替代功能安全

DeepMind 這次也發布 ASIMOV-Agentic,測試 agent 是否會拒絕不安全指令、由立體影像估計人員距離、正確處理由外部監控器注入的結構化安全告警、判斷 VLA 能不能完成某個動作,以及在指令或場景含糊時主動詢問人類。這些都是具身 agent 真正需要的新安全層。

但公司自己的安全技術報告也給了最強的反方:

“This work does not evaluate the underlying functional safety architecture … necessary to safely execute those decisions in a compliant physical deployment.”

中文:「這項工作沒有評估合規實體部署所需的底層功能安全架構。」

— Gemini Robotics 2: Safety Evaluations
  • 會說安全,不等於會安全地動。在 ASIMOV-Agentic 的安全指令遵循內部測試中,ER 2 的文字分類準確率為 98%,可執行 VLA tool-call 模式則是 89.1%。
  • 人員距離偵測有明顯 trade-off。在 Google 的離線 agentic proximity 評估中,多個 frontier model 的假陽性率壓到 5% 以下時,假陰性率超過 40%;把假陰性率壓到約 10%–15% 時,評估樣本中的假陽性率則約為 15%–25%。
  • 真實車庫測試仍是內部受控環境。報告稱人員偵測 99%、轉入安全姿態 96%,但沒有列出試驗分母、停止距離、延遲或信賴區間。
  • 確定性的底層保護仍不可少。急停、速度與力限制、避碰、平衡控制、認證硬體、冗餘與即時保證,不能由一個語意 benchmark 取代。

所以「AI 更懂安全」與「機器人可以安全量產」之間,還隔著整套控制工程與認證。這不是唱衰,而是物理世界的底線:約 90% 的語意/工具呼叫準確率可以是有用的上層訊號,卻不能當成實體保護動作有 90% 可靠度;後者還取決於感測、低階控制器、停止距離與功能安全硬體。


七、AlphaLab 的判讀:這是控制範圍突破,不是可靠度突破

判讀一:Google 真正推進的是「整合廣度」

全身 VLA、多機器人、具身推理與跨機體 transfer 都有先例。Gemini Robotics 2 的價值,是 Google 把這些方向放進同一模型家族,並示範 ER 2 透過工具介面協調 VLA 與機器人 API;這是一個平台方向,但公開資料尚未證明三個模型共享單一通用介面。這種整合不如「全球首創」聳動,卻更接近平台會產生的長期槓桿。

判讀二:最值得興奮的是 action space 變大

前代 Gemini 的人形展示主要停在上半身桌面任務,現在模型開始把腳、軀幹、雙手與手指一起納入決策。這是明確、可觀察的能力擴張。即使成功率還不高,能做與完全不能做之間,仍然是一道重要門檻。

判讀三:真正的產品瓶頸已從資料量移到失敗成本

若 Google 所稱的少於 200 個例子能在外部部署重現,它有望降低新雙臂機體的資料蒐集負擔,這很可能是最有商業價值的進步;官方尚未公布完整適配成本。而在 model card 展示的最高資料點,SO101 的內部成功率仍為 53.3%。下一個瓶頸就變成:誰來監看、失敗一次損壞什麼、恢復要多久、一天能完成多少有效工作。企業最後買的不是「會動的模型」,而是可預測的 throughput。

判讀四:「腦」公開、「肌肉」封閉,外部驗證因此不對稱

ER 2 已能透過 API 測試,但旗艦 VLA 是 private preview,On-Device 2 只給 Trusted Testers。外界可以驗證影片理解、規劃與 tool calling,卻很難重現官方的全身與多指成功率。下一個真正有說服力的里程碑,不是更多精選影片,而是早期合作夥伴公布 repeated trials、介入率、失敗分類與部署經濟。

判讀五:我同意什麼,我存疑什麼

我同意:Google 的展示顯示,Gemini Robotics 2 把 Gemini 家族的控制邊界從桌面大幅推向全身,也開始觸及長序列與跨機器協作;後兩項仍缺量化可靠度。DeepMind 願意公開 32%–44% 這類不漂亮數字,也比只放成功 demo 更有價值。

我存疑:「general-purpose physical AI」「human-level dexterity」與「通往實體世界 AGI」仍走在證據前面。當 Google 的 physical-agent 內部評估中 real-VLA 模式 success rate 是 60%、地面取物是 45.7%,而本次安全報告又明說未評估底層功能安全架構時,合理結論是研究系統跨過了新的能力門檻,不是通用機器人已經準備進入家庭或大規模工廠。


八、接下來該追哪些數字?

如果你是開發者,可以先從公開 preview 的 ER 2 測試影片理解、進度追蹤與工具編排;如果你在評估機器人供應商,則不要讓一支漂亮影片替代下面六個問題:

  1. 同一任務跑 100 次,端到端成功率是多少?
  2. 每小時需要幾次人類介入、reset 或遠端接管?
  3. 失敗後能偵測並恢復的比例是多少?平均多花多久?
  4. cycle time、每小時產出與耗能,相較專用自動化是否划算?
  5. 新機體在 0、25、50、100、200 個例子時的完整 adaptation curve 是什麼?
  6. 哪一層負責碰撞、平衡、力控、急停與認證,AI 失效時如何降級?

這六個數字,會決定 Gemini Robotics 2 是一個令人驚豔的研究能力,還是一個能創造可重複經濟價值的平台。

📚 延伸閱讀

下一次看到人形機器人走路、疊衣或協作,不必急著在「AGI 已到」與「全是行銷」之間二選一。先找成功率、分母、介入率與連續運作時間;當這四個數字開始跨公司、跨機體、跨場景都站得住,physical AI 才真正從能力展示走進基礎設施。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。