2026 年 9 月 4 日,Robocurve 發布〈GPT-6 Astra on robotic manipulation〉,公開一組 GPT-6 Astra 機器人評測:在把積木放進碗裡的任務,Astra 完成 19/20;到了需要對準凹槽的拼圖片插入,卻只剩 2/20。這兩個數字並不互相矛盾,它們恰好畫出目前通用模型進入實體世界時最值得看的能力斷層。

以下先忠實整理這場測試到底做了什麼,再把結果與官方模型資料、機器人控制研究逐一對照,最後判斷它證明了什麼、又還不能證明什麼。
先釐清來源身分:網址雖以 openai.robocurve.org 開頭,發布者與網站署名都是 Robocurve,不是 OpenAI。它提供 run table、影片、transcript 與 replay,但不是同儕審查論文,也不是另一個實驗室的獨立重現;下文的試驗結果都以「Robocurve 報告」為範圍。
GPT-6 Astra 機器人評測核心:真正的訊號不是 95%,而是換任務後的斷崖
Robocurve 的主張很窄:把 GPT-6 Astra 放進與 Claude Fable 5.1 同名的 Inspect Robots agent policy,使用宣告相同的高階評測配置,讓它看三個攝影機畫面與機器手臂狀態,再用工具送出末端執行器的位置、角度與夾爪動作。在簡單的積木入碗任務,Astra 的完成率、時間與估算模型費用都優於 Fable 5.1;但精密插入任務沒有拉開完成次數。公開 transcript 顯示部分 run 的套件版本並不一致,後文會單獨處理。
這不是「模型直接接管每顆馬達」。完整鏈條比較接近:
- 感知:模型每一回合接收三個視角,加上手臂本體狀態。
- 規劃:Inspect Robots 的共同 agent policy 包裝提示、歷史與工具呼叫。
- 動作:模型輸出高階的末端姿態與夾爪指令,不是低階關節電流。
- 落地:逆向運動學把姿態轉成關節動作,速度上限與安全限制再約束手臂。
因此,這場測試最合理的讀法是「一個通用視覺語言模型,在固定控制介面與安全護欄下的系統表現」,不是一個脫離 scaffold 的純模型智力測驗。
外部證據:通用模型能看圖,不等於精密操控已經解決
OpenAI 官方模型頁確認 GPT-6 Astra 可接收圖片,公開標價為每百萬輸入 token 10 美元、輸出 token 50 美元;Anthropic 官方模型資料也把 Claude Fable 5.1 列在相同的 10/50 美元級距。Robocurve 依這些名目價格估算每次執行的模型費用,價格口徑可以核對,但公開總表沒有逐次輸入 token,外界無法完整重算每一筆費用;它也不是雲端帳單,沒有包含機器手臂、人工重置或實驗室時間。
更重要的外部對照來自 Anthropic 自己的機器人研究:同一個模型只要更換控制介面,表現就可能大幅改變;直接給較低階動作通常困難,把感知與動作包進較高階工具或 VLA scaffold 才能顯著改善。這與 Robocurve 的架構相符,也提醒我們:測到的是模型、介面、控制器與硬體共同形成的閉環。
Robocurve 公開的 Inspect Robots 與 YAM adapter 讓外界能檢查 agent 與硬體介面,這比只放一段成功影片更可驗證。不過專案也明示仍在早期開發,控制介面本身尚不是固定不變的標準。
GPT-6 Astra 機器人評測數據:入碗拉開差距,精密插入沒有
| 模型/任務 | 完成次數 | 平均輸出 token | 估算模型費用/次 | 平均時間/次 |
|---|---|---|---|---|
| GPT-6 Astra/積木入碗 | 19/20 | 2.1k | US$0.94 | 2.5 分鐘 |
| Claude Fable 5.1/積木入碗 | 8/20 | 12.9k | US$2.12 | 6.8 分鐘 |
| GPT-6 Astra/拼圖片插入 | 2/20 | 2.7k | US$1.36 | 3.4 分鐘 |
| Claude Fable 5.1/拼圖片插入 | 2/20 | 10.5k | US$2.18 | 5.9 分鐘 |

“The puzzle task is a different story: Astra completed the insertion 2 times in 20…”
中文:拼圖片任務是另一回事;Astra 在 20 次中只完成 2 次插入。
Robocurve
AlphaLab 另用二項分布的 Wilson 方法重算 95% 區間:19/20 約為 76.4%~99.1%,8/20 約為 21.9%~61.3%,2/20 則約為 2.8%~30.1%。入碗任務的差距足以支持「這組條件下明顯領先」;但每格只有 20 次,區間仍寬,而且統計區間沒有納入不同 rig、人工重置與時間順序帶來的系統性誤差。
同樣是 2/20,失敗方式仍不完全相同
只看最終完成率,兩個模型在拼圖片插入完全打平;Robocurve 的總表與圖把 Fable 5.1 的平均階段分數列為 2.35,Astra 列為 2.00。依這份彙總,Astra 並沒有在每一個中間步驟都領先。兩者共同的瓶頸,是把圓形拼圖片穩定對準凹槽並完成最後插入。

這個細節很重要。粗略抓取與移動主要容忍位置誤差;插槽則要求連續視覺回饋、姿態估計、接觸修正與更細的閉環控制。模型能描述「把東西插進去」不代表它能在幾毫米的誤差、遮擋與摩擦下持續修正。19/20 對 2/20 的分化,與「粗粒度策略可行、精細閉環仍卡關」的解釋一致;但這組未盲化、非交錯且入碗任務不同 rig 的小樣本,還不足以把差距直接歸因為模型策略層本身的進步。
原文自己揭露的限制,比 19/20 這個數字更重要
- 不是交錯測試:Astra 的試驗晚兩天進行,無法把當日環境與時間順序完全消掉。
- 入碗不是同一台 rig:Fable 的入碗試驗用 rig 3,Astra 因 rig 3 無法使用而改用 rig 1;只有拼圖片任務固定在 rig 4。可以說兩者同為 YAM embodiment、採用宣告相同的高階評測配置,不能說每一格都用了同一套實體手臂或完全相同的軟體實作。
- 評分沒有盲測:操作員知道是哪個模型,完成與否由操作員判定。
- 頁面 metadata 與正文互相矛盾:description/og:description 把比較寫成「interleaved blinded pairs」,但正文限制明說試驗沒有交錯,而且評分者知道模型身分。本文採正文的具體限制為準;Robocurve 應同步修正頁面 metadata。
- 每次人工重置:場景由人手恢復,仍可能留下位置與擺放差異。
- 只測一種推理設定:兩者都用 medium effort、最多 20 次模型呼叫,結果不能直接外推到其他 effort、工具或控制頻率。
- 摘要少了一項任務條件:公開的 60 份拼圖片 transcript 都要求「只用右手」,但摘要頁顯示的 prompt 沒有這句;重現者若只抄摘要會得到不同規格。
- 兩筆階段資料對不上:Astra 有兩份拼圖片 transcript 的操作員註記或判定,無法和總表的 stage 1 一致對帳。它們都沒有被算成完成,因此不改變 2/20,但 2.00 的平均階段分數無法只靠附件完整重算。
- 成本口徑有限:報告使用 wire-level token,而非供應商最終計費 token;Astra 約五分之一輸入獲自動快取,但表內估算沒有扣掉快取折價。
“Grading was operator-judged with the model known…”
中文:評分由操作員判定,而且操作員知道正在測哪個模型。
Robocurve
公開執行紀錄還有一個值得保留的版本註記:技術規格頁寫 Inspect Robots 0.58.0,但 Astra 的 20 份入碗 transcript 都標示 0.57.1;Astra 拼圖片與 Fable 5.1 的紀錄則標示 0.58.0,而且所有 transcript 的 git 欄位都是 unknown。這不會自動推翻結果,但現有公開資料不足以判斷版本差異是否影響結果,因此不能只依摘要頁假設所有 run 都是同一實作;需要 Robocurve 再對齊 run manifest、commit 與版本。
原文真正提出的,是仍待重驗的系統比較
Robocurve 的頁面把最強的結論限定在積木入碗:在其直接機器人控制設定下,Astra 的成功率約為 Fable 5.1 的 2.4 倍;表列單次估算費用則約為 Fable 5.1 的 44%(Fable 5.1 約為 Astra 的 2.3 倍)。到了拼圖片插入,它反而明說結果是另一個故事。這是一種可被後續試驗推翻或重現的主張:換 rig、交錯次序、盲化評分並增加樣本後,入碗差距是否仍存在?
這組試驗也不能回答 Astra 是否具備通用智慧:評測範圍是一種 YAM embodiment、兩個固定桌面任務、medium effort 與最多 20 次模型呼叫;報告衡量的是任務階段、完成率、token、時間與估算費用,而不是跨硬體泛化、長時程自主性或相對人類的能力。它提供的是一個特定系統在一個粗粒度任務上的強烈訊號,不是通用智慧的充分條件。
AlphaLab 的判讀:四件比勝負更值得帶走的事
1. 能力邊界要用任務階梯找,不能用單一成功率命名
如果只測積木入碗,我們會得到「Astra 已能可靠操控機器人」;只測精密插入,又可能得到「新模型幾乎沒進步」。兩者都太粗。好的評測應把抓取、搬運、粗放置、精對準、接觸修正與完成插入拆成難度階梯,找出能力在哪一級崩落。這比把 95% 當成模型的固定屬性,更接近真實部署風險。
2. 通用模型的價值正在上移到策略層,但底層控制沒有消失
Robocurve 將這套系統描述為 GPT-6 Astra 經 Inspect Robots agent policy 輸出末端姿態,再由逆向運動學與安全限制轉成手臂動作;在這個限定架構裡,通用多模態模型確實能透過工具介面把視覺輸入轉成動作計畫。可是相機配置、embodiment-specific prompt 與 agent policy 都在替它收斂動作空間。產品真正該比較的是整套 closed-loop system,而不是把所有成功歸功於模型名稱。
3. 單次 token 成本會獎勵失敗得快,應改算每次可接受成果
用報告數字粗算「模型費用÷完成率」,入碗每次成功約是 Astra US$0.99、Fable 5.1 US$5.30;拼圖片則約為 US$13.60 與 US$21.80。這比單看每次 run 更貼近產出,但仍沒包含重試、人工、折舊、停機與失敗後果。當任務有安全風險時,最便宜的模型呼叫可能反而導致最昂貴的系統。
4. 這份結果足以決定下一輪實驗,不足以決定「誰已通用」
我同意 Robocurve 最窄的結論:在 Robocurve 這組條件下,Astra 的入碗系統結果很強,值得用控制更嚴格的實驗重驗,精密插入則仍是共同瓶頸。我存疑的是把這組結果外推成模型在所有機器人、所有操控任務都領先,更不同意把一格 19/20 當作通用智慧的證據。現在最有價值的不是再換一個更聳動的標籤,而是把這個差距放進更嚴格的重驗。
下一步怎麼驗:把漂亮 demo 變成可部署證據
- 先固定可重現單位:公開每次 run 的模型快照、prompt、agent policy、套件版本、commit、rig、相機校正與原始 transcript。
- 交錯並盲化:同一天隨機交錯模型與 rig,讓不知道模型身分的人依預先定義的規則評分。
- 增加任務階梯:在入碗與插槽之間加入不同容錯、遮擋、摩擦與物件姿態,找出真正的失效曲線。
- 跨 rig 重複:每個模型都輪流跑多台手臂,分離模型效果與單機校正差異。
- 報告完整經濟性:同時列出成功率、成功前重試、延遲、人工介入、硬體時間與每次可接受成果成本。
- 加入人類與專用系統基準:通用模型不只要彼此比較,也要回答和人類遙控、傳統規劃器、專用 VLA 相比是否值得。
閱讀下一個機器人或 agent benchmark 時,可以沿用同一套檢查:先看評測題目與評分規則,再看介面與 scaffold,最後才比較模型名稱。只要精密任務、環境變動與失敗成本沒有一起報告,單一成功率就仍是一段線索,而不是部署保證。
接著閱讀
左右滑動查看更多推薦






