2026 年 8 月 17 日,GigaAI(極佳視界)發布〈GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture〉;8 月 25 日,團隊再於 GitHub 宣布釋出 GigaBrain-0.7 的程式碼、base checkpoint 與樣本資料。它最吸睛的主張,是在機器人 VLA 旁加入一個會預測未來畫面與任務進度的 world value model,並用這些訊號訓練控制器偏向能推進任務的動作。
這個方向值得認真看,但也很容易被一句「機器人先預演、再行動」講得過度神奇。論文描述的是三個協作系統、37,256.98 小時異質資料,以及多組由團隊執行的模擬與真機評測;公開發布的範圍,則比整篇論文描繪的研究堆疊窄。真正的問題不是「展示影片帥不帥」,而是:世界模型到底怎麼影響動作?結果能否離開團隊自己的硬體與測試重現?所謂開源,又實際開到哪一層?
先把GigaAI 官方專案頁放在這裡。點擊下面截圖可另開原文;接下來會依序忠實整理架構、核對公開 artifacts 與數字,再給出獨立判讀。

一、GigaBrain-0.7 的核心:不是一顆模型,而是一個三系統堆疊
傳統 VLA(Vision-Language-Action)可以粗略理解為:把攝影機畫面、語言指令與機器人狀態,直接映射成下一段動作。它比只會辨識物體的視覺模型更接近控制,但仍可能在長任務裡累積誤差——抓偏一次、放錯一次,後面就一路錯下去。這也是為什麼近年的 embodied AI 開始把「預測世界怎麼演化」接回動作生成;我們在FLUX 3 世界模型分析與Gemini Robotics 2 深度解讀裡,也反覆遇到同一條能力邊界。
GigaBrain-0.7 把這件事拆成三層:
- System 1:動作與控制。論文寫的是 PaliGemma2 3B 加上一個 0.5B Action Expert,名義上稱為 3.5B VLA;部署時以 flow matching 產生連續動作片段。
- System 2:理解與規劃。同樣以 PaliGemma2 3B 為骨幹,把當前影像、歷史畫面與語言整理成場景描述和分層子任務。
- System 3:預測與評估。一個以 GigaWorld-1 為基礎的 5B world value model,生成短期未來畫面,把末幀當作視覺子目標,並估計任務進度/價值訊號。
因此,「3.5B」不是整套三系統的總參數量。它是論文對 System 1 組成的名義標示;截至本文查核時,Hugging Face 上公開的 base checkpoint safetensors metadata 顯示 4,121,726,448 個參數,介面也四捨五入顯示為 4B。這不必然代表論文造假,而是提醒我們:研究架構標籤、序列化權重的實際 tensor 數量、以及完整推論堆疊,是三件不同的事。

二、8 月 25 日真正開源了什麼?
GitHub README 的原句很清楚:
“Released the GigaBrain-0.7 Code, Model and Sample Data.”
中文:「已釋出 GigaBrain-0.7 的程式碼、模型與樣本資料。」
— GigaBrain-0.7 GitHub README,2026/08/25
逐項打開後,可以確認主程式碼 repository、一個公開且免申請存取的GigaBrain-0.7-3.5B-Base checkpoint,以及一個約 13.43 GB 的SampleData repository。GitHub 沒有另建 tagged Release;8 月 25 日是 README 的整包發布公告與主要程式碼匯入日,而第一批 Hugging Face 權重其實在 8 月 24 日 UTC 已上傳。
更重要的是邊界。截至 2026 年 8 月 27 日,官方模型集合中可見的是上述一個 base checkpoint;本文在官方集合與主 repository 中沒有找到另列的 5B System 3 checkpoint。公開的 inference server 自稱「PaliGemma2-only VLA Phase 3」,request 也沒有 GigaWorld-1 的 subgoal/value service。公開資料明確叫做「SampleData」,不是論文的完整 37.3K 小時訓練集;README 的 VLM evaluation、RoboColiseum、RoboTwin 2.0 與 EBench 評測程式碼仍標示在 TODO 清單。換句話說,目前可以下載的 package 足以讓人檢查一部分實作,卻還不足以把論文裡所有三系統結果照表重跑。
這種差異在 open model 世界並不少見。「有權重」不等於「有完整訓練資料、評測程式、部署 recipe 與安全文件」;判斷方式可對照我們對NVIDIA Alpamayo 2 Super與Kimi K3 開放權重的逐層拆解。GigaBrain-0.7 的公開 artifact 是有實質內容的,但「全面開源」仍應按 component 清單,而不是按一句發布標語判定。
三、37,257 小時很大,但不是 37,257 小時真機資料
論文報告的清洗後總量是 37,256.98 小時,但它把不同資料型態統一換算成 operating hours:20,535.65 小時真實機器人軌跡(55.12%)、8,251.83 小時 UMI 近手示範(22.15%)、2,862.36 小時第一人稱人類影片(7.68%)、1,453.92 小時模擬(3.90%),以及 4,153.22 小時由世界模型生成的資料(11.15%)。此外還有 271,976,674 組影像文字/問答樣本供 VLM 訓練。

這種混合很合理:真機資料昂貴,人類影片與模擬能補長尾情境,生成資料則能擴張時間與場景變化。但「一小時」在五種來源裡的資訊密度、標註品質與控制可用性並不相同,因此總時數更像資料規模的會計口徑,不是五種資料可互換的證明。
同樣要分清楚三個數字:資料表列出 16 種真實機器人平台;公開設定檔列出 8 個 embodiment ID;論文的主要真機結果則集中在 AgileX PiPER/PiPER-X 與團隊自家的 Maker H01。前兩者說明訓練覆蓋,後者才是文章能直接檢視的物理評測範圍。把「訓練看過 16 種平台」寫成「已在 16 種機器人上證明泛化」,會多走了一大步。
四、「先預演,再行動」到底發生在哪裡?
在 System 3 pretraining 與 task-specific VLA post-training 的描述裡,world value model 會根據當前觀察與任務生成一小段未來影片,把最後一幀轉成 visual subgoal;同時預估任務進度,再把它轉成 binary advantage 訊號。System 3 在 VLA post-training 時凍結,論文並以 50% 的 subgoal dropout 與 15% 的 value dropout 訓練,避免控制器完全依賴提示。
推論階段反而有一個必須保留的問號:論文只明確說 policy 會以「positive progress」作為條件,沒有提供整個三系統的端到端 latency;官方英文頁甚至寫著 inference 不需要 world-model rollout,而中文頁卻寫 System 3 進入「實時決策回路」。目前唯一的 latency 表測的是 System 1,每個 action chunk 為 0.221 秒。因此「預演」是一個好用但有限的比喻:公開證據沒有證明 5B System 3 會在每個控制週期窮舉多條動作、逐一模擬後再選最優解;較穩妥的說法是,世界模型產生的 subgoal/value 被用來塑造 action policy。下面這張圖就是團隊給出的 failure 與 recovery 範例:預測畫面與 advantage 在盒蓋掉落時轉差,恢復操作後再回升。

另一個該降溫的詞是「首次」。2025 年的WorldVLA已把 action model 與預測未來影像的 world model 放進同一框架;2026 年 1 月的Cosmos Policy也同時生成未來狀態與價值,並用於 test-time planning;GigaAI 團隊自己的GigaBrain-0.5M*也早已用世界模型預測的未來狀態與價值來 conditioning policy。GigaBrain-0.7 的差異在三系統分工、資料規模與特定 conditioning/RL 設計,不是把「世界模型影響機器人動作」這個概念從零發明出來。
五、真機結果看起來很強,但證據層級要分開
先講團隊報告的結果。經 task-specific post-training 後,GigaBrain-0.7 在語言跟隨任務的平均成功率為 PiPER 91.5%、H01 84.2%;複雜操作為 PiPER 84.9%、H01 74.1%。System 3 消融裡,gift wrapping 從 base 的 0% 提升到 image+value 條件下的 80%;cube sorting 則從 40% 到 55%。四項 experience-driven RL 任務的平均成功率,表格從 SFT 30.0%、offline RL 57.5% 走到 online RL 100%。

但這些數字必須連同三個限制一起讀:
- 多數真機設定只有 10–20 次 trial。一個成功或失敗,就可能讓百分比移動 5–10 個百分點;100% 更應讀成「這批有限試驗全數成功」,不是永遠不會失敗。
- 評測與基準比較主要由團隊執行。RoboTwin、EBench、RoboColiseum 表格是特定日期與模型子集的 snapshot;不同訓練資料、解析度、post-training 與硬體會影響可比性。這類 benchmark 的常見陷阱,也可對照VibeWorlding benchmark 判讀。
- 最戲劇化的 online RL 結果,方法披露反而最少。論文說 human-in-the-loop 細節與完整 online RL formulation 將留待後續報告,因此目前最難由外部團隊照同一 protocol 重跑。
而且作者自己沒有掩蓋 OOD 問題。out-of-box language-following 測試中,PiPER 從 ID 的 94.5% 降到 OOD 的 36.5%,H01 從 55.8% 降到 16.7%。論文直接寫道:
“The ID–OOD gap also highlights the current limits of foundation transfer.”
中文:「ID 與 OOD 之間的落差,也凸顯了 foundation transfer 目前的限制。」
— GigaBrain-0.7 technical report, §6.6.1
這句比「emergent capabilities」更值得記住。真正通用的機器人基礎模型,不只要在熟悉物件與場景做對,還要在視角、物體、位置與指令組合一起改變時維持能力。GigaBrain-0.7 已經把這個缺口量出來,但還沒有把它消掉。
六、原文真正的訴求:把世界模型變成具身 AI 的第三套系統
官方頁面的終點不是一張排行榜,而是「物理 AGI」:用更大、更雜的資料塔訓練通用 foundation model,再用 System 3 的預測/價值與 experience-driven RL,讓同一套基礎能力延伸到多種 embodiment 與長任務。論文摘要還留下了一句可對帳的承諾:
“All training code and pretrained model weights will be released.”
中文:「所有訓練程式碼與預訓練模型權重都將釋出。」
— GigaBrain-0.7 technical report, Abstract
這個未來式很重要。8 月 25 日的發布讓承諾往前走了一大步,但截至本文查核日,完整三系統與全部評測鏈仍不是同一個可下載、可一鍵重現的 package。接下來最值得追蹤的,不是 GitHub star 數,而是 System 3 artifact、evaluation code、固定版本的 benchmark recipe,以及外部團隊能否在不同硬體上重現「加入 subgoal/value 後,長任務成功率穩定提升」這個核心命題。
七、AlphaLab 的判讀:方向對了,結論還不能跑在證據前面
我的結論是:GigaBrain-0.7 是一個值得研究的 world-model-powered VLA 系統,也是一個「研究敘事大於目前公開重現面積」的發布。這兩句並不矛盾。以下五點,是我認為讀者最該帶走的判讀。
判讀一:真正的新意在系統整合,不在「世界模型+動作」四個字
WorldVLA、Cosmos Policy 等先前工作已經證明這是一條研究路線。GigaBrain-0.7 的價值,是把長歷史理解、flow-matching controller、future subgoal/value conditioning 與 offline/online experience learning 接成一個完整故事。這可能是很好的工程取捨,但不能靠「首次」替代逐項比較。
判讀二:System 3 最有價值的不是生成漂亮影片,而是提供可被消融的訊號
如果世界模型只是多生成一段看似合理的影片,它很容易變成昂貴裝飾。GigaBrain-0.7 至少把 subgoal 與 value 拆開做 ablation,讓我們能問「哪個訊號真正改變成功率」。下一步應在更多任務、更多 trial 與外部硬體上固定 System 1,只開關 System 3;這比再拍一支剪輯過的 demo 更能證明因果。
判讀三:37.3K 小時是資料工程能力,不是泛化保證書
異質資料可以擴張覆蓋,也會帶來分布、品質與授權口徑的差異。更何況 Maker H01 占真機資料影格的 43.82%,而主要真機評測也包含 H01;這會讓模型在自家平台上表現好變得合理,卻不能自動證明跨 embodiment 的公平泛化。最有價值的測試,反而應該是團隊沒收過資料的新硬體與新場景。
判讀四:「emergent」目前比較像解讀,不是已定位的相變
論文展示資料擴張後若干能力變好,但沒有用獨立重複實驗、信賴區間或明確 change-point 證明某個能力突然「湧現」。把曲線上升叫做 scaling 很合理;把它升級成 emergence,就需要更強的統計與因果證據。這不否定能力進步,只是避免一個有吸引力的詞替代精確描述。
判讀五:商業價值最後看的是可靠產出,不是單次成功率
在工廠或家庭裡,真正成本還包括推論延遲、人工介入、復原時間、硬體磨耗與不合格輸出。10–20 次 trial 的 100%,不能直接換算成一個班次、一個月或一萬次動作的 uptime。想把模型能力翻譯成經濟價值,可以接著看Tesla Optimus 每個有效工時成本的判斷框架。
我同意的部分:用未來子目標與進度訊號 post-train policy,是比單純 reactive mapping 更有希望處理長任務的方向;團隊也公開了足夠多的資料表、消融與 OOD 失敗,讓外界可以開始嚴肅對話。
我存疑的部分:官方頁面的「全面領先」、論文標題的「emergent capabilities」,以及「全面開源」的讀者印象,都比目前可獨立檢查的證據走得更遠。這些主張不是一定錯,而是要等 component 齊全、外部硬體重現與更大樣本測試,才配得上同樣強度的語氣。
八、接下來該看什麼?一份重現清單
如果你是研究者或開發者,判斷 GigaBrain-0.7 的下一輪證據,不妨照這五項檢查:
- Artifact 是否補齊:System 3 checkpoint/inference path、評測程式與固定 commit hash 能否一起取得。
- 比較是否公平:同一份資料、硬體、推論算力與 trial protocol 下,只開關 subgoal/value,觀察因果差異。
- 任務是否真正新:用未出現在訓練資料的新物件、組合、背景與 robot embodiment,並把 ID/OOD 分開報告。
- 樣本是否足夠:公布每格 trial 數、失敗類型與信賴區間,不只報平均成功率。
- 部署是否算全成本:同時記錄 latency、人工介入、恢復時間與每小時合格輸出;repository 的 dry-run 預設應保留到硬體安全驗證完成。
如果你只是想判斷這次發布值不值得興奮,我會給一個簡短答案:值得,但興奮點應放在「可被驗證的架構假說」,不是「通用機器人已經完成」。GigaBrain-0.7 把一條重要路線做得更完整;它接下來能不能成為里程碑,取決於其他人能否用它、拆它、重跑它,最後在陌生世界裡仍得到同樣結果。
接著閱讀
左右滑動查看更多推薦
若要持續追蹤這篇研究,先收藏官方 repository;下一次更新時,不要只看 star 數,而是對照上面的 artifact 與重現清單逐項打勾。






