2026 年 8 月 15 日,香港科技大學(廣州)與騰訊團隊發布 〈VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?〉預印本;VibeWorlding 想把「讓 AI Agent 從指令一路做到完整 3D 場景」變成可訓練、可比較的任務。最吸睛的結果,是作者訓練的 30B 模型在自建 VWE-Bench 拿到 59.3,略高於 GPT‑5.5 的 57.3;但只要把評分器、測試集與釋出程式逐一對帳,這個「勝出」就必須加上很長的限定語。
下面分三步走:先還原 VibeWorlding 真正建立的是什麼,再拆解 59.3 分從哪裡來,最後檢查它的「首個」、小模型優勢與可重現性是否站得住腳。
- 把論文裡的「3D 開放世界」縮回可操作的技術定義。
- 分開讀規則評分、Gemini 評審與作者自報的排行榜。
- 拿前作、資料檔與公開程式反向挑戰最重要的主張。

一、這不是「一句 Prompt 生出整個遊戲」
先把名詞釘牢。在 VibeWorlding 的正式定義裡,一個 world 是一份資產清單:每個物件有類型、位置、旋轉與縮放,再由引擎輸出五個視角的畫面。Agent 可以呼叫五種工具:搜尋資產、加入、刪除、旋轉與平移。它要在多輪操作後交出更新後的場景狀態與渲染圖。
所以這裡的「端到端 3D 世界建造」,不是從零生成任意網格、材質、角色動作、物理規則與遊戲邏輯;而是在固定、卡通風格的資產庫裡完成場景組裝和修改。這個範圍仍然有價值,卻與玩家平常理解的可探索、可互動遊戲世界不同。像 WorldGen 這類工作,還會處理可行走空間、分離網格與遊戲引擎匯入;VibeWorlding 的重點則是 Agent 如何操作既有資產。
Our experiments show that current frontier MLLMs are far from solving the vibe worlding agent task.
中文:我們的實驗顯示,現有前沿多模態大模型距離解決 vibe worlding Agent 任務仍有很大差距。
VibeWorlding 論文摘要
這句話是整篇最值得保留的自我約束:VibeWorlding 展示的不是「3D 世界已被 AI 解決」,而是一個把失敗具體量出來的考場。
二、VWE-Bench 把什麼變成可測量?
作者從 3,148 個候選概念開始,經圖生 3D 與品質過濾後,在論文中報告 2,616 個資產;323 個由美術人員建立的 seed worlds,再反向合成 6,828 個使用者查詢。其中 1,364 題是從零建造,5,464 題是修改既有場景。

關鍵不是總量,而是兩種題目的證據強度不同:
- Verified(1,710 題):先對 seed world 做已知修改,再讓模型描述該修改;因為目標狀態已知,可以直接比對資產差異。這是最接近可驗證獎勵的部分。
- Unverified(5,118 題):主題建造、模糊修改、場景批評等開放題沒有唯一答案,先過幾何與規則檢查,再由 Gemini 3.5 Flash 按作者設計的 rubric 判斷是否符合意圖。
資料切成 5,567 題 SFT、1,007 題 RL、254 題測試,seed world 彼此分離,這能降低把同一場景背下來的風險。公開的 test index 也能逐列數出 254 題、12 個測試 seed worlds:46 題建造、208 題修改;66 題是 Verified,188 題是 Unverified。換句話說,測試集約 74% 仍仰賴作者的模型評審,而且 46 題從零建造全部走這條路。
這個設計同時帶來一個優點與一個風險:它終於能大規模訓練開放式 3D Agent;但模型也可能學會迎合評分器,而不只是學會迎合人。
三、真正的亮點,是把環境、評分與 RL 接成閉環
VibeWorlding-Gym 的工程貢獻比排行榜更耐看。Agent 每輪讀取場景狀態與五視角渲染,決定下一個工具呼叫;Verified 題用狀態差異給獎勵,Unverified 題用規則加多模態評審給獎勵。團隊先做 SFT 冷啟動,再用 GRPO 讓模型在同一個 sandbox 裡反覆嘗試。
Verified 題的設計,確實抓住 Agent 最怕的錯
精確修改不只問「目標物有沒有動」,還比較應改與不應改的資產;多刪一棵樹,即使新增動作做對,也可能整題歸零。這比只看最後截圖更接近工具型 Agent 的真實要求:正確完成任務,同時保存未授權狀態。
Unverified 題則把同一個 Gemini 放在三個位置
同一套 Gemini 3.5 Flash 評審參與篩選 SFT 軌跡、提供 RL reward,最後又替排行榜打分。這不代表結果必然無效;但它讓「能力提升」與「更會符合這位評審的偏好」難以分離。作者自己的訓練曲線也承認,Unverified reward 比 Verified 不穩定,可靠度受 reward 品質限制。
公開釋出很實在,但還不到按一下就能重跑論文
GitHub repository 不是只有 README:它包含 sandbox、verifier、訓練程式與 CLI;VWE-Bench、模型權重也能公開下載。這是很有分量的釋出。
不過截至 2026 年 8 月 18 日,repository 沒有對應論文的 release tag,也沒有各模型的 254 筆原始輸出、逐題評分、匿名人評標註與產生 Table 4 的腳本;根目錄和兩張主模型卡也未標示授權,只有資料集卡標為 Apache‑2.0。比較精確的說法是「程式、資料與權重已公開」,而不是把所有 artifact 一概稱為可重現的 open-source release。
四、59.3 分,應該怎麼讀?

先忠實還原 Table 4 的 Overall 數字:
| 模型 | 作者報告 Overall | 作者報告 Human |
|---|---|---|
| GPT‑5.5 | 57.3 | 33.3 |
| Qwen3.8‑Max | 56.9 | 46.7 |
| VibeWorlder‑8B | 41.4 | 30.0 |
| VibeWorlder‑30B‑A3B | 59.3 | 47.2 |
30B 模型的自動分數只領先 GPT‑5.5 2.0 個百分點、領先 Qwen3.8‑Max 2.4 個百分點;Human 欄則只比 Qwen3.8‑Max 高 0.5。截至 2026 年 8 月 18 日,論文的實驗章節未報告這些差距的信賴區間、重複 run 或顯著性檢定。測試只有 12 個 seed worlds,Distractor 子類甚至只有 2 題;把 59.3 解讀成「確定比 GPT‑5.5 強」超出了資料能支持的範圍。安全的結論只有:VibeWorlder‑30B‑A3B 在作者的 Gemini-based verifier 下,取得最高的作者自報 VWE-Bench 分數。
8B 的訊號不是「打敗前沿」,而是可訓練性
Qwen3‑VL‑8B base 從 5.3 升到 VibeWorlder‑8B 的 41.4,幅度很大;但它仍低於 GPT‑5.5 的 57.3。這說明針對環境、工具格式與 reward 的 post-training 能大幅改善小模型在這個考場的表現,不等於 8B 模型在通用 3D 推理上已追平所有大型閉源模型。
公開表格與公開 evaluator,目前對不出 Overall
把公開 test index 的十個子類題數,乘上 Table 4 的各子類分數,再按 254 題加權,會得到 GPT‑5.5 56.23、Qwen3.8‑Max 55.25、VibeWorlder‑8B 39.41、VibeWorlder‑30B‑A3B 58.10;四列都與論文的 Overall 相差約 1.1~2.0 個百分點,遠大於一位小數造成的捨入誤差。公開 eval.py 又是逐題平均,現有 artifact 因而無法重建表中的 Overall。
還有第二個定義問題:論文把 Unverified Pass@1 寫成所有維度都通過才算 1;但公開的 from-scratch verifier 對失敗題仍按通過維度給最多 0.16,eval.py 聚合的是這個 total_reward,同時另列 hard pass。作者可能用的是未公開設定或另一版腳本,但在逐題 log 與 table-generation code 出現以前,讀者無法判斷 Table 4 究竟採哪一條路。
五、「第一個多模態 RL 造 3D 世界」站得住嗎?
VibeWorlding 把自己描述為第一套端到端 3D 世界建造的 agentic RL framework,並寫道先前沒有工作探索 3D world construction 的 multimodal RL。這個廣義優先權主張很難成立。
SceneReVis 在 2026 年 2 月 10 日提交,已把 SFT 接上 multi-turn GRPO;每一輪 observation 都包含 scene graph、渲染視圖與互動歷史,並以 Add、Move、Rotate、Scale、Replace、Remove 等原子操作修改 3D 室內場景。更早的 SceneCraft 已經用渲染畫面做閉環修正,3D‑GPT 也早已讓多個 Agent 操作 Blender。
VibeWorlding 仍有清楚的新意:它把從零建造與模糊修改放進同一個 benchmark,提供更完整的資產、retriever、MCP sandbox、verifier、SFT/RL pipeline 與公開權重。比較公平的定位是:這套 benchmark 與 training gym 的整合很新;「多模態 3D 建造 Agent 的 RL 是首次出現」則不是。
六、論文最誠實的畫面:懂指令,卻改錯座標

第一個案例要求把 rock 18 往前移 7 公尺;Agent 移了正確距離,卻沿相反方向,最後與目標差 14 公尺。第二個案例要求在寶箱右邊加一棵樹;Agent 成功新增,卻順手刪掉原本的大樹。
這正好解釋為什麼 render-in-the-loop 有用、又為什麼只靠「模型似乎理解了」不夠。工具型 Agent 的可靠性是乘法:找對物件 × 讀對座標系 × 發出正確參數 × 不碰其他狀態。任一項接近零,漂亮的 reasoning 都救不了最後世界。論文自己的能力圖也顯示,RL 後各模型的 collision 檢查通過率仍只有 59%~68%。
七、接受排行榜以前,還要踩十次煞車
- 同隊自建考場、自寫題目、自做模型。這是 in-distribution engineering result,不是獨立第三方能力認證。
- 同一位模型評審同時參與資料篩選、RL reward 與最終評分。截至查核日,論文與公開 repository 未交代 held-out judge、judge ensemble 或針對 prompt injection/說服式 reasoning 的對抗測試。
- Pass@1 混合兩種量尺。Verified 是修改資產的比例分數,Unverified 在論文定義中是全維度通過的二元分數;把兩者混成 Overall,不能直接等同「解題成功率」。
- 公開 scorer 與論文敘述有版本疑問。除了 partial reward,公開 RL 預設還含首次完成輪次折扣、額外輪次懲罰與題型 turn limit;這比論文強調的 whole-trajectory outcome reward 多了 shaping。作者尚未標明哪組設定產生已發布模型。
- 物理檢查是近似規則,不是 3D ground truth。公開 collision code 會把 extent 轉成整數、忽略小於 10 立方公尺的重疊,並豁免若干 terrain/effect 類別;通過應讀成「通過這個 checker」,不是物理上無碰撞。
- 測試集小且群聚。254 題只來自 12 個 seed worlds;截至查核日,論文未報告 cluster-aware 信賴區間、重複 rollout 或顯著性分析,2 個百分點的領先不足以建立穩定排名。
- 模型與 baseline 設定未完整釘選。論文沒有公開所有 API snapshot、日期、temperature、reasoning/token budget 與逐模型完整設定;幾個 scaffold 也是作者在五種工具裡重做的版本,不是原系統原生對決。
- 公開 evaluator 對覆蓋率不夠 fail-closed。它只遍歷存在的輸出目錄、略過缺少 final_map.json 的案例,verifier exception 也未清楚放回該 route 的分母;沒有逐模型 254 筆 log,便無法確認所有失敗都以零分計入。
- 人評只能算有限的交叉訊號。作者報告 holistic agreement 83.4%、Cohen’s κ=0.54,屬中度一致;實驗章節未交代 annotator 人數、每模型樣本數、重複標註與裁決,公開 artifact 也未附 raw labels。文中稱為「Real-World CLI User Study」的章節,實際只展示一次 CLI 操作,未交代參與者、任務設計或可用性統計。
- 釋出資料仍有小型版本漂移。論文報告 2,616 個資產,但目前 item_infos.json 有 2,617 筆、asset_cards.jsonl 有 2,622 個 unique IDs;這不推翻 benchmark 規模,卻提醒我們不能把 README 數字當成 artifact 已完全對齊。
截至 2026 年 8 月 18 日,這篇預印本提交僅三天;本文在已索引的論文、程式庫與社群表面尚未找到第三方重跑或獨立逐題審計。這是「目前未找到」的時間截面,不代表未索引或私人測試不存在,因此所有性能結論仍應保留作者自報標籤。
八、AlphaLab 的判讀
真正值得留下的,是 gym,不是「打敗 GPT‑5.5」
一個領域要從 demo 走向工程,必須先有穩定環境、工具介面、任務分布、reward 與失敗分類。VibeWorlding 把這些零件一次公開,還把「誤刪未要求資產」納入可驗證目標,這比一張漂亮的生成圖更能推動後續研究。
小模型的大幅上升,證明的是專門化有用
8B 從 5.3 到 41.4、30B 從 13.6 到 59.3,若原始 log 能支持,最有意義的解讀不是「參數不重要」,而是工具 schema、視覺回饋、可驗證 reward 與訓練環境能把大量通用能力轉成可執行行為。這與 AI Agent Harness 的核心觀念一致:模型只是系統的一部分,環境與回饋迴路決定能力能否落地。
我同意什麼/我存疑什麼
我同意:精確 3D 編輯是目前的真瓶頸;render feedback、狀態差分與 seed-disjoint split 都是正確方向;公開 254 題測試與模型權重也讓外部驗證有起點。
我存疑:59.3 是否足以排出模型高下、Gemini reward 是否代表人類偏好、公開 evaluator 是否就是論文版本,以及「第一個 multimodal RL 3D world framework」的廣義說法。現有證據更像一套有潛力但尚待校準的研究基礎設施,而不是通用 3D World Agent 已被證明。
什麼新證據會改變判斷?
- 第三方用固定 commit、固定 API snapshot 重跑全部 254 題,公開逐題輸出與 coverage。
- 把 Verified/Unverified 分榜,另用不同 MLLM 與盲人評重判 RL 模型。
- 提供 repeated rollouts、按 seed bootstrap 的信賴區間,以及 hard-pass/partial-score 的明確 table script。
- 換資產風格、引擎、工具 schema 與自然使用者指令後仍能遷移,而不是只在同一套 type IDs 與合成模板裡進步。
- 真正的使用者研究:多人、預先定義任務、成功率、耗時、錯誤恢復與主觀可用性,而不只是一段成功 demo。
九、研究者、開發者與創作者現在可以怎麼做?
- 研究者:先重跑 66 題 Verified test,因為它不靠模型評審;再逐步加入 Unverified,觀察換 judge 後排名是否翻轉。
- Agent 開發者:把狀態差分、未授權修改、座標單元測試與 hard fail 放在 learned judge 前面。可驗證的錯,不要交給模型猜。
- 做 RL 的團隊:訓練 reward 與最終 evaluator 至少保留一個獨立通道;否則 reward 上升可能只是更熟悉評審。
- 3D 創作者:把目前 CLI 視為研究 prototype。先用小型、可回滾場景測試,不要直接把一次成功案例等同長流程 production reliability。
接著閱讀
左右滑動查看更多推薦
如果你要判斷 VibeWorlding 下一版是否真的跨過門檻,先別盯著最高分:看第三方能否重建同一張表、換一位評審後排名是否不變,以及模型能否在陌生資產與陌生工具裡仍然只改該改的東西。






