2026 年 10 月 8 日,Jiawei Chi 等研究者在 arXiv 提交了〈AgentGarten: Code Worlds for Evolving Agents〉,作者來自 MirroS、清華大學與北京大學。AgentGarten 把世界的規則交給程式,把畫面交給神經渲染器,再讓 Agent 把每輪經驗寫成下一輪能讀的手冊。值得追問的是:傳下去的究竟是可驗收的技巧,還是一段看起來合理的故事?

先看這個練習場如何保持一致,再把實驗數字放回原本的比較條件,最後判斷什麼樣的經驗值得留給下一位 Agent。這篇是預印本研究的解讀;下文的實驗觀察均歸屬原作者。
AgentGarten 的核心:帳本和畫面各司其職
想像一個可以搬箱子、搭斜坡的遊戲。Agent 把箱子推到門口,世界必須記得箱子的位置;換個鏡頭,也應該看見同一次推動的後果。若只追求畫面漂亮,卻把門、箱子或碰撞關係畫錯,Agent 會從錯誤回饋學到錯誤規則。
AgentGarten 的官方倉庫把工作分成兩層:模擬器/遊戲引擎保存狀態、執行程式規則,輸出深度或表面法線等幾何條件;共同的神經渲染器據此產生觀察畫面。程式是世界的帳本,渲染器是 Agent 看世界的窗口。同一個帳本可以換外觀,卻仍需把同一件事交代清楚。

作者也展示從圖片或文字建立場景程式的流程:編程 Agent 安排粗略幾何與規則,查看探測鏡頭、試跑與引擎的接觸/碰撞檢查,再修正場景。自動產生場景是否值得拿來學習,仍需檢查任務能否解、失敗是否有辨識度,以及觀察是否足以做決定。
圖中的對照,說明作者想同時取得兩種能力:環境規則可編輯,觀察畫面可以多樣化。這對測試很有吸引力:先固定箱子與門的關係,只改外觀,就能追問 Agent 是否仍做對;再固定外觀、改門的位置,檢查它是否真的重新判斷。這些是可設計的驗收方式,並非本文已完成的測試。
畫面跟得上互動,靠的是另一套訓練
在作者同日發布的技術文章中,渲染器先學著跟隨幾何,再改成分塊、依先前畫面生成,最後以 Adversarial Forcing 蒸餾成少步數模型。這個名稱指的是渲染器的訓練方法,與 Agent 玩完一輪後寫手冊,是兩個不同流程。
它結合三件事:讓生成結果接近教師模型;用 exact replay 重新計算歷史編碼,讓後面的誤差能改善前面如何保存歷史;再加入真實影片的對抗式監督。作者的長片段畫面比較,是這項視覺品質主張的示例,不能直接當成所有場景的可靠性成績。
論文第 4 節報告,單張 H100、BF16、480×832、四步取樣及 FP16 小型解碼器的特定配置,穩態吞吐量為 36.5 frames/s;每個 16 畫格區塊的總牆鐘時間為 438.8 ms。每秒生成幾格,與按下動作後多久得到可用回饋,量的是不同事情。互動體驗還需計入模擬、傳輸、Agent 判斷與排隊。這兩個數字是作者的配置量測,未經 AlphaLab 重跑。
AgentGarten 的「學習」:讓下一輪讀懂上一輪
在官方專案頁展示的循環中,Agent 先讀 task.md,知道目標、可用動作與限制;在預算內行動;寫下嘗試、觀察、疑點與下次要驗的事;再把 playbook 歸檔。下一輪由新的對話讀取任務與先前手冊。
一份更好的操作筆記,與一個重新訓練過的模型,應分開評估。假設手冊說「先輕推箱子,確認抓住後再搬」,它改變的是後續決策可讀取的資訊。要確認技巧有效,可以拿走這條筆記、換成錯誤筆記,或換一個箱子位置,觀察差別。單憑傳承發生,尚不能推出底層能力持續自行提升。
這條研究路線有可核對的前例:Reflexion(2023)用語言反思與記憶支援後續嘗試;Voyager(2023)在 Minecraft 累積可執行技能,並以黑箱模型呼叫運作。它們支持「把經驗寫成外部資源」這種方法有研究脈絡;不能替 AgentGarten 的特定畫面或結果提供獨立重現。
4 輪對數百萬回合,不能除出一個效率倍率
Crucially, these numbers reflect two fundamentally different learning paradigms rather than a direct sample-efficiency ratio.
中文:關鍵在於,這些數字反映兩種根本不同的學習範式,而不是可直接相比的樣本效率比例。
AgentGarten 論文第 5.2 節
作者報告,躲藏者到第 4 輪搭出遮蔽物,搜尋者到第 10 輪使用斜坡;此處採一名躲藏者準備後,交給一名搜尋者行動的順序版本,每輪含五場遊戲。拿來並列的是OpenAI 2019 年的自我對戰研究:原研究以物件狀態表示觀察,透過自我對戰與 PPO 訓練策略。
兩邊的起點、觀察與訓練方法不同。預訓練 Agent 已帶著對物件、工具與空間的先備知識;從隨機權重訓練的策略,要用另一種方式取得能力。把作者列出的 2,500 萬個 episodes 除以四輪,既混用了單位,也把預訓練成本移出了分母。這組展示有助於研究如何把既有知識落實成行動,不能據此宣布學習效率提高數百萬倍。
其他世界的成績:有改善,也有退步的一輪
作者表 4列出四個額外世界,每輪一個 episode。例如單線橋的兩車交換終點,時間由 71、68、45 秒到 41 秒;採石場裝載機的分數則是 30、0、30、90.9。後者第二輪退步,是判讀「持續進化」時應保留的證據。
這些紀錄支持的是:在展示的任務與跑次裡,後續輪次可以出現較好的結果。若要判斷穩定增益,還要有多個隨機種子、重複跑次與失敗分布;若要判斷手冊的作用,還要有相同預算下不帶手冊的對照。好看的第四輪,是下一份評估的起點。
AlphaLab 的判讀:值得保留的是可被反駁的經驗
一、世界能重播,才有機會分清哪一步做錯
我同意把狀態與畫面分開保存的方向。重播同一組動作、換一種外觀,可以幫助定位失敗:是規則寫錯、畫面誤導,還是 Agent 決策錯?這樣的分工,讓「再試一次」有機會變成控制變因的測試,而不是每次重新講一個故事。
二、程式守住狀態,窗口仍可能誤導
我存疑的是,直接把可控狀態理解成可信觀察。箱子實際還在,不保證生成畫面完整交代它的位置。原文第 7 節也討論幾何條件對物件身分、材質與長時間遮蔽的限制。即使帳本正確,Agent 看錯後仍可能做錯;因此要把狀態一致性、畫面忠實度、任務成功率放在三張成績單上。
三、手冊的價值,應在沒見過的題目上對帳
一條只在原場景管用的技巧,可能仍有用,但適用範圍要能說清楚。更有說服力的下一步,是固定模型與時間預算,讓帶手冊、不帶手冊和帶無關手冊的 Agent 面對新布局;再逐步改外觀、動作阻力與目標。這是評估建議,並非論文已交出的實驗。
我會期待有效經驗能跨場景保留,也能在條件改變時被修正。若手冊只是越寫越長,卻無法指出哪條教訓改善哪個結果,記憶庫會增加閱讀負擔。能刪掉不適用的教訓,和能留下新技巧,同樣值得量。
現在可以做什麼?先替一條教訓留收據
截至 2026 年 10 月 10 日,官方 README 的這個版本說明已提供神經渲染器的訓練與串流推論程式,code worlds 與 Agent 練習循環會陸續釋出。想重現整段「玩、回顧、傳承」的人,應先核對各項交付;不要把渲染程式能下載,當成完整實驗已能一鍵重跑。
一般讀者可先打開專案頁,選一份 playbook,找出三種句子:實際看見什麼、由此推論什麼、下一次要怎樣驗。這三者分得清楚,才知道哪些經驗值得信任。開發者則可以在自己已有的可重置小任務裡,固定成功條件,測試一條教訓的加入與移除;保存模型版本、題目、動作紀錄、花費與失敗原因。
要把這種驗收接進系統,AI Agent Harness 的分工可補足模型與執行層的界線;想理解預測與模擬的用途,先讀世界模型的白話介紹。AgentGarten 值得關注的未來,是環境與經驗能否一起擴大,且每次擴大仍能說清楚進步從哪裡來。
接著閱讀
左右滑動查看更多推薦
下一次看到「Agent 從經驗變強」,先追一條教訓:它從哪次失敗來、由誰繼承、在新題目上是否仍有效。把這條路徑對帳清楚,進步才會從展示變成可累積的能力。






