2026 年 10 月 7 日,Wei Huang 等來自 NVIDIA、MIT、香港大學與 UCSD 的研究者,在 arXiv 提交了〈Long-WAM: Scaling the Context of World-Action Models〉。Long-WAM 要解決的是一個很實際的矛盾:機器人需要看過去,才能判斷物體怎麼動;可是回看得越多,下一個動作也可能來得越晚。

先看作者如何讓歷史進入動作,再核對成功率與延遲各自量了什麼,最後判斷這項研究離可靠的實際控制還有哪幾道考驗。讀完最值得留下的問題是:多記住一段畫面,是否真的改善了下一次決策,且趕得上現場的變化?
Long-WAM 的核心:有歷史,還得會用歷史
access to history is not the same as using it
中文:能讀取歷史,不等於能有效利用歷史。
Long-WAM 論文摘要中的關鍵片語
想像輸送帶上有一個杯子。單張照片告訴你它在哪裡;前後幾張照片讓你估計它朝哪裡移動、什麼時候會到手邊。另一方面,收碗或整理積木的任務,需要知道前一步已經拿了什麼、放到了哪裡。兩種情境都需要過去,但有用的過去未必一樣長。
作者的路線,是先用機器人與第一人稱影片,在不使用動作標籤的預訓練階段,讓自回歸影片模型從先前畫面預測後續變化;再把這種依時間順序建立的結構,接到動作模型。自回歸在這裡可以白話理解為「用已經發生的部分,預測接下來的部分」。這讓預訓練與操作時的資訊方向更接近。

圖中的「約 1 萬小時」,依附錄 B.1 是將訓練樣本按窗口累加的等價估計,並非去重後的原始影片時長。這個口徑影響你如何理解資料規模:同一段互動取出多個重疊窗口,與收集更多全新互動,帶來的資訊並不相同。
動作生成接收觀察到的歷史與模型預測的未來表徵。這種表徵是模型內部的壓縮資訊,不必先畫出一段完整影片給人看,再開始動作。因此「想像未來」在這裡是一條計算路徑,而不是機器人先播放小電影的比喻。若想補上訓練階段的分工,AI 模型怎麼學習可幫你分清預訓練與下游適配。
Long-WAM 的 78.7%:歷史有幫助,證據到哪裡?
依論文摘要、圖 6 與第 5.3 節,機器人影片自回歸初始化的模型,在 RoboCasa GR-1 上從僅保留當前觀察的 63.3%,提高到 19.2 秒歷史的 78.7%,相差 15.4 個百分點。這是作者報告的模擬評估;基準的官方倉庫也明確將 GR-1 Tabletop 定義為模擬任務,不能把這個數字當作家庭現場的成功率。
更有價值的比較,是相同因果動作適配路線下,不同影片初始化如何隨歷史長度變化。作者的自回歸初始化呈現較明顯的長歷史收益,雙向預訓練初始化在相應區間沒有相同的淨增益。這支持「訓練方式會影響歷史的價值」,但還不足以證明所有自回歸模型都勝過所有雙向模型;模型、資料與適配流程仍是比較條件的一部分。
這項研究每個歷史窗口都各自訓練模型,再在對應長度下評估。因此曲線比較的是一組模型與訓練配置,不能直接讀成同一台已部署機器人,轉動一個記憶旋鈕就能得到同樣增益。實際產品若想依場景調整窗口,還要驗證切換後的行為。
原文有一處值得保留的歧義:表 4 把 2.4 秒配置列為 63.3%,第 5.3 節與專案摘要則列 66.3%。這篇採用摘要與圖 6 一致的「當前觀察 → 19.2 秒」比較,不以表 4 的 2.4 秒數字計算精確增益。讀者若要重做實驗,應先向作者核對這項配置,而不是把兩種標示混成同一個基準。
107.4 ms 與 19.2 秒:兩個好數字不能直接拼在一起
論文附錄 G 的表 12將 RTX 5090 上的每個動作區塊推論時間,按歷史長度分開列出。107.4 ms 對應 2.4 秒歷史;19.2 秒歷史對應 341.0 ms。所以「19.2 秒歷史提升成功率」與「107.4 ms 推論」是各有條件的結果,不是同一配置同時交出的成績。
| 歷史窗口 | RTX 5090 每區塊推論時間 |
|---|---|
| 0.0 秒(保留當前觀察) | 74.6 ms |
| 2.4 秒 | 107.4 ms |
| 4.8 秒 | 138.3 ms |
| 9.6 秒 | 204.5 ms |
| 19.2 秒 | 341.0 ms |
附錄 F 還界定了計時範圍:包含觀察影像編碼與推論,排除前處理、文字編碼,以及控制器與程序間通訊開銷。把 107.4 ms 取倒數得到的推論吞吐率,也不是機器人的控制頻率。對實際抓取來說,需要追的是「相機看到變化,到新動作真正生效」的時間。
這個區分影響很大。杯子移動時,較準但太晚的決策可能錯過抓取;較快但依據過時的決策,也可能抓到空處。記憶與速度應該放在同一張成績單上,而不是各挑一個漂亮數字。AI Evals 入門談的固定驗收條件,在這裡也適用:先確定要保護的行為,再挑量測。
讓機器人繼續動:省時間的關鍵在交接
Long-WAM 的系統層把推論與既有動作重疊,並讓觀察影像一批批提前編碼。機器人執行上一段動作時,系統準備下一段;交接時,對準已經流逝的時間,採用新區塊中仍適用的後半段。量化、快取重用與裝置調校,則降低這條推論路徑的成本。

這能減少等待,但交接仍有期限。若新決策抵達太晚,就算後台一直在計算,也不能保證動作不中斷。作者的時間線特別有用:它把「總共算多久」與「觸發下一次推論之後,還剩多少工作」分開,後者才直接決定是否趕得上交接。
獨立的Motubrain 非同步部署研究同樣把觀察、預測與執行命令的時間對齊列為核心問題,並比較平滑與精確度的取捨。這是機制上的外部支持,不是對 Long-WAM 成功率的重現。它提醒我們:讓手臂一直移動,與讓手臂持續做對,必須分開驗。
真實抓杯、模擬規劃,各自回答不同問題
在作者的 Unitree G1 動態疊杯條件下,Long-WAM 完成 20 次中的 19 次,即 95%;比較的兩個基線在各自 20 次中皆為零。第 6.1 節與圖 7限定了這個結果的任務與樣本數。它是有價值的實體操作證據,但 19 次成功不能替不同光線、杯型、遮擋或突發干擾下的表現蓋章。

論文也提供 LIBERO、RoboTwin 2.0、DOMINO 模擬基準與 YAM 長任務結果,再把 Long-WAM 接到高層規劃器。後者在 RoboCasa365 的作者評估中,提高了組合任務表現。這兩層分工值得注意:短期物理歷史幫助「現在怎麼做」,高層規劃則維持「接下來要完成什麼」。把整段長目標塞進底層控制器,不是唯一可考慮的設計。
這也是為什麼展示影片要分清真實執行、模擬執行與模型生成的預測。能畫出合理的物體移動,與手臂真正完成移動,是不同的測驗。看影片時先辨認它是哪一種,再把畫面接回對應的實驗條件;漂亮的示例不能替整個試驗集合做平均。
AlphaLab 的判讀:值得追的是記憶如何換成更好的控制
我同意:記憶應該按任務的時間尺度配置
短期移動方向、近期交互狀態、長期任務目標,是不同的資訊需求。選窗口之前,先問「眼前這個決策缺了什麼線索」。若新畫面已足以判斷動作,回看更久可能只是增加負擔;若先前狀態仍決定下一步,截斷歷史又可能造成重複或遺漏。合理的設計目標,是保留決策所需的證據。
我存疑:目前的曲線還不能給出普遍最佳記憶長度
窗口越長不代表真實資訊越多。作者在更長窗口的分析中,指出大量歷史取樣來自補齊畫面,並把有效資料不足列為可能解釋。因此,長窗口表現回落,可以促使我們檢查資料覆蓋,卻不能直接宣布模型「記憶到這裡就到頂」。要區分容量限制與資料問題,應比較真正連續、足夠長的互動紀錄。
未來預測值不值得保留,要看同樣的時間預算
Fast-WAM 的原始研究提出另一條路:訓練時保留影片共訓練,推論時省去明確未來生成,在其評估中仍得到有競爭力的表現。這使 Long-WAM 的選擇更值得比較,而不是更容易下定論。兩套方法的資料、模型與測試條件不同,不能只抄各自一個延遲數字就排名。
公平的下一步,是固定可用的反應時間,再比較保留預測、簡化預測與直接生成動作。前一條路若增加準確度,還要看它是否在截止時間之前交付;後一條路若省時,也要看失敗集中在哪類互動。只要其中一種在你的場景更可靠,便值得留下,無須先替架構選陣營。
下一份值得等的證據:一張完整任務成績單
我會追三類資料:同一配置下,歷史長度、閉迴路成功率與完整反應延遲的共同量測;不同場景與物體下,失敗如何分布;以及單一策略動態選擇歷史窗口後,是否改善任務而非只縮短推論。這些證據會把「會記得」推進成「記得有用,而且及時」。
一般讀者可以把同一套問題帶到下一則機器人新聞:數字是哪個場景、同一配置嗎、成功與速度是否一起量?開發者則可先替自己的任務畫出觀察到動作的時間線,列出截止時間與失敗條件,再決定要增加哪段歷史。模型與執行層的分工,可接著看AI Agent Harness;需要把停止與錯誤處理具體化,最小 Harness 實作提供另一個系統層的參照。
接著閱讀
左右滑動查看更多推薦
下一次看到「記憶更長,而且更快」,先把兩個數字放回同一個配置。若它們對得上,再看完整任務是否更可靠。Long-WAM 值得追蹤的方向,是讓歷史成為按需要分配的控制資源;真正的進步,會出現在機器人每一次需要及時做對的交接裡。






