跳到主要內容

Long-WAM 論文解析:機器人記得更多,107.4 ms 代表什麼?(2026)

最後更新: ·
Long-WAM 論文解析:移動杯子的視覺歷史與即時抓取,AlphaLab 原創概念示意

2026 年 10 月 7 日,Wei Huang 等來自 NVIDIA、MIT、香港大學與 UCSD 的研究者,在 arXiv 提交了〈Long-WAM: Scaling the Context of World-Action Models〉。Long-WAM 要解決的是一個很實際的矛盾:機器人需要看過去,才能判斷物體怎麼動;可是回看得越多,下一個動作也可能來得越晚。

Long-WAM arXiv 原文頁面截圖,含論文標題、作者與摘要
圖/Wei Huang 等作者,arXiv 論文頁面截圖;點擊圖片可閱讀原文。

先看作者如何讓歷史進入動作,再核對成功率與延遲各自量了什麼,最後判斷這項研究離可靠的實際控制還有哪幾道考驗。讀完最值得留下的問題是:多記住一段畫面,是否真的改善了下一次決策,且趕得上現場的變化?

Long-WAM 的核心:有歷史,還得會用歷史

access to history is not the same as using it

中文:能讀取歷史,不等於能有效利用歷史。

Long-WAM 論文摘要中的關鍵片語

想像輸送帶上有一個杯子。單張照片告訴你它在哪裡;前後幾張照片讓你估計它朝哪裡移動、什麼時候會到手邊。另一方面,收碗或整理積木的任務,需要知道前一步已經拿了什麼、放到了哪裡。兩種情境都需要過去,但有用的過去未必一樣長。

作者的路線,是先用機器人與第一人稱影片,在不使用動作標籤的預訓練階段,讓自回歸影片模型從先前畫面預測後續變化;再把這種依時間順序建立的結構,接到動作模型。自回歸在這裡可以白話理解為「用已經發生的部分,預測接下來的部分」。這讓預訓練與操作時的資訊方向更接近。

Long-WAM 論文圖 1:影片預訓練、動作適配、歷史長度與部署架構
圖/Wei Huang 等,Long-WAM 論文圖 1,CC BY 4.0;保留原圖。

圖中的「約 1 萬小時」,依附錄 B.1 是將訓練樣本按窗口累加的等價估計,並非去重後的原始影片時長。這個口徑影響你如何理解資料規模:同一段互動取出多個重疊窗口,與收集更多全新互動,帶來的資訊並不相同。

動作生成接收觀察到的歷史與模型預測的未來表徵。這種表徵是模型內部的壓縮資訊,不必先畫出一段完整影片給人看,再開始動作。因此「想像未來」在這裡是一條計算路徑,而不是機器人先播放小電影的比喻。若想補上訓練階段的分工,AI 模型怎麼學習可幫你分清預訓練與下游適配。

Long-WAM 的 78.7%:歷史有幫助,證據到哪裡?

依論文摘要、圖 6 與第 5.3 節,機器人影片自回歸初始化的模型,在 RoboCasa GR-1 上從僅保留當前觀察的 63.3%,提高到 19.2 秒歷史的 78.7%,相差 15.4 個百分點。這是作者報告的模擬評估;基準的官方倉庫也明確將 GR-1 Tabletop 定義為模擬任務,不能把這個數字當作家庭現場的成功率。

更有價值的比較,是相同因果動作適配路線下,不同影片初始化如何隨歷史長度變化。作者的自回歸初始化呈現較明顯的長歷史收益,雙向預訓練初始化在相應區間沒有相同的淨增益。這支持「訓練方式會影響歷史的價值」,但還不足以證明所有自回歸模型都勝過所有雙向模型;模型、資料與適配流程仍是比較條件的一部分。

這項研究每個歷史窗口都各自訓練模型,再在對應長度下評估。因此曲線比較的是一組模型與訓練配置,不能直接讀成同一台已部署機器人,轉動一個記憶旋鈕就能得到同樣增益。實際產品若想依場景調整窗口,還要驗證切換後的行為。

原文有一處值得保留的歧義:表 4 把 2.4 秒配置列為 63.3%,第 5.3 節與專案摘要則列 66.3%。這篇採用摘要與圖 6 一致的「當前觀察 → 19.2 秒」比較,不以表 4 的 2.4 秒數字計算精確增益。讀者若要重做實驗,應先向作者核對這項配置,而不是把兩種標示混成同一個基準。

107.4 ms 與 19.2 秒:兩個好數字不能直接拼在一起

論文附錄 G 的表 12將 RTX 5090 上的每個動作區塊推論時間,按歷史長度分開列出。107.4 ms 對應 2.4 秒歷史;19.2 秒歷史對應 341.0 ms。所以「19.2 秒歷史提升成功率」與「107.4 ms 推論」是各有條件的結果,不是同一配置同時交出的成績。

歷史窗口RTX 5090 每區塊推論時間
0.0 秒(保留當前觀察)74.6 ms
2.4 秒107.4 ms
4.8 秒138.3 ms
9.6 秒204.5 ms
19.2 秒341.0 ms
作者報告的 Long-WAM 優化推論配置,論文附錄 G、表 12;包含觀察影像 VAE 計算。

附錄 F 還界定了計時範圍:包含觀察影像編碼與推論,排除前處理、文字編碼,以及控制器與程序間通訊開銷。把 107.4 ms 取倒數得到的推論吞吐率,也不是機器人的控制頻率。對實際抓取來說,需要追的是「相機看到變化,到新動作真正生效」的時間。

這個區分影響很大。杯子移動時,較準但太晚的決策可能錯過抓取;較快但依據過時的決策,也可能抓到空處。記憶與速度應該放在同一張成績單上,而不是各挑一個漂亮數字。AI Evals 入門談的固定驗收條件,在這裡也適用:先確定要保護的行為,再挑量測。

讓機器人繼續動:省時間的關鍵在交接

Long-WAM 的系統層把推論與既有動作重疊,並讓觀察影像一批批提前編碼。機器人執行上一段動作時,系統準備下一段;交接時,對準已經流逝的時間,採用新區塊中仍適用的後半段。量化、快取重用與裝置調校,則降低這條推論路徑的成本。

Long-WAM 論文圖 3:串流影像編碼讓推論與機器人動作重疊的時間線
圖/Wei Huang 等,Long-WAM 論文圖 3,CC BY 4.0;保留原圖。

這能減少等待,但交接仍有期限。若新決策抵達太晚,就算後台一直在計算,也不能保證動作不中斷。作者的時間線特別有用:它把「總共算多久」與「觸發下一次推論之後,還剩多少工作」分開,後者才直接決定是否趕得上交接。

獨立的Motubrain 非同步部署研究同樣把觀察、預測與執行命令的時間對齊列為核心問題,並比較平滑與精確度的取捨。這是機制上的外部支持,不是對 Long-WAM 成功率的重現。它提醒我們:讓手臂一直移動,與讓手臂持續做對,必須分開驗。

真實抓杯、模擬規劃,各自回答不同問題

在作者的 Unitree G1 動態疊杯條件下,Long-WAM 完成 20 次中的 19 次,即 95%;比較的兩個基線在各自 20 次中皆為零。第 6.1 節與圖 7限定了這個結果的任務與樣本數。它是有價值的實體操作證據,但 19 次成功不能替不同光線、杯型、遮擋或突發干擾下的表現蓋章。

Long-WAM 論文圖 7:Unitree G1 動態抓杯與疊杯的作者測試數據與選定畫面
圖/Wei Huang 等,Long-WAM 論文圖 7,CC BY 4.0;保留原圖。各條件為作者的 20 次試驗,畫面是選定示例。

論文也提供 LIBERO、RoboTwin 2.0、DOMINO 模擬基準與 YAM 長任務結果,再把 Long-WAM 接到高層規劃器。後者在 RoboCasa365 的作者評估中,提高了組合任務表現。這兩層分工值得注意:短期物理歷史幫助「現在怎麼做」,高層規劃則維持「接下來要完成什麼」。把整段長目標塞進底層控制器,不是唯一可考慮的設計。

這也是為什麼展示影片要分清真實執行、模擬執行與模型生成的預測。能畫出合理的物體移動,與手臂真正完成移動,是不同的測驗。看影片時先辨認它是哪一種,再把畫面接回對應的實驗條件;漂亮的示例不能替整個試驗集合做平均。

AlphaLab 的判讀:值得追的是記憶如何換成更好的控制

我同意:記憶應該按任務的時間尺度配置

短期移動方向、近期交互狀態、長期任務目標,是不同的資訊需求。選窗口之前,先問「眼前這個決策缺了什麼線索」。若新畫面已足以判斷動作,回看更久可能只是增加負擔;若先前狀態仍決定下一步,截斷歷史又可能造成重複或遺漏。合理的設計目標,是保留決策所需的證據。

我存疑:目前的曲線還不能給出普遍最佳記憶長度

窗口越長不代表真實資訊越多。作者在更長窗口的分析中,指出大量歷史取樣來自補齊畫面,並把有效資料不足列為可能解釋。因此,長窗口表現回落,可以促使我們檢查資料覆蓋,卻不能直接宣布模型「記憶到這裡就到頂」。要區分容量限制與資料問題,應比較真正連續、足夠長的互動紀錄。

未來預測值不值得保留,要看同樣的時間預算

Fast-WAM 的原始研究提出另一條路:訓練時保留影片共訓練,推論時省去明確未來生成,在其評估中仍得到有競爭力的表現。這使 Long-WAM 的選擇更值得比較,而不是更容易下定論。兩套方法的資料、模型與測試條件不同,不能只抄各自一個延遲數字就排名。

公平的下一步,是固定可用的反應時間,再比較保留預測、簡化預測與直接生成動作。前一條路若增加準確度,還要看它是否在截止時間之前交付;後一條路若省時,也要看失敗集中在哪類互動。只要其中一種在你的場景更可靠,便值得留下,無須先替架構選陣營。

下一份值得等的證據:一張完整任務成績單

我會追三類資料:同一配置下,歷史長度、閉迴路成功率與完整反應延遲的共同量測;不同場景與物體下,失敗如何分布;以及單一策略動態選擇歷史窗口後,是否改善任務而非只縮短推論。這些證據會把「會記得」推進成「記得有用,而且及時」。

一般讀者可以把同一套問題帶到下一則機器人新聞:數字是哪個場景、同一配置嗎、成功與速度是否一起量?開發者則可先替自己的任務畫出觀察到動作的時間線,列出截止時間與失敗條件,再決定要增加哪段歷史。模型與執行層的分工,可接著看AI Agent Harness;需要把停止與錯誤處理具體化,最小 Harness 實作提供另一個系統層的參照。

接著閱讀

左右滑動查看更多推薦

下一次看到「記憶更長,而且更快」,先把兩個數字放回同一個配置。若它們對得上,再看完整任務是否更可靠。Long-WAM 值得追蹤的方向,是讓歷史成為按需要分配的控制資源;真正的進步,會出現在機器人每一次需要及時做對的交接裡。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。已訂閱?管理主題偏好(會寄登入連結到你的信箱)