2026 年 9 月 23 日,Haotian Zhang、Hokin Deng 等研究者在 arXiv 發布論文〈Training Object Permanence in World Models〉:WROP 物體恆存研究要問的是,影片世界模型能否讓一顆被杯子遮住的球,在畫面看不到它時仍保持存在、位置與身分。這篇文章先還原研究設計與成績,再檢查分數能證明什麼。

一顆球消失在杯子後,為何是世界模型的硬題?
如果模型只根據眼前像素猜下一格,遮蔽物移開後,球可能憑空消失、換色,或從錯誤的杯子出現。物體恆存要求它在不可見期間仍追蹤物件;「固體性」則要求它在碰撞與支撐改變後遵守幾何與運動後果。兩者是可檢驗的局部能力,不能直接等同完整的物理理解。
這條研究路線並非從 WROP 才開始。2020 年的物體恆存研究已把可見、遮蔽、被容器包住與隨容器移動分開測試;WROP 的新處在於把這些問題做成可大量生成的影片續接訓練與考卷,並一起加入阻擋、掉落、碰撞。
WROP 物體恆存資料怎麼造?
研究團隊用 Blender 手工設計 150 個場景生成器,分為六類:動態遮蔽、靜態遮蔽、容器藏物,以及障礙物、支撐移除、碰撞。每類在物件數、速度、鏡頭、照明等條件上變化。作者報告每個生成器產出 1 萬個訓練樣本,合計 150 萬筆;另從每個生成器抽兩題,組成 300 題考卷。這是同一組生成規則下的不同樣本,尚不能當成跨場景泛化測試。

影片在關鍵事件附近切成輸入與目標兩段:模型看前段,再產生後段。論文指出,樣本是人工設定 Blender 關鍵影格,並非物理引擎自然模擬。因此「正確答案」是作者定義的合理運動;它提供乾淨的受控測試,也留下真實世界接觸、材質與雜訊的落差。

成績亮眼,但榜單回答的是一個較窄的問題
論文評估 14 個影片模型,其中 4 個做真正的影片續接、3 個依參考影片重新生成、7 個做編輯或轉換。作者的 PWM-WROP 是以既有模型微調的 160 億參數模型,也是這組比較中使用 WROP 資料訓練的模型。作者報告它在續接組排名第一,在全榜排第三;原生輸出解析度為 320 × 192。
這個排名來自 20 名評分者、361 次不同模型之間的盲測配對,而不是每個模型在 300 題上都有 300 份獨立人工判斷。論文表 2 給 PWM-WROP 的 Elo 為 1679.5、95% 信賴區間 1603.5–1781.5;排第一的兩個參考影片生成模型同為 1723.6,區間互相重疊。名次不能讀成統計上穩定的細微差距。

更重要的是三組模型收到的任務介面不同:參考影片生成能重做一段影片,續接模型必須接住上一格,編輯模型則主要重繪輸入片段。作者也提醒,架構不同,不能把模型之間的 Elo 差額全部歸因於 WROP 訓練。
However, because the models also differ in architecture, the performance gap cannot be attributed to training alone.
中文:由於模型架構也不同,表現差距不能只歸功於訓練。
WROP 論文,第 5.1.1 節
對照原文與公開資料,能下什麼結論?
同一生成器的考卷,還缺真正陌生的場景
WROP 物體恆存的訓練題與考題來自同 150 個生成器,只改變參數。若模型學會特定布景與事件節奏,也可能在考卷上表現很好。下一步應保留整個生成器、未見過的物件材質或自然攝影場景做測試,再看球的身分、數量與位置是否仍連貫。現有 300 題只能支持對這套考卷的判斷。
漂亮的續接畫面與可用的物理預測,仍隔著一層
論文的人評同時看文字符合度、動作自然度與物理合理性;單一 Elo 把這些感受合在一起,無法隔離「記住遮蔽物後的球」的正確率。LPIPS、MS-SSIM 等自動指標則測影片與目標畫面有多像,作者自己也說它們不直接測物體恆存。若要支援機器人決策,還須檢查物件軌跡、接觸時刻與行動後果,而非只看影像品質。
這不是空想的保留條件。另一篇 2026 年機器人世界模型綜述在小型診斷中展示遮蔽物後物件遺失與機械臂穿過桌面的例子;它不能替 WROP 做獨立複驗,卻說明從可看影片走到可供行動的預測,還有不同層次的測試。
開放材料降低複驗門檻,成績仍待外部對帳
研究頁面目前連到訓練資料、考卷、程式碼與模型頁。公開連結使外部團隊有材料可以重跑;本文所引用的成績仍來自作者的評估與示例,後續還要看外部團隊按相同設定重跑後能否得到相近結果。
我同意什麼,存疑什麼?
我同意:把「看不見時仍存在」拆成可以生成、控制與失敗分析的場景,比泛稱影片模型「懂物理」更可檢驗。六種家族的差異也提醒我們,遮蔽、支撐與碰撞需要分開看。
我存疑:作者自建資料訓練、再用同族生成器考核,且與不同介面的模型合榜,尚不足以宣稱一般世界模型已取得穩定物理推理能力。WROP 更像一套有價值的訓練場和初步成績單;真正突破要看獨立團隊在未見場景、自然影片與下游行動任務上的結果。
接下來看哪三件事?
- 跨生成器:整類未見過的遮蔽或碰撞場景,是否仍保持物件身分與數量?
- 公平消融:同一基座模型、相同算力與介面,加入 WROP 訓練後究竟改善多少?
- 行動價值:模型的預測能否改善機器人規劃或風險辨識,而非只讓影片更順?
讀這篇論文時,可以先打開作者展示頁,挑一個杯子遮住球的例子,逐格記下「遮住前在哪裡、遮住期間怎麼移動、露出後是否同一顆」。這比只看排行榜,更接近 WROP 物體恆存真正要測的問題。
接著閱讀
左右滑動查看更多推薦
下次看到「世界模型懂物理」的宣稱,先問它通過的是哪一種遮蔽、碰撞與未見場景測試。






