這篇 WorldCrafter 教學先從一個陷阱開始:一張照片做成能前進、轉彎的影片,很容易讓人誤以為 AI 已經「建好一個 3D 世界」。但真正值得問的不是鏡頭會不會動,而是鏡頭離開原位、看見新區域,再沿路返回時,原本的物件、遮擋關係與紋理還在不在。
這篇 WorldCrafter 教學不要求你懂 3D 建模,也不把漂亮 demo 當答案。你會先用一張有前景、中景、背景的圖片,依官方 camera action 語法設計三條「回頭路徑」,再用同一張驗收表檢查返回原視角、遮擋背面、重複紋理與動態物件。讀完後,你應該能分辨:哪些畫面只是合理補圖,哪些證據才支持模型真的保留了長期視覺記憶。
WorldCrafter 教學核心:可控移鏡不等於記住世界
3D 記憶可信度=鏡頭離開舊視角後,沿路回來時,舊證據還對得上。
WorldCrafter 是一個由單張圖片或文字起步、依相機姿態逐段生成影片的世界模型。它不是輸出可編輯 mesh 的傳統 3D 引擎,也不是物理模擬器。論文稱它具有 implicit 3D-aware memory,意思是模型用隱式表徵保存與視角有關的歷史資訊;生成時並沒有先建立一份可讓你直接檢查的深度圖或完整 3D 場景。論文展示的點雲,是生成後另用模型重建來評估,不是 WorldCrafter 內部直接存著的世界。
如果你第一次接觸這類系統,建議先讀 AlphaLab 的世界模型入門。想看另一種可探索世界的產品思路,可對照 World Labs Marble/Atlas 世界模型;要理解「看起來像 3D」和「可被 agent 使用」之間的差距,則可延伸到 VibeWorlding 3D 世界評測。
WorldCrafter 到底怎麼記:三層白話拆解
第一層:近期畫面讓動作接得順
模型一次不是生成整支長片,而是生成一個接一個的短片段。每個 action 對應 33 幀,前一段的近期內容會成為下一段的上下文,因此人物動作、光線和鏡頭移動通常能短暫銜接。可是只靠近期上下文,走遠之後最早的畫面會被擠出視野;這正是長影片常出現「回家卻變成另一間房」的原因。
第二層:歷史視角被壓成固定大小的記憶
WorldCrafter 的 memory encoder 會從歷史挑出最新一幀與八個互補視角,盡量涵蓋接下來可能看到的區域。這些歷史影像與相機姿態被編碼後,不會無限堆進生成模型,而是壓成固定大小、相當於四個完整畫面的記憶 token。好處是影片變長時,主要生成模型的記憶預算不必跟著線性膨脹;代價是選錯歷史、壓縮遺失細節,仍可能讓舊世界變形。
第三層:未來相機姿態決定要讀哪段記憶
所謂 pose-conditioned readout,可以想成「帶著目的地去查相簿」。模型不只問歷史有哪些畫面,還用下一段相機路徑的姿態去查詢哪些舊視角最相關,再把記憶、近期上下文與目前要去雜訊的新片段一起交給 video DiT。這使它比單純把前一段影片接下去,更有機會在長距離移動後找回早期場景。

開始前準備:挑對圖片,比 prompt 更重要
截至 2026 年 9 月 23 日,沒有 TencentARC 官方公開 Space。可先使用 Hugging Face 團隊成員在官方 GitHub issue 分享的社群 WorldCrafter demo,但要把它視為方便測試的第三方介面,不要當作官方產品保證。當日介面可上傳圖片、輸入 prompt 與 camera actions,最多設定六個 chunks;輸出標示為 384×640、16 fps,每段 33 幀。
- 選靜態、層次清楚的圖:前景放欄杆、門框或樹幹,中景放主體,背景放建築或地平線。三層越清楚,越容易檢查遮擋與比例。
- 保留可數的地標:例如三扇窗、五根柱子、規則磁磚。它們比「感覺像原圖」更容易驗收。
- 先避開擁擠人群:動態物件本來就會改變;第一次測試先用靜態場景,第二輪再加入人物或車輛。
- 固定 prompt、seed 與輸入圖:三條路徑只改 camera actions,否則無法知道差異來自路徑還是隨機性。
- 保存紀錄:記下檔名或雜湊、prompt、seed、action 字串、chunk 數與產生日期。之後版本改動才有可比較基準。
公開 demo 的執行狀態與排隊資源可能變動;如果頁面不可用,先保存下方腳本,不要為了完成一次測試就直接下載數百 GB 權重。
WorldCrafter 教學實作:三條回頭路徑
下列字串依照官方 action parser 的語法設計。@last_frame include 會把輸入圖保留為第一幀;reverseN 是沿前 N 個 chunk 的相機姿態反向走回去,不是把影片倒播。座標慣例是 +X 向右、+Y 向下、+Z 向前。官方也建議單一 chunk 的平移不超過 5 個單位。
測試一:短折返,先驗證基本返回
@last_frame include
forward1
reverse1
鏡頭前進一段,再原路退回。把第一幀與最後一幀並排,先看四件事:主要地標是否仍在同一側、主體比例是否接近、輪廓是否改形、背景線條是否漂移。這條路徑若已失敗,後面更長的測試通常沒有解讀價值。
測試二:轉角折返,檢查遮擋背面
@last_frame include
forward1
right1
yaw_left30
reverse3
這次先前進、右移再左轉,會暴露原圖沒有拍到的表面。那個新表面無論多合理,本質上都是模型補出的假設,不能拿來證明它「記住」了背面。真正的考題是返回後:原本被欄杆遮住的邊界是否回到原位?窗戶數量是否恢復?物件前後關係是否與起點一致?
測試三:斜向加轉彎,壓力測試重複紋理
@last_frame include
forward1&right1
yaw_right30
forward1
reverse3
& 代表同一段同時前進與右移。斜向運動、旋轉、再前進會讓模型同時處理視差、新區域與細節壓縮。特別去數磁磚、欄杆、窗格與招牌字:它們最容易在離開後被複製、吞掉或改寫。若場景有行人或車輛,評分重點是身分與外觀能否延續;不要要求它精確還原真實物理狀態,因為系統沒有釋出物件層級的物理控制介面。
逐格驗收:不要只看影片順不順
每條影片都截四個節點:起點、最遠點、折返中點、返回點。用「通過/輕微漂移/失敗」三級評分,而不是只寫好看或不好看。
- 返回原視角:地標位置、大小、輪廓與背景透視都接近起點,才算通過。只是色調變化可記為輕微漂移;門窗換位置、主體換造型則是失敗。
- 遮擋關係:前景重新遮住同一區域,邊界沒有穿透或黏合。新看到的背面只評「是否合理」,不評「是否真實」。
- 重複紋理:數量、順序、間距要能對回起點。規律圖案被多複製一排,通常就是記憶或生成一致性破綻。
- 動態物件:人物衣著、車種與大致身分要連續,但位置與姿勢可隨時間改變。若人物消失後回來變成另一個人,判定身分失敗。
- 鏡頭路徑:折返應近似沿原路回來。若畫面內容穩定但終點根本沒回到起始姿態,這是相機遵循失敗,不是記憶通過。

如果想把主觀判斷做得更穩,可邀請另一人只看打亂順序的「起點/返回點」配對,不告訴他哪支影片是哪條路徑。這不是論文級 benchmark,卻能減少自己因期待而放寬標準。需要更正式設計評測時,可參考 AlphaLab 的 AI Evals 入門。
論文成績怎麼看:Fast 不一定只是縮水版
作者用 145 張起始圖、每張五條路徑,共 725 支影片評估,路徑長度為 528 至 1,648 幀,並包含閉環返回。作者報告中,Base 的返回指標為 MEt3R 0.166、LPIPS 0.255、PSNR 18.016、SSIM 0.517;Fast 分別為 0.129、0.186、20.868、0.616。對前兩項來說越低越好,後兩項越高越好,因此 Fast 在這組返回指標反而更好。Base 則在該論文比較的相機控制指標居首。
這些數字來自作者自己的論文評測,尚不是獨立重現;不同 baseline 也混有完整步數與蒸餾版本。正確解讀是「論文提供一套有閉環路徑的證據」,不是「任何圖片都已通過」。你的三條路徑,正是把抽象分數轉成自己可觀察的錯誤模式。
要不要本機跑?先算清楚三道門檻
門檻一:不是下載 59.5GB 就結束
Hugging Face 顯示 Base 權重約 59.5GB、Fast 約 147GB。但官方安裝方式指出,Base 還需要 Fast 目錄中的 shared components;照官方指示同時下載兩者,光模型檔就約 206.5GB,尚未包含 Python 環境、快取、輸出與暫存空間。不要直接照 Base model card 自動產生的通用 Diffusers/MPS 程式碼;官方 repository 的實作要求 CUDA,並使用專案內的自訂套件。
門檻二:截至 2026 年 9 月 23 日,官方未公布最低 VRAM
官方列出的環境是 Linux、NVIDIA GPU、相容驅動與 CUDA,本機互動 demo 曾在單張 H200 驗證;論文提到四 GPU 機器可達最高 16 generated fps,卻沒有交代 GPU 型號與可重現的延遲表。既然沒有最低 VRAM 數字,就不該推算某張消費級顯卡「一定能跑」。一般讀者先用公開 Space 驗證題目價值;真的需要批次、私有資料或自訂 camera.npy,才考慮租用合適 NVIDIA GPU。
門檻三:授權只允許學術用途
WorldCrafter 授權限制為 academic purposes,並明確禁止 commercial or production use。這不是部署前才補看的附註,而是是否值得下載的第一個決策條件:課堂研究、非商業實驗可再核對完整條款;商業影片服務、客戶專案或正式產品,不應把這個權重當可直接上線的方案。
實際決策:只想理解能力邊界,先跑三條 Space 路徑;要做可重複研究,才準備約 206.5GB 以上空間與 CUDA 機器;用途涉及商業或正式生產,就停在這裡,另找授權允許的模型。
常見失敗,分別代表什麼
- 一離開就改造原圖:近期生成不穩,先縮短步幅、簡化 prompt,再測記憶。
- 最遠點很漂亮,回程卻變形:新視角補圖能力不差,但歷史提取或回讀不足。
- 內容對,終點視角不對:優先判為 camera adherence 問題,不要錯怪長期記憶。
- 靜態建築穩,人物換身分:幾何線索保留得比動態主體狀態好;這不代表模型理解人物行為。
- 長路徑才失敗:符合論文自己承認的限制;複雜或延伸軌跡仍可能破壞一致性,而且每段都重新編碼歷史會增加延遲。
WorldCrafter 常見問題
WorldCrafter 會輸出真正的 3D 模型嗎?
不會。它輸出依相機路徑生成的影片,不是可直接編輯的 mesh、NeRF 或場景圖。論文點雲是事後重建的評估素材。
只看影片很順,可以說它有 3D 記憶嗎?
不夠。順暢可能只來自近期上下文;至少要離開原視角、增加新內容,再返回比對舊地標。
reverse3 是把前三段影片倒播嗎?
不是。它反向追蹤前三段相機姿態,畫面仍由模型重新生成,因此正好能拿來測返回一致性。
新露出的牆面很合理,算記憶成功嗎?
不算。單張圖沒有提供牆面背後的真相;那只是合理生成。返回後原本可見的證據是否恢復,才是記憶測試。
Base 59.5GB,下載它就能跑嗎?
不能只下載 Base。官方流程還需要 Fast 目錄的共享元件,兩者合計約 206.5GB,另需 CUDA 環境與額外磁碟空間。
Mac 可以照 Hugging Face 的 MPS 範例跑嗎?
不要照通用範例推論。官方 repo 的實作明確要求 CUDA;model card 自動產生的通用程式碼不等於專案已支援 Apple MPS。
可以把 WorldCrafter 用在商業影片嗎?
依目前授權不可以。權重限學術用途,且禁止商業或生產使用;採用前仍應閱讀完整授權。
三條路徑都通過,就代表理解物理嗎?
不代表。它只顯示這些輸入與路徑下的視覺一致性較好,沒有證明因果、碰撞、物體恆存或真實物理推理。
接著閱讀
左右滑動查看更多推薦






