跳到主要內容

4DAnyone 深度解讀:一段影片真的能變成自由視角 4D 人物?(2026)

最後更新: ·
4DAnyone 將單鏡頭人物影片轉成多視角影片與自由視角 4D 人物的概念圖

2026 年 8 月 20 日,浙江大學、Robbyant、Ant Group、香港科技大學與香港中文大學團隊在 arXiv 發布 〈4DAnyone: Create Anyone in 4D from a Casual Monocular Video〉,主張 4DAnyone 能從一段未校正的單鏡頭人物影片,先生成同一段表演的多個虛擬機位,再重建可自由切換視角的動態 4D 人物。

4DAnyone 官方專案頁,列出論文、程式碼與模型入口
4DAnyone 官方專案頁;點圖可開啟原始頁面。

這個故事真正值得問的,不是「AI 能不能補出背面」,而是補出的多個視角是否一致到足以支撐 4D 重建。本文先忠實拆解方法,再用量化結果、公開程式與前作逐一查證,最後給出 AlphaLab 的獨立判斷。

“Single video in, 4D human out. No rig, no calibration, no tripod.”

中文:輸入一段影片,輸出 4D 人物;不需要實體多機架、預先校正或腳架。

4DAnyone 官方專案頁

4DAnyone 不是把影片「掃描成 3D」

單一鏡頭只記錄看得到的表面。整段輸入都未拍到的背面衣服花紋、髮型、配件與遮蔽區域,並沒有藏在像素裡等待還原;它們只能由模型依訓練先驗生成一個合理版本。4DAnyone 的「4D」指的是隨時間變動、可從新視角播放的 3D 表示,不等於精密人體掃描,也不代表能把人物任意重新綁骨或換動作。

因此,較準確的說法是:它把一段單鏡頭影片轉成一組「像由虛擬攝影棚拍到」的多視角觀測,再用這些合成觀測建立動態 Gaussian Splatting。這可以降低拍攝門檻,卻沒有把未知資訊變成測量事實。

一個鏡頭如何變成虛擬攝影棚

4DAnyone 方法流程,從單鏡頭影片擷取 3D 骨架、生成多視角影片,再進行 4D Gaussian Splatting
作者公布的流程:單鏡頭輸入、骨架條件、多視角影片生成,再交給 FreeTimeGS。圖:4DAnyone 論文。
  1. 先估人體運動。GVHMR 從未校正影片估出接地的 SMPL-X 動作,再把選定的身體、腳與手掌關節畫成帶深度遮擋關係的 3D 骨架。
  2. 再生成虛擬機位。以 Wan2.2-TI2V-5B 為骨幹的影片擴散模型,同時讀取原影片、既有參考視角與目標骨架,生成指定相機角度的影片。
  3. 讓許多視角互相傳話。Reference Context Packing(RCP)用不同解析度打包少量代表性參考;Target Context Routing(TCR)則在去噪早期輪換四視角小組,讓原本分批生成的鏡頭交換資訊。
  4. 最後重建動態人物。論文把生成影片交給 FreeTimeGS,最佳化成可隨時間與觀看位置改變的 4D Gaussian Splatting。

“The bottleneck is therefore not only view control …”

中文:瓶頸不只在於控制視角……

4DAnyone 論文

這句話抓到方法核心。單張背面圖看起來漂亮並不難,難的是帽子、樂器、衣褶與四肢在 16 個相機、近百個時間點都指向同一個人。RCP 宣稱的固定成本只限於「參考 token 的上下文」;目標視角越多,分組去噪與後續 4D 重建的總工作量仍會增加。

真正的新意,不是「單鏡頭變 4D」本身

這條路線早已有多個前作。HumanNeRF 在 2022 年展示從單鏡頭人物影片合成自由視角;CAT4D 把單一影片、生成式多視角與動態 Gaussian Splatting 串成一般場景流程;Diffuman4D 已使用骨架條件與多視角影片生成,但輸入仍是已知相機的稀疏同步影片。

更接近的 Flex4DHuman 在 2026 年 6 月就把單一靜態相機人物影片生成為密集同步視角,再交給 FreeTimeGS。AlphaLab 對兩篇 v1 的交叉閱讀顯示,4DAnyone 的可辯護增量,是容納未知內外參與輕微相機移動,不把相機參數直接餵給生成模型,而把 3D 骨架投影到指定目標相機作為條件,再以 RCP、TCR 把更多視角納入同一套一致性設計。這是一個有價值的系統組合,但不是新任務的誕生。

作者數字很亮眼,但測到的是什麼?

作者報告的測試DNA-RenderingDyMVHumans
生成影片一致性:4DAnyone24.33 / .862 / .16324.48 / .862 / .109
生成影片一致性:ReCamMaster†21.47 / .806 / .21021.94 / .833 / .142
4DGS 重建:4DAnyone24.15 / .863 / .15923.28 / .846 / .117
4DGS 重建:ReCamMaster†20.55 / .807 / .21419.86 / .795 / .159
數值依序為 PSNR(越高越好)/SSIM(越高越好)/LPIPS(越低越好)。ReCamMaster† 是作者用相同訓練資料集與設定微調、並加入 RCP、TCR 的版本;以上皆為作者報告,未經 AlphaLab 重跑。
4DAnyone 與 MV-Performer、TrajectoryCrafter、ReCamMaster 的多視角生成比較
這是作者比較圖,未經 AlphaLab 重跑。圖:4DAnyone 論文。

差距在論文設定內相當明顯,但樣本只有 10 段 DNA-Rendering 與 3 段 DyMVHumans,共 13 個場景;每段以 16 個相機、98 幀評估,4DAnyone arXiv v1 的表 2 也未報信賴區間。兩個其他基線以零樣本、不同解析度流程運行,ReCamMaster† 則經作者重新訓練與修改,所以「在這三種配置、這兩個資料集上領先」比「全面超越既有方法」更準確。

還要留意「生成影片一致性」的定義:作者用 12 個生成視角訓練 FreeTimeGS,再拿它去預測另外 4 個生成視角。這能測出生成影像是否彼此相容,卻不能證明看不見的背面就是本人真實外觀;一致的幻覺仍可能拿到高分。另兩項與同步相機真值比較的指標更有力,但仍是影像空間的 PSNR、SSIM、LPIPS;4DAnyone arXiv v1 未報告直接幾何、布料物理或不可見身分細節指標。

程式碼是真的,端到端重現還差一段

截至 2026 年 8 月 22 日,官方 GitHubHugging Face 權重 已公開,下載後可追到人體運動估計、骨架渲染、RCP/TCR 與多視角影片推論。這不是只有展示影片的空殼發布。

截至 2026 年 8 月 22 日的官方 main commit 48d1f77,教學把多視角輸出接到 Nerfstudio 的單一時間點前景 3DGS;README 同時把「用開源方法支援 4DGS 重建」列在待辦。論文最後使用的 FreeTimeGS 動態階段、訓練程式與量化評估流程,尚未成為同一個可重跑的官方工作流。換句話說,這個版本足以審查核心推論實作,還不足以單靠倉庫重建論文全表。

硬體門檻也不宜淡化:論文報告訓練使用 128 張 H20-3E GPU;生成四段 121 幀影片約需一張 H20 七分鐘,FreeTimeGS 約需一張 RTX 4090 三十分鐘。截至上述 commit,公開程式預設 24 個去噪步驟,與論文時間測試的 20 步不同,README 也把低於 32 GB 的低記憶體推論列為待辦。本次 AlphaLab 做的是論文、專案、程式與模型發布清單稽核,沒有把作者成績寫成自家實測。

最難的邊界:別把合理外觀當成真相

4DAnyone 失敗案例,包含寬鬆衣物跨視角不一致與錯誤腳部姿勢
論文列出的失敗案例:骨架難以描述飄離身體的衣物,姿勢估計錯誤也會傳到所有視角。圖:4DAnyone 論文。

作者明確展示兩種失敗:寬鬆飄動的衣物離骨架太遠,容易在不同相機間變形;芭蕾舞者踮足被人體估計器判成平腳後,錯誤骨架會被所有生成視角忠實繼承。截至 2026 年 8 月 22 日的官方 main commit 48d1f77,自訂輸入說明也把範圍收得很窄:直式約 9:16、單一全身或上半身人物、至少 121 幀、只有輕微相機移動。

這些限制讓「Anyone」顯得比證據寬。多人物互動、劇烈運鏡、複雜遮擋、透明或反光材質,都不應從精選展示直接外推。對真人使用時,還要把同意、身分隱私與合成內容標示當成產品規格,而不是發佈後才補的備註。

AlphaLab 判斷:它做出更一致的「合成觀測」

我們同意 4DAnyone 抓到真正的工程瓶頸:自由視角重建需要的不是一張驚豔背面圖,而是一整圈在時間、身份與幾何上互相說得通的影片。在作者挑選的 8 段 DNA-Rendering 消融測試中,生成影片一致性 PSNR 顯示 RCP 與 TCR 分別帶來約 0.60 dB 與 0.42 dB 增益;這支持兩個元件有效,卻不能單獨解釋全部基線差距。

我們不接受把成果描述成「任何隨手影片都等價取代同步攝影棚」。它取代的是推論時的硬體,不是多機測量所含的資訊;訓練本身仍依賴由 10/24/48 相機 rig 建成的同步資料集,再於訓練時抽樣其中子集。最合理的定位,是一個人類專用的生成式前端:它合成一組更適合 4D 重建的虛擬觀測,但輸出仍是受條件限制、可能一致地猜錯的研究結果。

誰現在值得試,誰應該再等

  • 研究者:值得用固定原始片單做壓力測試,公開成功與失敗的完整分母,並與 Flex4DHuman、CAT4D 或 Diffuman4D 做同資料、同解析度比較。
  • VFX 與虛擬製作團隊:可先把它當成預覽、鏡位探索或低成本素材原型;背面標誌、手指、飄動布料與接觸動作仍要人工驗收。
  • 開發者:先確認 CUDA、BF16、SMPL-X 授權與顯存,再從官方範例重跑多視角輸出;若要做可重複的製作流程,可接著看 Claude Code AI 影片工作室 的六階段驗收方法。
  • 一般創作者:如果目的只是快速做一個可環繞觀看的表演概念,4DAnyone 很有吸引力;若目的是保存人物真實外觀、法證紀錄或高精度數位替身,應等待更完整的幾何驗證與獨立重現。

接下來最值得看的不是更多精選影片,而是第三方拿未篩選手機素材做出的成功率、16/32/48 視角品質曲線,以及官方 4DGS 工作流補齊後的端到端重現。那會決定 4DAnyone 是一個漂亮研究展示,還是一條真正能進入製作現場的管線。

接著閱讀

左右滑動查看更多推薦

若只記得一件事:4DAnyone 的核心增量是讓生成視角更適合彼此重建,不是從一個鏡頭找回原本不存在的背面證據。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。