2026 年 9 月 1 日,World Labs 在官方研究部落格發布〈Atlas: A World Model for Spatial Intelligence〉,介紹 Atlas,並把 World Labs Atlas 稱為一個能共同處理文字、影像、影片與 3D 的「omni world model」。真正值得注意的,不只是它能生成好看的畫面,而是同一套模型開始同時碰觸鏡頭控制、幾何重建與 Real-to-Sim;但這三件事加起來,仍不能直接推導出「它懂物理」。
這篇文章會依序拆解三層證據:先看它如何控制觀看路徑,再看兩三張圖能恢復多少幾何,最後檢查機器人展示是否真的驗證了因果與物理。讀完後,你會有一套比「demo 很驚艷」更可靠的世界模型判讀框架。

World Labs Atlas 的核心主張:一個模型處理多種空間任務
「Omni」是 World Labs 對 Atlas 模型設計的定位。公告描述它為單一多模態自回歸擴散 Transformer,原生輸入包括文字、影像、相機姿態與 3D 深度圖;影片則被表示成影像序列。模型因此能在共同的 3D 脈絡中,處理相機控制生成、新視角合成、深度/逐像素 3D 點估計與空間重建。
這個整合才是 Atlas 最有價值的地方。過去創作者常要把生成模型、相機控制、深度估計與 3D 表示串成一條容易失真的管線;Atlas 想把中間轉換收進同一個模型。這不代表每個能力都是第一次出現,卻可能減少工具之間的語意與幾何落差。
公告還展示兩項延伸能力:以三至五台一般相機拍攝的影片重建多視角畫面,做出時間凍結與重新取景效果;以及從文字或影像提示生成 360 度全景。World Labs 也表示內部模型隨訓練算力增加而提升,但沒有在這次公告附上模型規模、資料量或完整縮放曲線,因此這部分更適合視為研發方向,而不是可外部比較的成績。
1440p 一分鐘:原生相機路徑已展示,但 benchmark 並非同條件比較
官方頁面展示一段由少量參考影像生成、長約一分鐘的 1440p 影片。對世界模型而言,「能看一分鐘」只是表面;更關鍵的是使用者提供數值化相機路徑後,畫面能否沿著路徑移動,同時維持同一場景的外觀與空間結構。這比只輸入「向右平移」之類文字提示更接近 3D 工作流程。

World Labs 公布的人工偏好測試顯示,Atlas 對五個影片模型的勝出比例為 75% 至 94%,圖表也列出各組 95% 信賴區間。這是有方向性的證據,卻不是同條件比較的排行榜:Atlas 拿到原生數值相機路徑,其他模型拿到由路徑翻成的文字描述;公告也承認,更細緻的提示可能改善對手結果。截至 2026 年 9 月 4 日,公告列出模型名稱、偏好比例與信賴區間,但未附可下載評測集或逐題結果。最穩健的結論是「Atlas 展示了更直接的相機控制介面」,而不是「已證明影像品質全面領先」。
兩三張圖的「重建」:看見的是測量,看不見的是生成
Atlas 另一個吸睛主張,是只靠兩三張影像就能做出忠實重建。要理解這句話,必須把「已觀測區域的幾何估計」與「遮擋區域的合理補全」分開:前者可以和真值比較,後者在輸入裡根本沒有唯一答案。
“When parts of the world are not visible in the input views, Atlas imagines a plausible way to fill in the gaps…”
中文:「當輸入視角看不到場景某些部分時,Atlas 會想像一種合理方式補上缺口……」
World Labs,Atlas 公告

World Labs 表示各 baseline 都依共同協定重跑;在這個 pointmap(逐像素 3D 點圖)評測中,Atlas 的 AbsRel(絕對相對誤差,越低越好)為 25.3 ×10−3,也就是 0.0253;Pi3X posed 為 28.7 ×10−3,也就是 0.0287。以 Pi3X 為基準,Atlas 約低 11.8%。不過這項測試要求模型替輸入影像裡的每個像素預測 3D 點;它沒有驗證遮擋背面的補全是否正確,也沒有評估新視角材質、3D Gaussian splat(以 3D 高斯點表示並即時渲染場景的方法)、碰撞網格或動態。
換句話說,這類輸出混合了已觀測區域的幾何估計與未觀測區域的生成,因此不能直接等同量測級掃描。Atlas 公告自己使用「想像合理補法」這個動詞,反而提供了正確的閱讀方式:可見處偏向重建,不可見處偏向生成。產品若要服務工業量測或安全關鍵機器人,還需要把不確定性明確標示出來。
從 Real-to-Sim 到物理:Atlas 展示了觀測,不等於因果

Atlas 的機器人章節展示兩條路徑。導航示範是在外部指定的相機路徑上渲染 RGB 與深度;操作示範則走得更遠,World Labs 表示它以少量實拍資料協助建立模擬,涵蓋剛體、關節物體與可變形物體的互動。後者不只是移動鏡頭,但發布頁呈現的是整體應用結果,還沒有拆出 Atlas 本身對動力學的貢獻。
官方公告列出的原生條件是文字、影像、相機姿態與深度圖,沒有把動作、力、摩擦係數、材質或接觸狀態列為可驗證介面。這不證明模型內部完全沒有相關知識,只表示這次發布沒有提供足以把因果動力學表現歸因到 Atlas 本身的模型層證據。
World Labs 自己的世界模型分類文章也提醒:生成幾何可能視覺正確,卻有錯誤尺度、自相交或不合理物理。它的Real-to-Sim-to-Real 系統則明確說明,每個任務會組合不同表示與建模技術。這代表機器人影片展示的是整套工作流的可能性,不能把所有物理能力單獨歸功於 Atlas。
若要檢驗 Atlas 生成影片的物理一致性,可先接受 Google DeepMind repository 目前建議的 Physics-IQ Verified;它以實拍影片涵蓋碰撞、流體動力學、重力與材料性質等現象。若要證明機器人因果模擬,則還需公布可歸因於 Atlas、以機器人動作為條件連續預測後續狀態的結果,以及模擬訓練成果移轉到真實機器的指標。鏡頭移動是一段觀看路徑;動作造成狀態改變,才是物理因果。
較可辯護的新意:把多種空間能力統一進同一架構
少量帶相機姿態的影像合成新視角並非始於 Atlas。CAT4D 已展示以三張帶相機姿態的影像生成不同視角與時間組合;3D Gaussian Splatting 則以 3D 高斯點表示場景,並在 1080p 展示至少 100 fps 的高品質新視角合成。
Atlas 較可辯護的整合敘事,是讓同一架構在共享空間脈絡中處理生成、視角合成與深度/pointmap,再由這些輸出形成 point cloud 或 3D Gaussian splat。對遊戲與空間設計,這可能縮短概念圖到可探索場景的路徑;對機器人,它可能降低建立視覺與幾何素材的成本。至於能否取代專用重建器、碰撞建模或物理引擎,現有發布資料還不足以回答。
AlphaLab 的判讀:先把 Atlas 當成空間內容引擎
我同意的部分
- 創意預視最接近可用:生成、相機控制、幾何與顯式 3D 輸出若能維持場景一致,會比多工具拼接更容易迭代。
- 3D 製作仍要量測:導演可以先用原生相機路徑排鏡頭,但設計師仍應檢查尺度、拓撲與人工修正時間。
- 機器人應分層驗收:導航畫面可先測視覺與深度;涉及接觸的操作任務,還要另驗動力學與真機遷移。
我保留的部分
- 公司公布的評測仍有披露邊界:兩張圖表都有清楚的任務價值;相機圖雖列出 95% 信賴區間,截至 2026 年 9 月 4 日的公告仍未附投票人數、完整評測樣本與逐題設定,且輸入方式不對稱。
- 視覺一致不等於物理正確:相機路徑驗證的是觀測;機器人控制需要動作、狀態與接觸的因果驗證。
- 補全必須帶著不確定性:未觀測區域可能看似合理,但 World Labs 自己提醒,生成幾何可能有錯誤尺度或自相交,進而導致不合理物理。
什麼證據會改變判斷
下一步應看六件事:公開模型卡與評測集、相機姿態誤差、未參與輸入的測試視角品質、遮擋區不確定性、可碰撞網格與尺度一致性,以及以動作為條件的模擬能否成功移轉到真實機器。如果 World Labs 能讓外部團隊在同一協定下重現這些數字,Atlas 才會從令人信服的空間內容引擎,向通用世界模擬器再走一步。
現在該怎麼看 World Labs Atlas
Atlas 目前進入面向特定合作夥伴的早期存取階段。創作者應關注鏡頭可控性、長片段的場景一致性與輸出能否進入既有 3D 工具;空間設計團隊應測量尺度、拓撲與人工修正成本;機器人研究者則要把畫面品質放到第二順位,優先追問碰撞、動力學與模擬轉真實指標。
我的結論是:World Labs Atlas 已把「生成一段影片」推向「生成一個可由指定相機路徑探索,並輸出 point cloud 或 3D Gaussian splat 等空間表示的場景」。這是實質進步;但公告直接提供的量化證據集中在相機路徑偏好與逐像素 3D 點重建,還不足以單獨證明完整的物理世界。把兩者分清楚,才能看見它真正的價值,也不會替 demo 補上尚未出現的證據。
接著閱讀
左右滑動查看更多推薦
接下來看任何「世界模型」發布時,先依序問四題:鏡頭是否可控、幾何是否可測、遮擋是否標示不確定、動作是否真的造成可驗證的狀態變化。






