World Labs unveils Atlas, a single AI model that generates, reconstructs, and simulates 3D worlds from just a few photos
世界實驗室推出 Atlas:只要幾張照片即可生成、重建與模擬 3D 世界
World Labs 由人工智慧研究先驅 Fei‑Fei Li 共同創立,近日正式發表全新 Atlas 影像模型。Atlas 能以少量照片(從單張到數十張)即時產出完整的三維場景,並支援從任意視角的相機移動生成高畫質影片。公司聲稱,Atlas 在各項專門化 3D 任務上均超越現有模型,未來有望取代多種獨立工具。
背景與技術核心
World Labs 自成立以來的願景是「空間智慧」——讓人工智慧像人類一樣理解三維空間。Atlas 是首個以此目標大規模建置的模型,與傳統只產出平面影像或短片的多模態模型不同,它能「空間定位」每一筆輸入資料(文字、影像、影片、3D 資料),將其錨定於具體的三維座標,而非僅僅作為一維或二維序列處理。這種 空間上下文(spatial context)使模型在產生新畫面或視角時,能直接參照已知的三維結構。
在相機控制的生成任務中,使用者只需提供一張或多張參考照片,並以幾何座標(相機位置與角度)作為輸入,Atlas 即可輸出最高 1440p、長度達一分鐘的影片。相較於需要文字提示的影片擴散模型,Atlas 的幾何輸入更直觀、可控,避免了「隨機抽籤」式的生成結果。
重建與模擬的突破
Atlas 能從極少的照片重建真實場景,最少只需單張影像,最多可接受數十張。輸入的照片越多,模型需要自行補完的部分就越少,重建品質相應提升。World Labs 表示,僅憑兩三張照片,Atlas 已能產出與專門 3D 重建模型相當甚至更佳的結果;在處理上百張照片時,亦能順利組合出完整的場景,例如在示範中,Atlas 以 2 至 25 張校園地面照片逐步拼湊出斯坦福大學主校區,並生成俯瞰全校的鳥瞰圖。
在 OpenWorldLib 基準測試中,傳統模型如 VGGT、InfiniteVGGT 在相機大幅移動時會出現幾何不一致與紋理模糊的問題;而 Atlas 能保持幾何一致性,提供平滑且細緻的視角切換。
輸出形式與未來應用
Atlas 不僅輸出影像或影片,還能直接產生點雲(point cloud)與 3D 高斯斑點(Gaussian splats)等真實三維資料格式。這類表示方式允許使用者在任意角度即時瀏覽場景,為虛擬實境、遊戲開發、建築設計等領域提供即插即用的基礎模型。
展望
Atlas 的出現標誌著 AI 從「二維感知」向「三維理解」的關鍵跨越。若其宣稱的跨模型優勢得以持續驗證,未來開發者可能不再需要分別採用多種專門工具,而只需一個統一的空間智慧模型即可完成生成、重建與模擬。對於內容創作者、設計師以及科研人員而言,Atlas 有望大幅降低製作門檻、縮短開發周期,並促進更真實、互動的數位體驗。
結語:在 AI 逐步掌握「空間感」的今天,Atlas 為三維內容的自動化開闢了新路徑。業界應持續關注其實際表現與生態系統的成熟度,才能真正把握這波「空間智慧」的浪潮。