
World Labs 公開了新一代世界模型 Atlas。它的特別之處在於從訓練階段就同時處理四種輸入——文字、圖像、影片、3D——並把它們整合到同一個空間脈絡裡,再以多模態自迴歸擴散 Transformer 推算下一個畫面。這意味著 Atlas 不只是「看得更多」,而是嘗試理解世界怎樣呈現、怎樣變化,並把想像中的場景渲染出來。
從使用場景來看,Atlas 主要涵蓋四類工作:相機控制生成、空間重建、空間時間模擬,以及純文字生圖與 360 度全景。其中相機控制生成支援 1 至 6 張輸入圖片,可輸出最高 1440p、最長約 1 分鐘的影片,並以像素級精度的相機幾何作為輸入,而不只是粗略的文字描述。
重建方面,Atlas 只需要 1 張到幾十張相片,就能還原真實場景並產出新視角的影像幀與明確的 3D 輸出。團隊指出,這項表現優於專門做 3D 重建的同類模型。空間時間模擬則可從影片重新取景,生成電影級視覺效果,並支援 Real-to-Sim 流程,供機器人規劃動作。
以下幾點值得留意:
- 原生多模態:文字、圖片、影片、3D 一開始就共享同一空間脈絡,並非後期拼接。
- 像素級相機控制:把精確相機幾何列為原生輸入,能逐格構圖、逐段運鏡。
- 超越專用模型:3D 重建表現優於專門訓練的模型。
- 支援 Real-to-Sim:能把真實影片轉成可模擬的世界,供機器人規劃。
- 規模持續擴展:團隊表示表現會隨訓練算力提升,並預期這個趨勢會延續下去。
World Labs 表示,Atlas 將驅動他們自家 Marble 的未來版本及其他產品,現已開放早期使用的申請。