World Labs 推出 Atlas:生成最長 1 分鐘、1440p 影片,並控制相機路徑與重建 3D 場景 episode artwork

EPISODE · Sep 2, 2026 · 2 MIN

World Labs 推出 Atlas:生成最長 1 分鐘、1440p 影片,並控制相機路徑與重建 3D 場景

from EasyVibeCoding Podcast · host Fei-Fei Li

World Labs 推出 Atlas:生成最長 1 分鐘、1440p 影片,並控制相機路徑與重建 3D 場景。一座紅色懸索橋橫跨在藍色水面上,遠方為起伏的海岸與陸地,畫面中央疊印著白色的英文字母。核心定位 Atlas 是面向 spatial intelligence 的 omni 多模態 world model,將文字、影像、影片、camera poses 與 3D depth 視為同一序列中的不同輸入與輸出。World Labs 在官方文章中表示,Atlas 採用自回歸 diffusion transformer,融合大型語言模型與影像、影片模型的設計:自回歸 transformer 讓 Atlas 能沿用 KV-caching、cache-aware routing 與 disaggregated serving 等 LLM 系統技術。 rectified flow diffusion 模型透過逐步去噪生成輸出,也能藉由調整推論時的去噪步驟,在速度與品質間取捨。 Transformer 架構則利用適合現代硬體的矩陣乘法,作為 world modeling 的核心骨幹。主要能力 Atlas 會產生影片,也把相機運動、空間結構與時間變化納入同一模型:來源:@theworldlabs(回覆)|Atlas 透過單張影像與相機路徑控制生成 3D 世界與模擬空間。從一張或多張輸入影像生成最長 1 分鐘、1440p 的影片,並直接控制 camera path;輸入可以包含 pan、truck、crane 等一至三段電影式運鏡。 以稀疏影像與 camera poses 重建場景,輸出明確的 3D 空間;官方 reframing 範例使用三至五個 camera views,機器人重建範例則各使用 24 個 frames。 將多張具備姿態資訊的影像組合成一致的 3D world,並透過重新取景模擬影片中的時空變化。 產生一般影像或 360 度全景圖,也能模擬機器人視角。不過,未被輸入影像觀察到的區域可能是模型自行想像的內容,因此稀疏視角重建不能直接視為完整、經驗證的真實場景。官方評測 World Labs 選擇 camera-controlled generation 與 sparse-view 3D reconstruction 兩條評測軌道。前者由第三方人工評審判斷模型是否遵循指定運鏡;Atlas 在各組比較中獲選的比例為:相較 MiniMax H3:75%,95% 信賴區間為 68% 至 82%。 相較 Gemini Omni Flash:81%,區間為 74% 至 87%。 相較 Happy Horse 1.1:86%,區間為 82% 至 91%。 相較 FLUX 3:93%,區間為 88% 至 97%。 相較 Seedance 2.5:94%,區間為 90% 至 97%。3D 重建以平均絕對相對 pointmap error 評估,數值乘以 10^-3,越低越好:Atlas 為 25.3、Pi3X (posed) 為 28.7、pi cubed 為 34.7、VGGT-Omega 1B 為 36.4、Depth Anything 3 為 39.3,MapAnything 為 47.7。World Labs 公布的兩條評測軌道:左側是 Atlas 相較五個模型的指定運鏡偏好率,右側是 pointmap error;Atlas 原生接收 camera poses,其他模型以文字描述運鏡,條件並不完全相同。評測限制 這些結果不能直接解讀成完全公平的模型對決。Atlas 使用原生 camera input format 接收 camera path;其他模型不支援原生相機輸入,只能在文字 prompt 中描述同一段運鏡。World Labs 也承認,更複雜的 prompt engineering 或 multimodal prompt 可能改善其他模型的 camera following 表現。此外,這些數字是 World Labs 發布的結果,雖然團隊表示以共同協定重現 baseline,仍沒有獨立 benchmark 報告可供驗證。開放狀態與後續 Atlas 目前僅向 select partners 提供 early access,官方尚未說明一般可用時間與定價;有興趣的團隊可申請測試,特別適合用代表性場景驗證生成、重建與模擬能力。World Labs 表示,開發期間持續擴大模型規模與訓練計算量,新的計算量層級都解鎖了更多能力,並預期未來 world model 仍會沿著 scaling 路線提升。Atlas 透過單張影像與相機路徑控制生成 3D 世界與模擬空間。 影片中的 Prompt 與操作:操作步驟: 1. (00:25)展示 Input Image 與 Camera Path 生成 Output 三維畫面 2. (00:55)展示室內客廳的 Sparse Reconstruction 三維空間重建 3. (01:04)展示 Robotics Simulation 的三維點雲地圖與機器人移動模擬原文:https://easyvibecoding.app/curated/3244-world-labs-atlas-generates-1440p-video-controls-camera-path

Episode metadata supplied by the publisher feed · Published Sep 2, 2026

Embed this episode

Ready to play

World Labs 推出 Atlas:生成最長 1 分鐘、1440p 影片,並控制相機路徑與重建 3D 場景

0:00 2:24

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 2 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on September 2, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!