@vai_viswanathan:到底什麼是 World Model?
 
 「World model」(世界模型)是當下最熱門的詞彙。李飛飛(Fei-Fei Li)的 World Labs 在… episode artwork

EPISODE · May 1, 2026 · 9 MIN

@vai_viswanathan:到底什麼是 World Model? 「World model」(世界模型)是當下最熱門的詞彙。李飛飛(Fei-Fei Li)的 World Labs 在…

from EasyVibeCoding Podcast · host Vai Viswanathan

到底什麼是 World Model? 「World model」(世界模型)是當下最熱門的詞彙。李飛飛(Fei-Fei Li)的 World Labs 在脫離幕後狀態後募資 2.3 億美元,隨後又完成了 10 億美元的融資。Yann LeCun 離開 Meta 創立了 AMI Labs,該公司以 35 億美元的估值募資 10.3 億美元,旨在從零開始構建世界模型。Google DeepMind 推出了 Genie 3。OpenAI 將 Sora 定位為「世界模擬器」。NVIDIA 發布了 Cosmos。Dreamer 4 僅憑離線資料就解決了 Minecraft 的鑽石挑戰(Diamond Challenge)。現在,任何有實力的機器人實驗室都有一篇關於世界模型的論文。 問題在於,當你試圖釐清「世界模型」究竟是什麼時,根據詢問對象的不同,你會得到五種截然不同的答案。 本文旨在拆解這個術語。首先,什麼是世界模型?其次,目前的技術路徑有哪些?第三——如果你是機器人開發者,這點至關重要——世界模型在現代機器人技術堆疊中究竟扮演什麼角色? 什麼是 World Model? 首先要理解的最重要一點是:世界模型是一個「問題陳述」,而非一種「模型架構」。 最貼切的類比是 SLAM(同步定位與地圖構建)。SLAM 並非特定的演算法,而是一個問題:給定一串感測器資料,在構建周圍環境地圖的同時,判斷自己身在何處。目前有數十種 SLAM 方法:基於濾波器的方法(如 EKF-SLAM 和 FastSLAM)、基於圖優化後端的方法(如 GTSAM 或 Ceres Solver)。感測器模態也各不相同——攝影機、LiDAR、IMU,或是三者的融合。即使在視覺 SLAM 內部,也有處理原始像素強度的直接法,以及提取關鍵點(如 ORB 或 SIFT)的特徵法。 世界模型也是如此。「構建一個世界模型」是目標,而如何構建則是完全開放的。 LeCun 的定義 最簡潔的正式定義來自 Yann LeCun(來源): 給定: x(t):一個觀測結果 s(t):對世界狀態的先前估計 a(t):一個動作建議 z(t):一個潛在變數建議 世界模型計算: h(t) = Enc(x(t)),即表徵(representation) s(t+1) = Pred(h(t), s(t), z(t), a(t)),即預測 其中: Enc() 是一個編碼器(可訓練的確定性函數,例如神經網路) Pred() 是一個隱藏狀態預測器(同樣是可訓練的確定性函數) z(t) 代表了那些能讓我們精確預測未來結果的未知資訊。它必須從某個分佈中採樣,或在一組集合中變化。它參數化了合理預測的集合(或分佈)。 讓我們用一個例子來落實這個正式定義。 實例說明:自動駕駛汽車 想像一輛停在空曠停車場的自動駕駛汽車,車上只有一個前置攝影機。它有兩個控制項:轉向角和油門。 x(t) — 攝影機看到的初始影像。柏油路、地平線,可能還有圍欄。 s(t) — 汽車的內部狀態:位置、速度、航向、當前轉向角。初始狀態為 (0, 0, 0),速度為零。 a(t) — 汽車決定採取的動作。假設我們正在原地甩尾:左轉到底 (-1) 並全油門 (+1)。 z(t) — 不可觀測的因素。輪胎抓地力有多少?一陣強風?路面上看不見的油漬?感測器雜訊?現實世界中任何會影響結果但無法從當前狀態讀取的因素。確定性模型會忽略 z(t),而機率模型會從分佈中採樣,給你一組合理的未來情境,而不是單一預測。 基於這些,世界模型預測 s(t+1) — 汽車的下一個狀態。 重要提示:這不是對下一張影像的預測,而是對底層狀態的預測。即在全油門、轉向到底的情況下,經過短暫時間後汽車的新位置、速度和航向。 解碼器(Decoder)擴充 如果你確實想生成下一張影像,可以增加一個解碼器步驟(由 Kevin Murphy 提出): x(t+1) = Dec(s(t+1)) 這種區別比看起來更重要。LeCun 有意將「預測」與「渲染」分開。世界模型的工作是針對狀態進行推理。將該狀態渲染回像素是一個獨立的、可選的步驟。正如我們將看到的,這種分離正是世界模型各流派之間產生分歧的地方。 目前有哪些技術路徑? 今天,構建現代世界模型主要有三種主流範式。每一種對於「壓縮什麼」、「預測什麼」以及「是否渲染」都有不同的立場。 生成式世界模型(Generative World Models) 這是最受矚目的類別。像 Sora、Veo、Genie 3、GameNGen 以及 World Labs 的 RTFM 等模型,學習在給定過去上下文和動作輸入的情況下,預測影片的下一幀。 在架構上,它們通常是自回歸 Transformer 或影片擴散模型(Diffusion Models),且經常結合使用。你給模型一張起始影像(或文字 Prompt),可選地加上一串動作,它就會逐幀預測世界的演變。 其邏輯很直接:如果模型能準確生成未來,它在某種程度上一定理解這個世界。在 Genie 裡玩遊戲,環境似乎具有一致的物理規律和物體恆存性;駕駛虛擬汽車,道路也會做出反應。 但這些模型也存在眾所周知的失敗模式: 自回歸漂移(Autoregressive drift)——小誤差在長序列預測中會不斷累積 幻覺(Hallucination)——物體在被遮擋時會憑空消失或出現 物理不合理性——水往高處流、剛體變形、光照不一致 記憶缺失——當你轉頭看別處時,世界發生了變化 這如何符合 LeCun 的定義:生成式模型將「狀態」和「觀測」合併為同一個東西——它們直接在觀測(像素)空間中進行預測,跳過了抽象狀態。LeCun 會認為這是一種貧乏的實例化:模型幾乎所有的容量都花在了渲染上,留給推理和控制等關鍵部分的容量就更少了。 潛在世界模型(Latent World Models) 潛在世界模型不是預測像素,而是在壓縮的抽象表徵空間中進行預測。目前有兩個主要的子家族,它們在哲學觀點上存在值得深究的對立。 潛在動力學模型(Latent Dynamics Models)——如 Dreamer / DreamerV3 / Dreamer 4、PlaNet、TD-MPC。這些模型源於基於模型的強化學習(Model-based RL)。循環狀態空間模型(RSSM)學習在給定動作條件下預測未來的潛在狀態。關鍵在於,這些模型通常使用重構損失(reconstruction loss)進行訓練——解碼器強制潛在空間保留足夠的資訊來重構觀測結果——並結合獎勵預測,使潛在空間與任務相關。隨後,策略和價值函數會在這些潛在空間中想像出的軌跡上進行訓練。 JEPA(Joint Embedding Predictive Architecture)——如 I-JEPA、V-JEPA、V-JEPA 2,以及最近 AMI Labs 及其合作者推出的 LeWorldModel (LeWM)。視覺編碼器產生當前狀態的嵌入(embeddings);預測器則預測未來或被遮蔽區域的嵌入。沒有獎勵,沒有像素重構。模型純粹透過表徵空間中的自監督預測進行訓練。 雖然兩者都在潛在空間中運作,但它們在四個方面存在重要差異: 訓練訊號:潛在動力學模型透過重構損失(經由解碼器)和通常的獎勵訊號進行 End to End (端到端) 訓練;潛在狀態由重構像素和預測回報的需求所塑造。JEPA 僅使用單一的「嵌入空間內自監督預測」目標進行訓練——沒有解碼器,也沒有獎勵。 對生成的立場:潛在動力學模型擁抱生成;例如 Dreamer 4 可以從潛在狀態想像出完整的影片序列。JEPA 則完全拒絕將生成作為訓練目標。LeCun 的論點是,世界包含本質上不可預測的細節(樹上的葉子、感測器的雜訊),強迫模型在像素層級預測這些細節,會浪費模型容量在那些根本無法預測的事物上。 任務特定性:潛在動力學模型通常針對特定環境或任務進行訓練,獎勵會塑造潛在空間。JEPA 則以任務無關、無獎勵的方式在影片上進行訓練,隨後透過 MPC 或小型動作條件預測器適應下游控制任務。 控制方式:潛在動力學模型通常在世界模型內部訓練一個明確的 Actor-Critic。基於 JEPA 的控制器通常在測試時執行 MPC:採樣候選動作序列,在嵌入空間中向前模擬,並選擇預測嵌入最接近目標嵌入的那一個。 這如何符合 LeCun 的定義:不出所料,這是與正式定義最契合的路徑。潛在動力學模型擁有強大的 Enc()、透過 RSSM 實現的強大 Pred()、隨機採樣 z(t),以及訓練時使用但在規劃時常被捨棄的 Dec()。JEPA 則是純度最高的契合者——Dec() 從設計上就被移除,LeCun 認為這是一個特性,而非缺陷。 3D 神經世界模型(3D Neural World Models) 第三類別致力於將 3D 幾何作為表徵。NeRF 開創了這一先河——一種隱式神經函數,將 3D 座標映射到顏色和密度,並透過體積射線投射(volumetric ray marching)進行渲染。過去兩年,3D Gaussian Splatting 在很大程度上取代了 NeRF,它將隱式函數替換為數百萬個明確的小型半透明高斯球體,渲染速度大幅提升。 World Labs…

Episode metadata supplied by the publisher feed · Published May 1, 2026

Embed this episode

Ready to play

@vai_viswanathan:到底什麼是 World Model? 「World model」(世界模型)是當下最熱門的詞彙。李飛飛(Fei-Fei Li)的 World Labs 在…

0:00 9:04

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 9 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on May 1, 2026.

Is there a transcript available for this episode?

Yes, a full transcript is available for this episode. You can read the complete transcript on the episode page.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!