EPISODE · May 25, 2026 · 31 MIN
特别篇 · 世界模型 — 后 LLM 时代的核心赌注,从 JEPA 到 Genie 3
from The Long View
The Long View 特别篇。这一期不蹭新闻,花一整集把世界模型 world model 这件事讲透。引子是上周 MIT Technology Review 的订阅者圆桌"Can AI Learn to Understand the World?",但讲到的远不止那篇文章。本期回答以下问题:什么是世界模型,它和 LLM 究竟差在哪七个维度;2018 年 David Ha 和 Jürgen Schmidhuber 那篇奠基论文做了什么,为什么"在梦里训练 agent 再迁回真实环境"这个 idea 直到今天还是骨架;Yann LeCun 在 2022 年提的认知架构有哪六个模块,他的 JEPA 联合嵌入预测架构具体是怎么工作的;今天前沿四大阵营各自押什么——Meta 的 V-JEPA 2 押隐空间预测 + 62 小时机器人数据零样本控制,DeepMind 的 Genie 3 押实时像素生成 + 一分钟一致性,Fei-Fei Li 的 World Labs 与 Marble 押静态 3D 场景持久化,Nvidia 的 Cosmos 押合成数据飞轮 + 9000 万亿 token;OpenAI 的 Sora 算不算世界模型,scaling 派和 LeCun 派为什么吵这件事;世界模型需要什么样的数据(被动视频 vs 带动作标签视频的极端比例)、什么样的架构(编码器、tokenizer、动力学预测器、动作条件化、记忆、MPC 控制器);为什么 LeCun、Fei-Fei Li、Hassabis 这几位会把后半生压在这条路上;以及目前最大的几个未解:长程一致性、组合泛化、动作-观测-结果三元组数据的稀缺、和语言模型怎么接。听完这一期,下次再看到 world model 这个词,你不会再把它和"更好的视频生成"混在一起。
Embed this episode
NOW PLAYING
特别篇 · 世界模型 — 后 LLM 时代的核心赌注,从 JEPA 到 Genie 3
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.