Skip to content
#715.a16z x 李飞飞:新视角预测通向空间智能 episode artwork

EPISODE · Sep 10, 2026 · 42 MIN

#715.a16z x 李飞飞:新视角预测通向空间智能

from 跨国串门儿计划

🎙️ 📝 本期播客简介 本期我们克隆了:a16z · Why Fei-Fei Li Is Betting on Spatial Intelligence 原内容更新时间:Fri, 04 Sep 2026 本期 a16z 主持人 Martin Casado 与 World Labs 联合创始人 Fei-Fei、Justin、Ben 对谈,围绕他们最新发布的世界模型 Atlas,解释空间智能究竟需要解决什么问题,以及新视角预测为什么可能成为继 next token prediction、next frame prediction 之后的下一种基础原语。 Atlas 同时具备生成、重建和模拟世界的能力:它可以根据少量带有相机位姿的图像,重建现实空间,并生成任意新视角下的视频帧或 3D 世界。节目详细讨论了 Atlas 与普通视频模型的区别、它如何把生成与重建统一到同一个多模态架构中,以及为什么三张手机拍摄的画面就可能替代数百张传统重建素材。 对谈还延伸到空间智能的未来:动态世界、可编辑的 3D 场景、建筑与创意工作流,以及机器人训练中的 real to sim。Fei-Fei、Justin 和 Ben 认为,机器人真正的瓶颈目前仍是现实世界数据,而能够理解空间、预测动作后果的世界模型,可能同时成为仿真器与规划器。 👤 本期嘉宾 Fei-Fei、Justin、Ben 是 World Labs 的联合创始人,围绕空间智能与世界模型展开研究和产品开发。Ben 是 NeRF 的创造者,长期研究从图像生成 3D、视觉重建与新视角合成;Fei-Fei 在计算机视觉领域已有数十年经验,强调空间几何、物理规律与智能之间的关系;Justin 带领团队推进 Atlas 的模型架构、训练与扩展。 三位嘉宾共同参与了 Atlas 的研发。相比此前聚焦高斯泼溅输出的 Marble,Atlas 将文本、图像、视频、3D 信息与相机位姿统一为原生多模态输入,并以新视角预测作为核心基元。主持人 Martin Casado 是 a16z General Partner,本期负责追问 Atlas 的技术路径、扩展假说、应用场景与发展方向。 ⏱️ 时间戳 00:00 Atlas的新视角预测 09:55 从Marble到Atlas 24:11 从创作到空间智能 🌟 精彩内容 💡 新视角预测是 Atlas 的核心原语 Atlas 不只是根据文字生成画面,也不只是预测视频的下一帧。它会读取一个场景的多个视角及其空间信息,再推断虚拟相机位于时空中任意位置时应该看到什么,把空间几何纳入生成过程。 "而 Atlas 做的其实是新视角预测,对吧?" 💡 生成与重建第一次在同一个模型里统一 传统计算机视觉往往把像素生成、识别、3D 重建视为不同赛道。Atlas 则试图让同一套架构同时完成精确重建与具有创造性的生成,在看得见的内容与不可见的空白之间建立连续关系。 "这是我们第一次把像素生成和像素重建统一了起来。" 💡 三张手机视频也能实现《黑客帝国》式子弹时间 经典子弹时间镜头需要围绕主体部署数百台相机,而 Atlas 可以从三台 iPhone 拍摄的素材中重构场景,让镜头在时间冻结的瞬间自由移动,不再依赖影棚、绿幕和昂贵校准。 "但现在用 Atlas,我们最少只要三台相机就能做到。" 💡 空间智能不止是生成 3D 真正的空间智能需要让模型能够生成空间内容,在空间中推理、编辑与交互,并进一步完成渲染、模拟和动作规划。Atlas 的关键进展,在于为每一帧估计相机位姿,让生成的像素拥有空间依据。 "但是生成真正具备空间语境和依据的像素,绝对是另一个重大步骤,而这正是 Atlas 迈出的非常艰难的一步。" 💡 稀疏输入正在改变 3D 重建的数据逻辑 传统稠密重建需要从大量角度覆盖场景的每个角落,甚至要拍摄数百张照片。Atlas 通过生成能力填补不可见区域,把过去无法用于重建的随手视频、旧照片和网络素材,转化为有空间依据的 3D 世界。 "而我们想做的,是把它降到大概 3 张。" 💡 机器人领域最大的瓶颈仍然是现实世界数据 机器人策略不是生成一张图片或一段代码,而是让 Agent 在充满意外的真实世界里行动。Atlas 可以降低 real to sim 的数据采集成本,并为训练机器人策略提供更丰富的环境变化与仿真素材。 "我们应该把视野放宽,认识到目前机器人领域最大的难题其实是数据。" 💡 动态世界与可编辑性是下一阶段 Atlas 的架构已经支持动态内容,但团队认为,未来还需要把动态、静态、多模态控制与可编辑性结合起来,让用户不仅能浏览世界,还能直接控制场景中的物体、布局、特征和时间变化。 "我觉得可编辑性才是这里的关键。" 💡 新视角预测可能像 next token prediction 一样基础 大语言模型通过 next token prediction 建模语言,视频模型通过 next frame prediction 建模时间变化,而 Atlas 试图用新视角预测建模空间变化。嘉宾认为,预测一个世界从新位置看起来会怎样,可能是理解物理世界与智能行为的基础能力。 "所以我们非常坚信,下一视点预测就相当于 next token prediction。" 🌐 播客信息补充 本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的 使用 AI 进行翻译,因此可能会有一些地方不通顺 在小宇宙查看该单集文稿

Episode metadata supplied by the publisher feed · Published Sep 10, 2026

Embed this episode

Ready to play

#715.a16z x 李飞飞:新视角预测通向空间智能

0:00 42:56

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of 跨国串门儿计划?

This episode is 42 minutes long.

When was this 跨国串门儿计划 episode published?

This episode was published on September 10, 2026.

Can I download this 跨国串门儿计划 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!