Skip to content
#683.Rich Sutton:大语言模型不是真正的智能,我们卡在了一个局部最优里 episode artwork

EPISODE · Aug 20, 2026 · 51 MIN

#683.Rich Sutton:大语言模型不是真正的智能,我们卡在了一个局部最优里

from 跨国串门儿计划

📝 本期播客简介 本期我们克隆了:知名播客 Training Data Rich Sutton and Khurram Javed: Why AI Models Stop Learning, and How to Start It Again。原内容更新时间:2026-08-18。嘉宾 Rich Sutton 与 Khurram Javed 讨论持续学习、合成数据、大世界假设、灾难性遗忘和能持续学习的智能体;由 Sequoia Capital 的 Sonya Huang 与 Alfred Lin 主持。 原内容更新时间:2026-08-18 本期嘉宾是强化学习领域的奠基人 Rich Sutton,以及他的联合创始人、前学生 Khurram Javed。主持人是红杉资本的 Sonya Huang 与 Alfred Lin。Rich Sutton 是那篇经典文章《苦涩的教训》的作者,也是阿尔伯塔大学强化学习研究的核心人物。这期对话围绕持续学习、合成数据的局限,以及他们创办的 Oak Lab 想要实现的新一代智能体展开。 这场对话从《苦涩的教训》出发,直指当前 AI 领域的核心矛盾:大语言模型在部署后权重不再更新,本质上不是持续学习者。Rich 与 Khurram 提出了"大世界假说",认为世界远比互联网上的一切都要大得多,合成数据无法替代真实经验。他们还分享了 Oak Lab 的野心——打造一个能持续学习、形成抽象、并保持自洽的智能体,并给出了具体的技术路径,包括持续反向传播算法和步长优化。如果你关心 AI 的下一个范式是什么,这期节目会给你一个完全不同的视角。 👨‍⚕️ 本期嘉宾 Rich Sutton,强化学习领域的奠基人之一,阿尔伯塔大学教授,著有奠基性教科书《Reinforcement Learning: An Introduction》,培养了大批该领域的关键学生(如 AlphaGo 的 David Silver)。他的文章《苦涩的教训》被视为深度学习领域的"圣经"。Khurram Javed 是 Rich 在阿尔伯塔大学的学生,也是 Oak Lab 的联合创始人,专注于持续学习与"大世界假说"的研究。 ⏱️ 时间戳 00:00 开场 & 播客简介 "我不怪,这个领域才怪" 01:15 Rich Sutton 的开场宣言:持续学习才是正常思考方式 01:57 主持人介绍 Rich Sutton 与 Khurram Javed 02:53 为什么在 AI 寒冬押注强化学习 03:40 2003 年与癌症搏斗的经历 《苦涩的教训》与大语言模型的局限 07:45 2019 年写下《苦涩的教训》的契机 09:03 苦涩的教训的本质:别被人类知识带偏 10:13 大语言模型是正面还是反面例子? 11:14 合成数据是"大错误":大世界假说 为什么合成数据无法替代真实经验 11:42 大世界假说:世界比互联网大得多 12:18 谁来判定合成数据的好坏? 14:18 世界无限复杂,任何模拟都渺小得可怜 16:10 自动驾驶模拟器:人类在循环里的瓶颈 持续学习:算法缺口与解药 22:33 大语言模型不是经验型学习者 23:23 预训练与后训练之后,模型就不再学习了 37:58 持续深度学习是算法缺口 39:10 解药:步长优化与持续反向传播 Oak Lab 的野心与未来 35:44 从空谈到行动:创办 Oak Lab 42:34 最有野心的目标:拥有完整跨度的知识 44:25 "这是触手可及的":五到十年的判断 47:53 如果一切顺利,Oak Lab 会变成什么样? 🌟 精彩内容 💡 "我不怪,这个领域才怪" Rich Sutton 反复强调自己并不激进,他只是在用"普通的方式思考"。在他看来,所有学习都是持续的,我们一直在行动、一直在学习,这才是正常的思考方式。是 AI 领域把"持续学习"当成了一个特殊概念,才显得他奇怪。 "所有学习都是持续的。我们一直在行动,一直在学习。这才是正常的思考方式。" 💡 大语言模型既是《苦涩的教训》的正面例子,也是反面例子 正面在于它把计算规模的扩展做到了极致,直接吞下整个互联网;反面在于它最终会被人类知识限制住——互联网是有限的,而世界比互联网上的一切都要大得多得多。 "互联网是有限的,很难再拿到更多样本。而世界很大,世界比我们存在互联网上的一切都要大得多得多。" 💡 合成数据是"大错误" Rich 与 Khurram 直言,合成数据生成是当前扩展范式的根本问题。谁来判定什么样的合成数据是好的?这需要人类专家,而这就是瓶颈所在。更根本的是,世界无限复杂,任何对它的模拟都渺小得可怜。 "世界是无限复杂的,任何对它的模拟都渺小得可怜。" 💡 大语言模型的权重永远不会变 这是 Rich 对当前主流范式最尖锐的批评:模型在部署后就不再学习了。你可以给它更多上下文,但模型本身已经停止学习。相比之下,Cursor 和 Tab 这类产品因为持续更新权重,反而是真正的持续学习例子。 "它们的权重永远不会变。……他们声称能从一种完全不再学习的东西里,榨出博士级的经验和专业能力。" 💡 学校其实无关紧要 Rich 认为,没有哪种动物是通过监督学习来学习的。松鼠不上学也能学会那些东西,学校是非常特殊的东西,就连人类也是直到几百年前才有的。把监督学习当成学习的主要例子,是一种干扰。 "你看,松鼠不上学,也能学会那些东西。动物不是那样学习的。" 💡 我们卡在了一个局部最优里 Khurram 认为,当前的大实验室被产品绑得太死,无法去走一条"事情会先变差"的路。新范式在变好之前几乎不可避免地会先变差,而那些大实验室不可能接受这一点。 "当我们开始探索这些新方向时,你不可能第一天就拿到最先进的性能。但这是因为,它是一个不同的范式。" 💡 大语言模型大概只占智能的 20% Rich 明确表示,大语言模型是了不起的科学突破,但它被过度包装成了"全部 AI"。全部智能并不只是流畅的语言运用能力,语言只是重要的一部分,还有太多别的东西没做完。 "全部智能并不只是流畅的语言运用能力。还有太多别的东西。语言是重要的一部分。它大概占智能的 20% 或者四分之一。" 🌐 播客信息补充 本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的 使用 AI 进行翻译,因此可能会有一些地方不通顺; 如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight 在小宇宙查看该单集文稿

Episode metadata supplied by the publisher feed · Published Aug 20, 2026

Embed this episode

Ready to play

#683.Rich Sutton:大语言模型不是真正的智能,我们卡在了一个局部最优里

0:00 51:34

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of 跨国串门儿计划?

This episode is 51 minutes long.

When was this 跨国串门儿计划 episode published?

This episode was published on August 20, 2026.

Can I download this 跨国串门儿计划 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!