#677.Post-Traning 前沿现状与问题 episode artwork

EPISODE · Aug 15, 2026 · 51 MIN

#677.Post-Traning 前沿现状与问题

from 跨国串门儿计划

📝 本期播客简介本期我们克隆了:The State of Frontier Post-Training Recipes | Conversation with Finbarr Timbers。节目讨论前沿大模型后训练(post-training)配方的现状与实践。本期节目来自技术播客《Interconnects》,主持人 Nathan 与 AI2 研究员 Finbarr Timbers 展开了一场关于前沿大模型后训练配方演变的深度对谈。这也是该节目首次迎来返场嘉宾——Finbarr 曾在 AI2 与 Nathan 共同参与 OMO 系列模型的后训练工作,而录制当天恰好是他在 AI2 的最后一天,让这场对话多了一层告别与回顾的意味。对话从经典配方讲起,一路梳理到多教师在线策略蒸馏(Multi-Teacher Online Policy Distillation)等最新趋势。两人不仅回顾了 InstructGPT 三阶段框架、Llama 3 与 TULU3 的实用落地、DeepSeek R1 的推理转向,还穿插了他们在 AI2 的实际经验——包括 OMO3 后训练如何逼近组织能力极限、为什么 DPO 正在从主流配方中消失,以及中国实验室与美国实验室在配方细节分享上的显著差异。如果你关心大模型后训练的技术细节、开源与工业界的差距,或者想了解前沿实验室内部的组织与决策逻辑,这期内容密度极高,值得反复收听。👨‍⚕️ 本期嘉宾Finbarr Timbers,AI2(Allen Institute for AI)研究员,专注于大模型后训练与强化学习。他此前曾在 DeepMind 阿尔伯塔办公室工作,参与过计算机扑克与博弈论研究,后加入 AI2 参与 OMO 系列模型的后训练工作。他是《Interconnects》节目首位返场嘉宾,对前沿后训练配方的演变有深入观察和一手经验。⏱️ 时间戳开场 & 节目背景01:12 欢迎回到 Interconnects,Nathan 与 Finbarr 的开场寒暄01:39 Finbarr 成为节目首位返场嘉宾01:48 两人在 AI2 共事后训练的缘起02:52 今天是 Finbarr 在 AI2 的最后一天从 OMO3 到经典配方:后训练的组织极限03:11 从 OMO3 聊起:推理模型后训练的复杂度03:35 现代后训练的本质:整合组织架构图04:16 TULU3 之后的分岔点:简单配方 vs 前沿做法07:35 经典配方综述:InstructGPT、Llama 3、TULU3、DeepSeek R1配方的工业化演进:从 InstructGPT 到 DeepSeek09:49 InstructGPT 三步法:SFT、奖励模型、RL10:40 Llama 2/3 的迭代:拒绝采样、DPO、多轮训练11:59 TULU3 的简化配方与组织规模的限制13:03 DeepSeek R1 的配方:RL-first 与冷启动 SFTDPO 的衰落与偏好调优的争议14:35 DPO 从主流配方中消失的趋势15:01 为什么配方越干净,DPO 需求越小16:27 偏好调优是否被低估?16:54 偏好损失函数带来的惊人提升多教师在线策略蒸馏:2026 年的新范式21:06 DeepSeek V4 与多教师在线策略蒸馏22:00 MIMO Flash V2 命名该术语22:25 多教师在线策略蒸馏的机制详解24:51 Nematron 3 Ultra 的实践与挑战教师模型的困境与行业分歧26:28 英伟达的关键发现:教师差异过大无法合并27:18 分阶段蒸馏 vs 收敛后蒸馏的争论29:05 微软 MAI 的保守配方选择33:15 中国实验室的细节分享:温度调度与难度课程开源环境、Tinker API 与算力经济35:57 开源环境市场的疯狂现状36:41 环境报价:每个环境十万美金40:05 Tinker 风格 API 的商业模式与争议42:14 卖算力、卖推理与卖 API 的利润层级职业选择与长期价值45:26 热潮之下:挤进实验室赚钱 vs 长期价值45:44 探索与利用的取舍:什么工作值得做48:41 Finbarr 的职业经历:DeepMind 与 AI2 的信念驱动50:27 大实验室的体量困境与多样化路线🌟 精彩内容💡 "把 OMO3 后训练成推理模型,对很多人来说都是一项重大成就"Nathan 坦言,OMO3 的后训练复杂度已经逼近 AI2 组织能力的极限。现代后训练拼的不是单一技术,而是把算力和数据整合进一条工作流的能力——本质上是在整合一张组织架构图。这也是为什么 OMO3 作为推理模型推出得相当晚,且配方相对简单。"很多现代后训练,拼的就是你把算力和数据整合进一条工作流的能力。"💡 配方趋同的分岔点出现在 TULU3 之后在 TULU3 之前,大家还能说"做法都差不多"——SFT、DPO、RL 三阶段配方。但到了推理模型和带工具使用的 Agent 模型时代,那种简单配方已经不再适用。前沿实验室的做法与开放学术界的差距正在急剧拉大。"可现在,把那种三阶段配方用在推理模型上,尤其是带工具使用的 Agent 模型上,就真的不太适用了。"💡 DPO 的消失是配方工业化的必然结果当后训练流程变得越来越精细、越来越工业化,DPO 能带来的边际收益就消失了。但在配方粗糙的阶段,DPO 依然是从零搭建时算力效率最高的选择之一。Nathan 直言:"用 DPO 的人可能会被看不起,但如果你是想把一个配方从零搭起来,它仍然管用。""当你的配方越来越干净的时候,这个需求基本上就消失了。"💡 多教师在线策略蒸馏:把 RL 框架变成教师对齐的舞台这是 2026 年最值得关注的后训练新范式:在 RL 框架内,让正在训练的学生模型采样轨迹,再路由给各个领域专家教师,用 KL 散度损失对齐。Finbarr 指出,实现起来其实很直接——只需要对现有 RL 配置做一小套调整。"你拿你现有的 RL 配置,然后只需要对学习者模型做一小套调整,就能实现这个。"💡 教师模型差异过大,蒸馏会失败英伟达在 Nematron 3 Ultra 论文中披露了一个关键发现:用差异很大的训练流程训练出来的教师模型,无法通过简单的在线策略蒸馏有效合并。教师和学生若用不同 SFT 数据训练,会习得不同推理行为,导致学生轨迹对教师而言属于分布外数据。"这种分布差异会导致学生生成的轨迹对教师来说属于分布外数据,从而降低教师提供的监督信号的质量和可靠性。"💡 中国实验室更愿意分享"特别特别具体"的细节从温度调度到难度课程,KIMI K2.5 和 GLM5 分享了大量可操作的配方细节——尽管两者在温度调度上声称的正好相反。相比之下,英伟达的论文更像一份方法列表,读起来没那么有意思。"我还是觉得中国实验室更愿意分享那种特别特别具体的细节。"💡 报酬最高的地方,往往也是你在做最有趣工作的地方面对"梯子被抽走之前挤进实验室"的热潮,Finbarr 给出的判断是:要区分短期套利和长期价值。他职业生涯里反复看到,高薪与有趣工作往往是重合的——关键是追随信念,在某个领域做到足够强。"往往报酬最高的地方,也正是你在做最有趣工作的地方。"💡 开放环境市场:一个环境十万美金,但可能不包含提示词Finbarr 分享了他年初尝试购买 RL 环境的经历:一个 DoorDash 克隆级别的环境,前期成本约十万美金,每年维护费约五万。但 Nathan 指出,真正值钱的是"我们知道这些提示词能提升某个基准测试"——那才能收高得多的溢价。"如果你能说'我们有提示词,而且我们知道它们能提升某个基准测试或某项能力',那就能收高得多的溢价。"🌐 播客信息补充本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的使用 AI 进行翻译,因此可能会有一些地方不通顺;如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight在小宇宙查看该单集文稿

Episode metadata supplied by the publisher feed · Published Aug 15, 2026

Embed this episode

NOW PLAYING

#677.Post-Traning 前沿现状与问题

0:00 51:41

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of 跨国串门儿计划?

This episode is 51 minutes long.

When was this 跨国串门儿计划 episode published?

This episode was published on August 15, 2026.

Can I download this 跨国串门儿计划 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!