【第671期】从监督微调到强化学习:在线蒸馏的参数空间几何特性 episode artwork

EPISODE · Aug 1, 2026 · 15 MIN

【第671期】从监督微调到强化学习:在线蒸馏的参数空间几何特性

from Seventy3

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:On the Geometry of On-Policy DistillationSummary在线策略蒸馏(On-Policy Distillation,简称 OPD)越来越多地被用于提升大语言模型的推理能力,但其训练动态机制(training dynamics)至今仍缺乏深入了解。我们对 OPD 在参数空间中的更新轨迹进行了刻画,并将其与监督微调(SFT)以及基于可验证奖励的强化学习(RLVR)进行了比较。一系列参数空间诊断结果一致表明,OPD 处于一种宽松的非主方向机制(relaxed off-principal regime):与 SFT 相比,它的更新所影响的权重更少,且更强烈地避开了主方向(principal directions);而与 RLVR 相比,它的限制程度则没有那么严苛。除了这种静态定位之外,OPD 还展现出了子空间锁定(subspace locking)现象:其累积更新会迅速进入一条狭窄的低维通道。将训练限制在训练早期形成的更新子空间内,能够保留 OPD 的性能,却会大幅降低 SFT 的效果,这表明被锁定的子空间在功能上对于 OPD 来说是充分的。对照实验进一步表明,稀疏化更新 Token(sparsifying update tokens)以及将 Rollout 生成转为离线策略(off-policy)依然能保持其秩动态特性(rank dynamics);然而,将 OPD 目标与 RLVR 混合使用则会改变这一特性。总体而言,这些结果表明 OPD 并非仅仅是 SFT 和 RLVR 之间的过渡状态,而是在参数空间中诱导出了其独特的更新几何结构(update geometry)。原文链接:https://arxiv.org/abs/2606.07082前往小宇宙评论区与主播互动

Episode metadata supplied by the publisher feed · Published Aug 1, 2026

Embed this episode

Ready to play

【第671期】从监督微调到强化学习:在线蒸馏的参数空间几何特性

0:00 15:14

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of Seventy3?

This episode is 15 minutes long.

When was this Seventy3 episode published?

This episode was published on August 1, 2026.

Can I download this Seventy3 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!