【第296期】(中文)d1: 扩散LLM的强化学习推理 episode artwork

EPISODE · Jul 23, 2025 · 9 MIN

【第296期】(中文)d1: 扩散LLM的强化学习推理

from Seventy3

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。今天的主题是:d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement LearningSummary这篇研究论文探讨了如何提升扩散大语言模型(dLLMs)的推理能力,此类模型与传统的自回归(AR)LLMs不同,采用非自回归的粗到细文本生成方式。作者提出了 d1 框架,通过结合监督微调(SFT)和一种名为 diffu-GRPO 的新型强化学习(RL)算法来训练预训练的掩码 dLLMs。实验结果表明,与基线模型及单独的 SFT 或 diffu-GRPO 方法相比,d1 显著提升了模型在数学和逻辑推理任务上的表现。此外,该研究还讨论了随机掩码等设计选择如何提高训练效率和稳定性,并指出了未来研究方向,例如开发更高效的推理策略以进一步扩展 RL 训练。原文链接:https://arxiv.org/abs/2504.12216前往小宇宙评论区与主播互动

Episode metadata supplied by the publisher feed · Published Jul 23, 2025

Embed this episode

NOW PLAYING

【第296期】(中文)d1: 扩散LLM的强化学习推理

0:00 9:45

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of Seventy3?

This episode is 9 minutes long.

When was this Seventy3 episode published?

This episode was published on July 23, 2025.

Can I download this Seventy3 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!