EPISODE · Jun 11, 2026 · 20 MIN
MIT:VPO矢量策略优化 通过训练多样性提升推理搜索效率 让AI不再钻牛角尖
from 每日AI · host 每日新闻
Vector Policy Optimization (VPO),这是一种旨在提升大语言模型在推理搜索阶段表现的新型强化学习算法。传统的后训练方法通常将多个目标压缩为单一数值,导致模型输出趋于同质化;而 VPO 通过随机化奖励权重,激励模型在单次生成中产出多样化且高质量的候选方案。该方法利用向量化奖励结构(如代码测试用例的通过情况)来覆盖帕累托前沿,从而在搜索空间内保留不同的策略权衡。实验证明,随着推理计算预算的增加,VPO 在代码生成、逻辑推理和多跳问答等任务中显著优于传统的 GRPO 等标量基准。通过在训练阶段主动培养这种奖励多样性,模型能够为下游的进化搜索或重采样程序提供更具潜力的解。总而言之,VPO 将强化学习的目标从寻找单一最优解转向构建一个能力均衡且各具特色的候选解池。
Embed this episode
Ready to play
MIT:VPO矢量策略优化 通过训练多样性提升推理搜索效率 让AI不再钻牛角尖
0:00
20:14
1×
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
Frequently Asked Questions
How long is this episode of 每日AI?
This episode is 20 minutes long.
When was this 每日AI episode published?
This episode was published on June 11, 2026.
Can I download this 每日AI episode?
Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!