EPISODE · Jun 16, 2026 · 8 MIN
AI计算广告论文播报|6月15日:出价均值陷阱、LLM改写持续训练与工业决策范式收敛
from 周六9点半
本期聚焦一个核心判断:商业化决策系统正从"模型够聪明就行"走向"训练、奖励、上线、回滚每一环都要可控"。三篇来自出价、搜索改写和电商定价的工业论文,骨架竟然是同一套——离线学习 + 在线约束 + 持续重训 + 可回滚。本期重点* DRIVE: Distributional and Retrieval-Augmented Bidding with Value Evaluation——直接面向广告自动出价,用GMM多峰动作头+历史轨迹检索+IQL价值打分的三段式推断结构,专治DT类模型的"Average Action陷阱"(高价和低价都合理,模型却输出无用的中间值)。AuctionNet上把PDiT收益提升约19%。* CoRe: A Continuously Reward-Finetuned LLM Query Rewriter for Multi-Stage Context-Awar...去小宇宙查看完整单集简介在小宇宙查看该单集文稿
Embed this episode
Ready to play
AI计算广告论文播报|6月15日:出价均值陷阱、LLM改写持续训练与工业决策范式收敛
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.