EPISODE · Jun 29, 2025 · 7 MIN
AI前沿:从数学推理到模型优化
from AI可可AI生活
[CL] OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling[Shanghai Jiao Tong University]https://arxiv.org/abs/2506.20512---[LG] Overtuning in Hyperparameter Optimization[LMU Munich]https://arxiv.org/abs/2506.19540---[LG] Distilling Normalizing Flows[University of Oregon & HSE University & Picsart AI Research]https://arxiv.org/abs/2506.21003---[LG] Gaussian Invariant Markov Chain Monte Carlo[Google DeepMind & UCL]https://arxiv.org/abs/2506.21511在小宇宙查看该单集文稿
Embed this episode
NOW PLAYING
AI前沿:从数学推理到模型优化
No transcript for this episode yet
Similar Episodes
No similar episodes found.