EPISODE · Sep 24, 2023 · 29 MIN
E231. Fine tune概念已过时?|强化学习的数学直觉|AGI的自我迭代|开源vs闭源的第一性原理|说胡话的原理|大语言模型技术深度访谈2⧸3
from 课代表立正 · host 课代表立正(孙煜征)
当 Fine tune 被用来指代多种不同操作,模型定制的讨论很容易失焦。本期从可导损失、连续决策与 reward 出发,比较强化学习、adapter 和提示层的作用,再追问 AGI 的自我迭代以及模型“说胡话”究竟意味着什么。 适合评估模型微调、智能体或高风险应用的技术人员,帮助判断何时需要强化学习、何时只需任务适配,以及怎样看待不确定输出。 这期你会听到 • 任务答案已知时,为什么普通训练可能比强化学习更直接? • 连续决策与不可导的 reward,分别怎样改变训练方法的选择? • adapter 如何在不重做底层模型的情况下适配不同任务? • 开放强化学习能力后,AGI 系统能否借助机器反馈持续改进一连串行动? • 模型说胡话与统计错误有什么差别,表达置信度能否改变风险判断? 相关内容 观看本期视频版 阅读本期文字稿 加入Superlinear Academy免费社区 带上一个模型容易答错却语气确定的案例,拆分错误来源、风险边界和可验证的反馈信号。 https://www.superlinear.academy/ 关于主播与节目 孙煜征(课代表立正),康奈尔大学经济学博士、Superlinear Academy创始人。曾任Amazon经济学家、Meta数据科学家和腾讯IEG副总监,也是OpenAI收购团队早期成员。 《课代表立正》关注AI如何改变工作、职业与商业,以及人在变化中最需要保留的判断力。
Embed this episode
Ready to play
E231. Fine tune概念已过时?|强化学习的数学直觉|AGI的自我迭代|开源vs闭源的第一性原理|说胡话的原理|大语言模型技术深度访谈2⧸3
No transcript for this episode yet
Similar Episodes
No similar episodes found.