Skip to content
E231. Fine tune概念已过时?|强化学习的数学直觉|AGI的自我迭代|开源vs闭源的第一性原理|说胡话的原理|大语言模型技术深度访谈2⧸3 episode artwork

EPISODE · Sep 24, 2023 · 29 MIN

E231. Fine tune概念已过时?|强化学习的数学直觉|AGI的自我迭代|开源vs闭源的第一性原理|说胡话的原理|大语言模型技术深度访谈2⧸3

from 课代表立正 · host 课代表立正(孙煜征)

当 Fine tune 被用来指代多种不同操作,模型定制的讨论很容易失焦。本期从可导损失、连续决策与 reward 出发,比较强化学习、adapter 和提示层的作用,再追问 AGI 的自我迭代以及模型“说胡话”究竟意味着什么。 适合评估模型微调、智能体或高风险应用的技术人员,帮助判断何时需要强化学习、何时只需任务适配,以及怎样看待不确定输出。 这期你会听到 • 任务答案已知时,为什么普通训练可能比强化学习更直接? • 连续决策与不可导的 reward,分别怎样改变训练方法的选择? • adapter 如何在不重做底层模型的情况下适配不同任务? • 开放强化学习能力后,AGI 系统能否借助机器反馈持续改进一连串行动? • 模型说胡话与统计错误有什么差别,表达置信度能否改变风险判断? 相关内容 观看本期视频版 阅读本期文字稿 加入Superlinear Academy免费社区 带上一个模型容易答错却语气确定的案例,拆分错误来源、风险边界和可验证的反馈信号。 https://www.superlinear.academy/ 关于主播与节目 孙煜征(课代表立正),康奈尔大学经济学博士、Superlinear Academy创始人。曾任Amazon经济学家、Meta数据科学家和腾讯IEG副总监,也是OpenAI收购团队早期成员。 《课代表立正》关注AI如何改变工作、职业与商业,以及人在变化中最需要保留的判断力。

Episode metadata supplied by the publisher feed · Published Sep 24, 2023

Embed this episode

Ready to play

E231. Fine tune概念已过时?|强化学习的数学直觉|AGI的自我迭代|开源vs闭源的第一性原理|说胡话的原理|大语言模型技术深度访谈2⧸3

0:00 29:27

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

Frequently Asked Questions

How long is this episode of 课代表立正?

This episode is 29 minutes long.

When was this 课代表立正 episode published?

This episode was published on September 24, 2023.

Can I download this 课代表立正 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!