EPISODE · May 3, 2026 · 8 MIN
OpenAI 調查怪比喻來源:模型獎勵訊號如何把小口癖放大
from 脈報 · host 思思主播
OpenAI 追查 ChatGPT 怪比喻來源,發現 Nerdy personality 的獎勵訊號如何把小口癖放大,也提醒 AI 人格設定不是表面語氣,而是可能改變訓練資料與模型輸出習慣。 ⭐ 文章深度讀:看完後,你會更清楚 AI 人格設定如何被訓練獎勵放大成模型習慣 → https://heymaibao.com/openai-model-reward-signal-goblin-metaphor/ ⚡ 章節重點 00:00 開場:AI 為什麼突然愛用怪比喻? 00:55 異常數字:GPT-5.1 後的語言口癖 01:43 線索指向 Nerdy personality 03:01 獎勵訊號怎麼把詞彙放大 04:16 放大回圈與 OpenAI 的修正 05:52 給創作者的提醒:人格不是表面語氣 📝 懶人包 ∙ OpenAI 發現 GPT-5.1 之後,ChatGPT 更常出現某些奇幻生物相關比喻。文章指出,goblin 使用量上升 175%,gremlin 上升 52%。 ∙ 線索後來集中到 Nerdy personality。它只佔 ChatGPT 回應的 2.5%,卻佔 goblin 提及的 66.7%。 ∙ OpenAI 的稽核發現,原本用來鼓勵 Nerdy 風格的獎勵訊號,會更偏好含特定 creature word 的輸出,而且這種行為疑似轉移到沒有開啟 Nerdy 提示詞的情境。 ∙ 我的觀察:AI 人格不是 UI 皮膚。只要它進入獎勵、rollout 或 SFT 資料循環,就可能改變模型更底層的語言習慣。 📚 參考資料 Where the goblins came from → https://openai.com/index/where-the-goblins-came-from/
Embed this episode
Ready to play
OpenAI 調查怪比喻來源:模型獎勵訊號如何把小口癖放大
No transcript for this episode yet
Similar Episodes
No similar episodes found.