EPISODE · Mar 13, 2026 · 7 MIN
AI 推理模型根本控制不了自己的思維,OpenAI 說這反而是 AI 安全的好消息
from 脈報 · host 思思主播
GPT-5.2 被叫「不要用 XOR 這個詞推理」,結果它用了、發現了、恐慌了,然後又用了 4 次。OpenAI 剛發表研究,說這種失控不是 bug,是安全保障:推理模型連自己的思維鏈都控制不了,就很難偽裝成「想法正確」的樣子來繞過監控。最高 15.4% 的可控性,讓 CoT 監控更可信。 ⭐ 文章深度讀:拆解 OpenAI「失控才安全」的核心邏輯,以及為什麼低可控性讓思維鏈監控更可信 → https://heymaibao.com/openai-cot-controllability-ai-safety/ 📝 懶人包 ∙ OpenAI 測試 13 個前沿推理模型,全部控制思維鏈的能力都很低,最高只有 15.4% ∙ 越長的思考、越多的強化學習訓練,模型控制自身推理的能力反而越差 ∙ 這對 AI 安全是好消息:沒辦法控制自己怎麼想,代表也沒辦法刻意讓推理看起來「對齊」來欺騙監控系統 ∙ 我的觀點:「缺陷即保障」這個邏輯紮實,但 OpenAI 自己也說不清楚這特性為什麼存在,也不確定它能持續多久,所以這是一個「目前窗口還開著」的暫時性好消息 📚 參考資料 Reasoning models struggle to control their chains of thought, and that's good → https://openai.com/index/reasoning-models-chain-of-thought-controllability/
Embed this episode
Ready to play
AI 推理模型根本控制不了自己的思維,OpenAI 說這反而是 AI 安全的好消息
No transcript for this episode yet
Similar Episodes
No similar episodes found.