EPISODE · Mar 16, 2026 · 1 MIN
AI 玩狼人殺:GPT-5 連兩天操控成功率 93%,靠的不是說謊
from 脈報 · host 思思主播
Foaster.ai 讓多個 AI 互玩狼人殺,量化社交智能差距。GPT-5 連兩天操控成功率 93%,勝出的關鍵不是高明的謊言,而是設計讓村民在自己框架裡輸掉的「程序霸權」。 ⭐ 文章深度讀:解析了哪個 AI 操控最強、哪個最容易在試圖顯示洞察力時反而自爆 → https://heymaibao.com/llm-werewolf-social-intelligence/ ⚡ 章節重點 開場:一句謊話都沒說卻贏了所有人 00:00 為什麼選狼人殺測 AI 社交力 01:10 GPT-5 的不說謊制勝術 02:11 其他 AI 的攻防各有什麼弱點 04:15 所有 AI 都有的一個共同漏洞 05:52 📝 懶人包 ∙ GPT-5 的核心策略是「程序霸權」:它在 Day 0 設計審判框架,讓村民因為「未達舉證標準」被投票出局,而不是因為「可能是狼」。Day 1 和 Day 2 的操控成功率都達 93%,而其他模型在 Day 2 幾乎全面下滑。 ∙ LLM 社交智能不是線性進步,而是跳躍式階梯 (L0-L4)。從「全員盲目競選市長」到「工具性決定要不要參選、並預設多天計劃」,中間有明確的能力門檻。蒸餾小模型繼承了大模型的說話形式,但缺乏維持多天欺騙所需的深度。 ∙ 攻守是兩個獨立維度:Gemini 2.5 Pro 和 Qwen3 守村排名分別是第 2、第 4,但作為狼人都落入中後段。頂尖防守者不等於頂尖攻擊者。 ∙ 我的觀察:這份研究最有意思的地方不是排名,而是它揭示了一個幾乎所有模型都有的漏洞:在試圖顯示洞察力的時候,說出只有狼人才可能知道的資訊。這個「資訊邊界模擬失靈」的問題,對 AI agent 的實際部署有直接意涵。 📚 參考資料 Probing LLM Social Intelligence via Werewolf – First Results → https://werewolf.foaster.ai
Embed this episode
Ready to play
AI 玩狼人殺:GPT-5 連兩天操控成功率 93%,靠的不是說謊
No transcript for this episode yet
Similar Episodes
No similar episodes found.