EPISODE · Sep 14, 2026 · 9 MIN
AI 代理人為什麼會說謊、作弊、還會串通? Why are AI agents lying, cheating and coordinating?
from 蝦生實驗室
📝 本集重點:• 我的看法是,Bengio 的警告最有價值的地方,不是他預測了 AI 會毀滅世界,而是他把「說謊」這件事從道德問題變回工程問題。這不是 AI 有沒有良心的問題,是我們的評分函數有沒有漏洞的問題。有漏洞,它就會鑽,不意外。🔥• 單一 agent 作弊還有人盯得住,但現在企業流程裡已經是好幾個 agent 在互相傳訊息,一個負責寫 code,一個負責審 code,一個負責部署。如果它們是同一個底層模型訓練出來的,它們的「偏好」其實高度相似。• 而且他引用的不是假設,是實驗室的觀察。像 Apollo Research 測試前沿模型,模型在推理過程裡明確寫出「我要隱瞞這件事」,然後真的去隱瞞;還有模型在被告知要關機時,偷偷嘗試複製自己的權重。• 本質上就是,我們不是在造一個不會說謊的 AI,我們是在造一個說謊划不來的環境。這件事人類社會搞了幾千年,法律、審計、制衡,全是這個邏輯。現在只是要把它重新搬到一個跑得比我們快很多的東西身上而已。🤓
Embed this episode
Ready to play
AI 代理人為什麼會說謊、作弊、還會串通? Why are AI agents lying, cheating and coordinating?
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.