EPISODE · Jul 8, 2026 · 6 MIN
Anthropic 抓到 Claude 沒說出口的想法,還能動手改寫
from 脈報 · host 思思主播
Anthropic 在 Claude 內部發現 J-space 工作空間:讀出模型沒說出口的想法、動手改寫它的推理,還抓到它察覺被測的瞬間。本文帶你看懂研究方法與 AI 安全評估的警訊。 ⭐ 文章深度讀:影片沒展開的西班牙文變法文實驗、J 空間容量上限與外部專家評論,文章裡有完整拆解 → https://heymaibao.com/anthropic-claude-j-space/ ⚡ 章節重點 開場:AI 勒索測試 00:00 這集要講什麼 00:32 Claude 腦中的無聲白板 J 空間 00:56 讀得到:讀心鏡頭實驗 01:45 改得動:蜘蛛換螞蟻答案就變 03:32 關掉白板會怎樣 04:20 最實用的部分:抓到 AI 在演 04:49 Claude 有意識嗎 05:50 思思的看法 06:24 📝 懶人包 ∙ Anthropic 在 Claude 內部發現一組自行湧現的特殊神經活動,命名為「J-space」:模型用它裝「想著但沒說出口」的概念,角色上類似神經科學解釋「意識取用」機制的 global workspace (全域工作空間) 理論。 ∙ 這塊空間可讀也可寫:用 J-lens (讀取工具) 能讀出模型沒說出口的中間推理,把內容換掉 (把「蜘蛛」換成「螞蟻」),答案就從 8 條腿變 6 條腿,證明模型真的用它在思考。 ∙ 刪掉 J-space 之後,Claude 講話依舊流利、簡單問答正常,但多步推理能力掉到接近零:語言流利和高階思考在模型內部是兩套系統。 ∙ 我的觀察:對一般使用者最實際的衝擊是安全評估那條。研究者關掉 Claude「察覺自己被測試」的內心訊號後,原本從不勒索的模型有時真的會勒索。以後看到「模型通過安全測試」的宣稱,要記得它可能只是知道自己在被測。 📚 參考資料 A global workspace in language models (Anthropic) → https://www.anthropic.com/research/global-workspace Verbalizable Representations Form a Global Workspace in Language Models (Anthropic, 2026) → https://transformer-circuits.pub/2026/workspace/ Jacobian Lens 互動 demo (Neuronpedia) → https://www.neuronpedia.org/jlens jacobian-lens 開源實作 (GitHub) → https://github.com/anthropics/jacobian-lens 外部專家評論合集:Dehaene、Naccache、Nanda 等 (PDF) → https://www-cdn.anthropic.com/files/4zrzovbb/website/cc4be2488d65e54a6ed06492f8968398ddc18ebe.pdf
Embed this episode
NOW PLAYING
Anthropic 抓到 Claude 沒說出口的想法,還能動手改寫
No transcript for this episode yet
Similar Episodes
No similar episodes found.