EPISODE · Aug 27, 2026 · 8 MIN
Anthropic 實測 1053 人:危險指令只有 13.6% 按拒絕,auto mode 擋下 89%
from 脈報 · host 思思主播
Anthropic 實測 1053 名測試者,面對危險指令只有 13.6% 按下拒絕,auto mode 擋下 89%。本文拆解確認框失效的機制,以及殘留 11% 對兩類 AI 安全風險的不同意義。 ⭐ 文章深度讀:那 11% 呢:兩種風險,答案不一樣 → https://heymaibao.com/anthropic-1053-testers-dangerous-commands/ ⚡ 章節重點 開場:1053 人只有 13.6% 按拒絕 00:00 這場實驗到底怎麼做的 00:53 真正說服我的是那條衰減曲線 01:20 設定檔裡的痕跡:放行規則與跳過檢查 02:10 auto mode 到底做了什麼 03:07 三個被攔下來的內部例子 04:04 那 11% 呢:兩種風險,答案不一樣 05:08 同一篇公告裡有兩組提示詞注入數字 06:14 一個看起來完全例行的安裝指令 07:03 那你現在該做什麼 07:52 回到開頭那個 13.6% 08:38 📝 懶人包 ∙ Anthropic 宣布,Claude Code 的 auto mode 從 2026 年 8 月 14 日起成為 Pro、Max、Team 方案新工作階段的預設模式,這個時間點已經過去。它不再逐項跳確認框,改由一個分類器判斷每個動作要不要擋。Enterprise 與 API 這類通道還是要自己開。 ∙ 在那場 1,053 人的受控實驗裡,人類只擋下 13.6%、auto mode 擋下 89%,而且人類的攔截率會隨著工作階段變長,從早期的約 17% 掉到 50 個提示之後的約 5%。 ∙ 同一篇公告裡有兩組提示詞注入數字,出自不同的攻擊集:Anthropic 委託第三方 Trajectory Labs 做的 720 次攻擊全數沒有攻破 auto mode 下的 Claude Fable 5、Opus 5 與 Sonnet 5,而 Apollo Research 那組對抗測試的分類器漏接率是從 12% 降到 7%。 ∙ 我的觀察是,這批數字真正證偽的是「逐項確認框」這個安全介面,跟哪一家的模型無關,而剩下的 11%,對「誤刪誤清」和「提示詞注入」這兩種風險來說,意義完全不一樣。 📚 參考資料 Auto mode is now the default in Claude Code for Pro, Max, and Team plans → https://claude.com/blog/auto-mode-default-in-claude-code Simon Willison:Auto mode is now the default in Claude Code → https://simonwillison.net/2026/Aug/8/auto-mode/ Configure auto mode - Claude Code Docs → https://code.claude.com/docs/en/auto-mode-config Configure server-managed settings - Claude Code Docs → https://code.claude.com/docs/en/server-managed-settings The lethal trifecta for AI agents: private data, untrusted content, and external communication → https://simonwillison.net/2025/Jun/16/the-lethal-trifecta/
Embed this episode
NOW PLAYING
Anthropic 實測 1053 人:危險指令只有 13.6% 按拒絕,auto mode 擋下 89%
No transcript for this episode yet
Similar Episodes
No similar episodes found.