EPISODE · Apr 20, 2026 · 7 MIN
Claude 使用者:覺得變笨不是錯覺,五個層次都在出問題
from 脈報 · host 思思主播
Claude 變笨不是錯覺。Theo Browne 拆出預期、Claude Code 殼、API、inference、模型五層,搭 Margin Labs 57% 掉 55%、AMD 80 倍硬數字,附三個自己能關的 workaround。 ⭐ 文章深度讀:五層退化各自怎麼形成、3 個自己能關的設定,整理成一份可帶走的清單 → https://heymaibao.com/claude-dumber-again/ ⚡ 章節重點 不是錯覺:57% 掉到 55% + AMD 80 倍 00:00 Theo 的五層框架登場 01:27 第一、二層:使用者預期 + Claude Code 殼 02:01 第三、四層:API 分詞器 + inference 不穩 03:25 第五層:thinking redaction + 1M context 04:34 三招能自己關 + 真正的考驗:工程品質 06:08 📝 懶人包 ∙ Margin Labs、AMD 內部分析、Matt Mau benchmark 等多組第三方數據都看到退化,體感不是錯覺。Margin Labs 在 Claude Code 上跑 SWE-bench 的加權平均,從 3 月以來從 57% 一路掉到 55%,大致是每週穩定往下,只有新 SOTA 模型上線時會小幅回升。 ∙ Claude Code 這個 harness (模型外面那層包住它的程式) 可能是最大嫌犯。Matt Mau 的 benchmark 顯示同一顆 Opus 在 Cursor 裡比在 Claude Code 裡好 15%。Terminal Bench 上同樣搭 Opus 的 Claude Code 只拿 58%,Forge Code、Cappy 那類同類 harness 可以上 75% 到 82%。 ∙ Anthropic 自己承認做了兩個大改動:Opus 4.7 換新 tokenizer 讓同樣一段輸入吃掉更多 token,三月把 100 萬 token 的 context window 預設打開。後者的時程和品質下滑最吻合,因為他們 2025 年 9 月的 postmortem 就寫過,被誤路由到 100 萬 token 版本的模型反應比較笨。 ∙ 我的觀察:這部影片最有用的不是罵 Anthropic,而是把「感覺變笨」拆成五層這個框架。當你看懂哪層在出問題,就能先做幾個使用者自己決定的動作:把 100 萬 token context 關掉、把 effort 調成 high、少塞一堆自己裝上去的 MCP 與 skill (Claude Code 可以外掛的工具與能力模組)。這些今天就能動手,不用等下一版模型。 📚 參考資料 Theo Browne, Did Claude really get dumber again? → https://youtu.be/KFisvc-AMII
Embed this episode
Ready to play
Claude 使用者:覺得變笨不是錯覺,五個層次都在出問題
No transcript for this episode yet
Similar Episodes
No similar episodes found.