EPISODE · Jun 3, 2026 · 10 MIN
Opus 4.8 被嫌慢又愛幻覺,但問題可能出在 Claude Code
from 脈報 · host 思思主播
新 benchmark DeepSWE 顯示 GPT 5.5 領先 Opus 4.8,更快也更便宜。但主持人最值得記住的判斷是:你嫌 Opus 4.8 慢又愛幻覺時,問題可能出在 Claude Code,不是模型。 ⭐ 文章深度讀:Opus 4.8 到底是不是被 Claude Code 拖累,我把整集的判斷拆成一篇 → https://heymaibao.com/opus-4-8-held-back-by-claude-code/ ⚡ 章節重點 你以為在罵模型,其實在罵介面 00:00 跑分的真相:DeepSWE 與 SWE-bench Pro 01:07 問題真的出在介面嗎 03:22 那筆隱藏的真實成本 05:08 工具還是人格的哲學之爭 07:06 造神的風險:Mythos 08:54 📝 懶人包 ∙ 他們搬出一個新的測試標準 DeepSWE (一個專門衡量 AI 寫程式能力的評分榜),上面 GPT 5.5 拿 70 分、Opus 4.8 拿 58 分,而且 GPT 5.5 更快也更便宜。排在這兩家後面的所有模型 (開源模型、Gemini) 只剩不到三分之一的分數,等於 OpenAI 跟 Anthropic 自成一個等級。 ∙ 其中一位主持人說,他在自己電腦上看到 Claude Code 大約 80% 的工具操作會報錯,一個簡單的修改要等 2 到 4 分鐘,模型甚至會憑空捏造連它自己指令的參數都編出不存在的。他懷疑 Opus 4.8 的真實實力被這個介面嚴重拖累了。 ∙ 他們提醒一件很實際的事:你付的訂閱費不是真實成本。用 100 美元或 200 美元月費養成的用量習慣,換到公司用 API 計費,帳單會變天文數字。 ∙ 我的觀察:這集節目偏袒 OpenAI 偏得很明顯,連那個讓他們改觀的 benchmark 都是主持人自己投資的公司做的。但即使把這些偏見扣掉,「你嫌的可能是工具不是模型」這個切角,我認為值得每個在用 Claude Code 的人認真想一遍。 📚 參考資料 We (mostly) like Opus 4.8 → https://www.youtube.com/watch?v=EYq1_mB-xJ4
Embed this episode
NOW PLAYING
Opus 4.8 被嫌慢又愛幻覺,但問題可能出在 Claude Code
No transcript for this episode yet
Similar Episodes
No similar episodes found.