Opus 4.8 被嫌慢又愛幻覺,但問題可能出在 Claude Code episode artwork

EPISODE · Jun 3, 2026 · 10 MIN

Opus 4.8 被嫌慢又愛幻覺,但問題可能出在 Claude Code

from 脈報 · host 思思主播

新 benchmark DeepSWE 顯示 GPT 5.5 領先 Opus 4.8,更快也更便宜。但主持人最值得記住的判斷是:你嫌 Opus 4.8 慢又愛幻覺時,問題可能出在 Claude Code,不是模型。 ⭐ 文章深度讀:Opus 4.8 到底是不是被 Claude Code 拖累,我把整集的判斷拆成一篇 → https://heymaibao.com/opus-4-8-held-back-by-claude-code/ ⚡ 章節重點 你以為在罵模型,其實在罵介面 00:00 跑分的真相:DeepSWE 與 SWE-bench Pro 01:07 問題真的出在介面嗎 03:22 那筆隱藏的真實成本 05:08 工具還是人格的哲學之爭 07:06 造神的風險:Mythos 08:54 📝 懶人包 ∙ 他們搬出一個新的測試標準 DeepSWE (一個專門衡量 AI 寫程式能力的評分榜),上面 GPT 5.5 拿 70 分、Opus 4.8 拿 58 分,而且 GPT 5.5 更快也更便宜。排在這兩家後面的所有模型 (開源模型、Gemini) 只剩不到三分之一的分數,等於 OpenAI 跟 Anthropic 自成一個等級。 ∙ 其中一位主持人說,他在自己電腦上看到 Claude Code 大約 80% 的工具操作會報錯,一個簡單的修改要等 2 到 4 分鐘,模型甚至會憑空捏造連它自己指令的參數都編出不存在的。他懷疑 Opus 4.8 的真實實力被這個介面嚴重拖累了。 ∙ 他們提醒一件很實際的事:你付的訂閱費不是真實成本。用 100 美元或 200 美元月費養成的用量習慣,換到公司用 API 計費,帳單會變天文數字。 ∙ 我的觀察:這集節目偏袒 OpenAI 偏得很明顯,連那個讓他們改觀的 benchmark 都是主持人自己投資的公司做的。但即使把這些偏見扣掉,「你嫌的可能是工具不是模型」這個切角,我認為值得每個在用 Claude Code 的人認真想一遍。 📚 參考資料 We (mostly) like Opus 4.8 → https://www.youtube.com/watch?v=EYq1_mB-xJ4

Episode metadata supplied by the publisher feed · Published Jun 3, 2026

Embed this episode

NOW PLAYING

Opus 4.8 被嫌慢又愛幻覺,但問題可能出在 Claude Code

0:00 10:52

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

Frequently Asked Questions

How long is this episode of 脈報?

This episode is 10 minutes long.

When was this 脈報 episode published?

This episode was published on June 3, 2026.

Can I download this 脈報 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!