EPISODE · Mar 13, 2026 · 6 MIN
GPT-5.4 做到了我沒想到的事,卻做壞了我每天都在做的事
from 脈報 · host 思思主播
GPT-5.4 在自建評測裡排第 10 名,UI 任務主動改設計,程式碼有記憶體洩漏。版本升級後行為大改、需要重調提示詞,是他留在 Claude 的真正原因,不是跑分。附實測細節。 ⭐ 文章深度讀:拆解 UI 任務被主動改掉、程式碼記憶體溢位的實測細節,加上比跑分更準的選工具標準 → https://heymaibao.com/gpt-54-benchmark-review/ 📝 懶人包 ∙ GPT-5.4 定價與 Claude Sonnet 相同 (每百萬輸入 / 輸出 token 各 $2.50 / $15),但在作者自建的 benchmark (效能評測) 裡排第 10 名。日常 UI 任務主動改掉作者的設計,解密程式也寫出記憶體洩漏問題。 ∙ 作者說不換過去的真正理由不是跑分,而是「版本升級後不用改設定」。Opus 4.5 升到 4.6 完全無縫,GPT 5.3 升到 5.4 卻需要重新調整所有提示詞 (跟 AI 溝通的指令)。 ∙ Anthropic 被認為已超出「模型公司」的定位,正在打造整個開發環境。Claude Code 社群活躍、更新有實質意義;反觀 Codex (OpenAI 的開發工具) 更新乏力,OpenAI 仍在這個層面追趕。 ∙ 我的觀察:這篇評測真正有意思的地方,是它重新定義了什麼叫「可靠」。對專業開發者來說,一個模型在極端任務的峰值表現,遠比不上它在日常任務裡的行為穩定性。這個標準,大部分的跑分評測都沒有在測。 📚 參考資料 GPT-5.4 實測評測影片 → https://youtu.be/2AMj7xGL0BU
Embed this episode
Ready to play
GPT-5.4 做到了我沒想到的事,卻做壞了我每天都在做的事
No transcript for this episode yet
Similar Episodes
No similar episodes found.