AI 寫程式最大的問題不是寫不好,是不知道自己寫得爛 episode artwork

EPISODE · Mar 25, 2026 · 8 MIN

AI 寫程式最大的問題不是寫不好,是不知道自己寫得爛

from 脈報 · host 思思主播

同一個 AI 模型,花 9 美元寫出壞掉的遊戲,花 200 美元寫出能玩的遊戲。Anthropic 工程師分享了多代理架構怎麼讓產出品質翻倍,以及模型升級後該怎麼調整架構設計。 ⭐ 文章深度讀:解析 $9 vs $200 背後的架構差異,以及模型升級後該拆掉哪些元件 → https://heymaibao.com/ai-self-evaluation-problem-anthropic-harness/ ⚡ 章節重點 同一個 AI,9 美元 vs 200 美元 00:00 AI 心裡的兩個小惡魔 01:21 不讓 AI 自己檢查作業 02:20 三人小隊寫出能玩的遊戲 04:27 模型變強了,架構反而該拆 05:35 你現在就能用的三步驟 06:47 📝 懶人包 ∙ AI 有兩個致命弱點:工作太久會急著收尾 (叫做 context anxiety),而且對自己的爛產出照樣打高分。把「做事的 AI」和「檢查的 AI」分開,是突破品質天花板的關鍵 ∙ 同樣的模型,不加架構花 9 美元寫出來的遊戲核心功能是壞的,加了多代理架構花 200 美元寫出來的遊戲可以實際玩。品質差距不在模型本身,在外部設計 ∙ 架構不是固定的。上面的三代理系統原本需要把任務拆成小段 (sprint) 才跑得順,但模型從 Opus 4.5 升級到 4.6 之後,AI 可以連續工作超過 2 小時不失控,Anthropic 就直接把這個拆段機制拿掉了。每個架構元件都是一個「模型做不到 X」的假設,模型升級就該重新檢驗 ∙ 我的觀察:這篇文章最值得帶走的不是技術細節,而是一個思維框架。不管你是 AI 工具的使用者還是開發者,「好的架構設計能讓同一個模型產出完全不同品質的結果」這件事,解釋了為什麼同一個 Claude,在不同工具裡表現差距那麼大 📚 參考資料 Harness design for long-running application development → https://www.anthropic.com/engineering/harness-design-long-running-apps

Episode metadata supplied by the publisher feed · Published Mar 25, 2026

Embed this episode

Ready to play

AI 寫程式最大的問題不是寫不好,是不知道自己寫得爛

0:00 8:15

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

Frequently Asked Questions

How long is this episode of 脈報?

This episode is 8 minutes long.

When was this 脈報 episode published?

This episode was published on March 25, 2026.

Can I download this 脈報 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!