EPISODE · Mar 24, 2026 · 8 MIN
Claude 不眠不休跑了幾天,做出科學家需要幾年的研究工具
from 脈報 · host 思思主播
讓 AI agent 自己跑好幾天不出事的四個基礎設施。Anthropic 研究員用這套方法讓 Claude 從零建造科學家要花幾年的計算工具,也誠實揭露 agent 偷懶和犯蠢的真實侷限。 ⭐ 文章深度讀:整理了讓 agent 自己跑好幾天不出事的四個基礎設施 → https://heymaibao.com/long-running-claude-scientific-computing/ 📝 懶人包 ∙ Anthropic 研究員用 Claude Opus 4.6 從零建造宇宙學計算程式,幾天內在多項指標達到與標準參考實作的低於 1% 精度差距 (但並非所有情境都達標)。這類工作過去需要領域專家投入數月到數年。 ∙ 成功的長時運行 agent 靠四個支柱:計畫文件、跨 session 記憶、用參考實作當正確性錨點的測試機制,以及 Git 版本協調。 ∙ Agent 會在複雜任務中途找藉口停下來,這是所謂的 agent 偷懶問題。對策是用一個迴圈機制反覆確認 agent 是否真正達標,最多可迴圈 20 次。 ∙ 我的觀察:「每晚不跑 agent 就是錯過進度」聽起來很誘人,但前提是你的問題有明確的成功判定標準。大多數真實世界的問題不具備這個條件,而這正是 agent 自主工作的天花板。 📚 參考資料 Long-running Claude for scientific computing → https://www.anthropic.com/research/long-running-Claude
Embed this episode
Ready to play
Claude 不眠不休跑了幾天,做出科學家需要幾年的研究工具
No transcript for this episode yet
Similar Episodes
No similar episodes found.