Anthropic 推出 Claude Fable 5.1:鎖定長時間 coding 與知識工作,Mythos 5.1 則限可信存取方案 episode artwork

EPISODE · Sep 2, 2026 · 4 MIN

Anthropic 推出 Claude Fable 5.1:鎖定長時間 coding 與知識工作,Mythos 5.1 則限可信存取方案

from EasyVibeCoding Podcast · host ClaudeDevs

Anthropic 推出 Claude Fable 5.1:鎖定長時間 coding 與知識工作,Mythos 5.1 則限可信存取方案。 來源:Anthropic 官方發布公告|Claude Fable 5.1 與 Mythos 5.1 官方發布主視覺。 先給選型結論 Anthropic 的模型文件仍建議多數工作先從價格只有一半、延遲較低的 Claude Opus 5 開始;若 Opus 5 開到高 effort 後,團隊自己的評測仍無法達標,或任務確實需要數小時到數十小時持續研究、操作工具與驗證成果,再考慮 Fable 5.1。Mythos 5.1 與 Fable 5.1 使用同一底層模型,但防護與存取資格不同,不能把 Mythos 的高風險領域能力當成一般帳戶可用功能。 發布與定位 Anthropic 在 2026 年 9 月 1 日發布 Fable 5.1。Fable 5.1 已一般可用,涵蓋 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 與 Claude Platform on AWS,也出現在 Claude.ai、Claude Code、Claude Cowork 等產品面。它主攻長時間、跨工具的 agentic 工作,包括大型程式專案、多步驟研究、資料分析,以及文件、試算表和簡報製作。Anthropic 團隊把它定位為目前最強的長任務模型,但這是第一方產品定位;是否值得升級,仍應由團隊自己的完成率、人工介入與成本資料決定。 官方 benchmark 橫向比較 Anthropic 這次公布七組評測,Fable 5.1 不只是在單一 coding 榜單進步: 資料來源:Anthropic 官方發布公告|Fable 5.1 七組官方 benchmark 橫向比較;珊瑚欄為 Fable 5.1,Terminal-Bench 4.0 第二個數字為 Mythos 5.1。 科學研究代理:Terminal-Bench-Science 0.1 為 52.6%,對上 Fable 5 的 24.7%、Opus 5 的 29.0% 與 GPT-5.6 Sol 的 22.4%。 終端機 coding:Terminal-Bench 4.0 為 55.8%;同底層模型但放寬防護的 Mythos 5.1 為 60.9%,Fable 5、Opus 5、GPT-5.6 Sol 則分別為 42.0%、52.3%、37.3%。 知識工作:GDPval-AA v2 得分 1853,高於 Fable 5 的 1723、Opus 5 的 1824 與 GPT-5.6 Sol 的 1711。 電腦操作:OSWorld 2.0 的 partial/strict 分別為 77.9%/41.7%,Fable 5 為 72.9%/36.1%,Opus 5 為 75.4%/39.6%。 跨領域推理:Humanity's Last Exam 無工具為 60.9%、有工具為 65.0%;Fable 5 是 57.8%/63.8%,Opus 5 是 56.6%/63.6%。 商務流程:AutomationBench 為 31.4%,對上 Fable 5 的 17.1%、Opus 5 的 26.9% 與 GPT-5.6 Sol 的 19.6%。 代理式 coding:CursorBench 3.2.0 為 73.4%,高於 Fable 5 的 70.5%、Opus 5 的 70.0% 與 GPT-5.6 Sol 的 67.2%。 怎麼讀這些數字 這些是 Anthropic 自行公布的產品評測,不是獨立榜單,也不是七組都採相同 harness。官方的成本曲線是在各 effort 等級比較表現與每次任務成本,成本軸使用對數刻度;Claude Code 預設 high,Claude.ai 與 Cowork 預設 medium,因此只看單一最高分,無法回答實際部署的成本效益。 Terminal-Bench-Science 維護者把它定義為跨生命、物理、地球、數學與工程科學的專家策劃研究工作流;Anthropic 這次使用的 0.1 版,每個模型標準誤差約為 ±3.5~4.5 個百分點。Anthropic 的設定把 Opus 5/Fable 5 重跑成 29.0%/24.7%,公開榜單則是 30.0%/21.4%,兩組差異仍在誤差範圍。OSWorld 2.0 使用 2026 年 8 月版任務,Fable 5 與 Opus 5 也在同一版本重跑,不能拿這次數字直接和舊版 OSWorld 成績比較。 Fable 5.1 測試時開著正式環境的安全防護;OSWorld 2.0 中,Fable 5.1 與 Fable 5 被防護介入的任務會直接記零分,AutomationBench 則只有 Fable 5 的介入任務明確採零分處理。其他受介入的資安任務會改由 Opus 4.8 執行,生物任務則改由 Opus 5 執行。Terminal-Bench 4.0 的 Fable/Mythos 差距也包含防護差異,所以 55.8% 與 60.9% 反映的是兩套可用系統,不是兩個純模型 checkpoint 的公平對決。 從跑分走到真實長任務 官方公告列了幾個較能說明「長任務」的案例,但它們仍是早期客戶回饋,不是獨立重現: Millennium 表示,Fable 5.1 逆向分析外部函式庫與 core dump,找出一個團隊多年未能解釋、約每百萬次執行才出現一次的 crash。 MongoDB 表示,模型先讀完多個服務的程式碼與文件,再持續執行數小時,用約三天完成一個複雜原型,並附上驗證紀錄與視覺 walkthrough。 Ramp 回報一個無人值守 38 小時的機器學習工作:模型辨認既有結果其實是標籤假象,修正後再啟動六組平行實驗。 合作夥伴的量化結果也只能當方向訊號:Browserbase 在最難的 browser-agent benchmark 測得 Fable 5.1 完成率 82%,Opus 5 為 74%、Fable 5 為 57%;Crosby 的 RedlineBench 從 47.9 提升到 57.0;Samaya 的 FrontierFinance rubric score 則由 Fable 5 的 49.2% 提升到 55.9%。這些評測的任務集與執行環境由各公司自訂,不應和官方 benchmark 混成同一排名。 外部 evaluator 的另一套量測 Artificial Analysis用自己的 Intelligence Index 測得 Fable 5.1 max effort 為 66 分,對照 Opus 5 的 63、Fable 5 的 62 與 GPT-5.6 Sol 的 61;分項包含 HLE 59.1%、Terminal-Bench v2.1 91.4% 與 SciCode 62.0%。這組結果和 Anthropic 官表不是同一 harness,不能混表比較,但同樣指出長任務與科學/coding 工作的提升。 Artificial Analysis 外部量測:Fable 5.1 max 分數最高,但每任務成本也最高;xhigh 更接近成本與分數的折衷。 成本面沒有同樣樂觀:Artificial Analysis 測得 Fable 5.1 max 每項任務約 3.76 美元,比 Fable 5 max 高 20%,主因是輸出 token 約為前代 1.7 倍;xhigh 可用 2.72 美元拿到 65 分,而 Opus 5 max 是 2.34 美元、63 分。該測試也使用 Anthropic 預設 server-side fallback,約 4% 輸出 token 實際由 Opus 4.8 或 Opus 5 提供,因此這是「Fable 5.1 產品系統」的外部量測,不是完全隔離的純 checkpoint 成績。 科學研究是這次另一條主線 Fable 5.1 用 NASA Magellan 雷達資料重建金星約三分之一表面的高解析度高程圖,把可辨識細節從 10~20 公里縮小到約 2~3 公里,官方稱高度估算最多改善 25%,並把成果以 Creative Commons 授權公開。受限存取的 Mythos 5.1 則設計蛋白質 binder:在三個指定 target 上,結合親和力約為 Adaptyv Bio 競賽最佳設計的 10 倍,12 個 target 的可用 binder 命中率接近 50%;另一項工作把七個開源蛋白質與基因體模型的推論加速最多 2.5 倍,官方估算大型分析的 GPU 成本可降低 30~60%。其中蛋白質設計送交兩家外部組織做實驗驗證,GPU 加速案例則使用公開原始碼;兩者使用的都是 Mythos 受限方案,不能直接推論一般 Fable 使用者能重現。 規格、價格與生命週期 Fable…

Episode metadata supplied by the publisher feed · Published Sep 2, 2026

Embed this episode

Ready to play

Anthropic 推出 Claude Fable 5.1:鎖定長時間 coding 與知識工作,Mythos 5.1 則限可信存取方案

0:00 4:19

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 4 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on September 2, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!