EPISODE · Jul 24, 2026 · 9 MIN
Anthropic 發布 Claude Opus 5,價格與 Opus 4.8 相同,智慧接近價格兩倍的 Fable 5
from EasyVibeCoding Podcast · host Claude
Anthropic 發布 Claude Opus 5,價格與 Opus 4.8 相同,智慧接近價格兩倍的 Fable 5。 Anthropic 正式推出 Claude Opus 5:定價維持與前一代 Opus 4.8 相同(每百萬輸入 token 5 美元、每百萬輸出 token 25 美元),卻以 Fable 5 一半的價格提供接近其前沿水準的智慧。它預設啟用思考、強化了推理與 Agentic 程式開發,上下文視窗 1M token 既是預設也是上限(沒有更小的變體),單次最多輸出 128k token。 Claude Opus 5 的標題畫面 模型效能與基準表現 在 Frontier-Bench、GDPval-AA 等程式開發與知識工作評測中創下全新的 state-of-the-art,且以較低成本達到前一代 Opus 4.8 超過兩倍的表現;官方同時註明,它在網路安全任務上仍落後 Mythos 5。 Opus 5 在多項編程與知識工作評測上達到前沿 SOTA,並在 ARC-AGI-3 創新問題解決測試中以 30.2% 分數遠超其他模型 在 Frontier-Bench v0.1 上,各個 effort 等級的成本與得分都壓過同級對手。 Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol 在 Frontier-Bench v0.1 依努力程度劃分的代理編程成本與得分比較。 在 ARC-AGI-3 評測中,其分數達到次佳模型的三倍以上。 Opus 5 (high) 在 ARC-AGI-3 評測中取得約 30% 得分,達到次佳模型 GPT-5.6 Sol 的三倍以上。 在 CursorBench 3.2 的 max effort 下,表現與 Fable 5 的 peak score 相差不到 0.5%,但單一任務成本僅有一半。 Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol 在 CursorBench 上不同 effort level 下的成本與分數比較 在電腦操作評測 OSWorld 2.0 上,以約三分之一的成本超越 Fable 5 的最佳成績。 Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol 在 OSWorld 2.0 評測中不同 effort level 下的任務成本與分數比較。 在 Zapier 的 AutomationBench 上,相同單任務成本下的通過率約為次佳模型的 1.5 倍;即使在最低 effort 設定,通過的任務數也多於其他所有模型。 Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol 在 AutomationBench 評測中各工作量設定下的任務成本與通過率比較 在真實知識工作評測 GDPval-AA v2 與 Humanity's Last Exam 上,以相近或更低的單次成本換到更高的正確率。 Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol 在 GDPval-AA v2 基準測試中,不同 effort level 下運算成本與 Elo 分數的比較 Opus 5 在 Humanity's Last Exam (with tools) 基準測試中,以類似或更低的每任務成本展現優於 Fable 5 與 Opus 4.8 的解題正確率 Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol 在不同 Effort Level 下的 Artificial Analysis Coding Agent Index 表現與成本比較 在生命科學評測中全面超越 Opus 4.8,例如有機化學內部評測高出 10.2 個百分點,蛋白質序列變異功能預測高出 7.7 個百分點,並能視覺化氣流流過空氣動力學物件的情況。 官方公布的三個實例 FreeCAD 任務中模型看不到圖面,於是自己寫了一條電腦視覺 pipeline 從原始像素抽出幾何,重建整個機械零件;相同設定下沒有其他競品模型能在五次嘗試內解出。 面對一個開源套件管理器的真實 bug,Opus 5 找出根本原因,補掉社群 patch 漏掉的邊界情況;競品模型只修掉表面症狀就回報問題已解決。 一家交易公司的工程師在單一 session 內建出新的交易所行情 feed;找不到 live feed 可對照時,Opus 5 自己建了一套測試 harness 驗證解析是否正確。 核心架構與行為變更 預設啟用思考功能(thinking),模型會自行決定每個回合的思考時機與深度,開發者可透過 effort 參數(支援 low、medium、high、xhigh、max)控制思考深度;在 Claude Code 與 Claude Platform 上預設為 high。 在 xhigh 或 max 的 effort 等級下,設定 thinking: {"type": "disabled"} 會回傳 400 錯誤,這是一項重要的行為變更。官方也提醒關閉思考有已知瑕疵:模型偶爾會把工具呼叫寫進純文字回覆裡,而不產生結構化的 tool_use 區塊。 支援 Fast mode,執行速度約為預設速度的 2.5 倍,定價為基礎價格的兩倍;此功能仍在研究預覽階段,目前只在 Claude Platform 與 Claude Code 提供,Amazon Bedrock、Google Cloud 與 Microsoft Foundry 尚未支援。 最低可快取 prompt 長度降至 512 tokens,過往因過短而無法快取的 prompt 現在無需修改程式碼即可建立快取條目。 行為方面,其預設回應與書面交付內容更長,在代理式對話中更常向使用者敘述進度,並會主動驗證自身工作——也因此官方建議刪掉沿用自舊模型的驗證指令,那些指令會造成過度驗證、白白消耗 token。 API 與整合設定 支援完整的 effort 階梯,執行高階運算時需設定較大的 maxtokens(例如 64000)以提供模型思考空間;要注意 maxtokens 是「思考+回覆文字」的總量硬上限: `bash cURL curl https://api.anthropic.com/v1/messages \ -H "x-api-key: $ANTHROPICAPIKEY" \ -H "anthropic-version: 2023-06-01" \ -H "content-type: application/json" \ -d '{ "model": "claude-opus-5", "max_tokens": 64000, "stream": true, "output_config": { "effort": "max" }, "messages": [ { "role": "user", "content": "Explain why the sum of two even numbers is always even." } ] }' ` 新增對話中途工具變更(Mid-conversation tool changes)beta 功能,允許在對話回合之間新增或移除工具同時保留 prompt 快取,請求時須帶入 mid-conversation-tool-changes-2026-07-01 beta header。 支援伺服器端預設 fallbacks 模式,依拒絕類別套用 Anthropic 建議的備用模型,須帶入 server-side-fallback-2026-07-01 beta header。 遷移至新版本時,開發者需將程式碼中的模型 ID 更新為 claude-opus-5(詳見遷移指南)。 誰能用、在哪裡能用 所有付費方案與 Claude API 當日開放:在 Claude Max 上是新的預設模型,在 Claude Pro 上是最強的可選模型。 三大雲平台同步供應,Amazon Bedrock 的模型 ID 為 anthropic.claude-opus-5,Google Cloud 與 Microsoft Foundry 亦可使用;Opus 4.8 在這些平台上仍然保留。 Claude Code 需升級到 v2.1.219 以上才選得到 Opus 5(執行 claude update);Max、Team Premium、Enterprise 隨用隨付與 Anthropic API 預設即為 Opus 5,Pro、Tea…
Embed this episode
Ready to play
Anthropic 發布 Claude Opus 5,價格與 Opus 4.8 相同,智慧接近價格兩倍的 Fable 5
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.