EPISODE · Jul 29, 2026 · 1 MIN
Claude Opus 5 在 DeepSWE 評測奪得最高分
from EasyVibeCoding Podcast · host Datacurve
Claude Opus 5 在 DeepSWE 評測奪得最高分。 評測表現與排名 Datacurve 發布的 DeepSWE 評測結果顯示,Claude Opus 5 獲得 74% 的分數,是目前所見表現最好的長跨度程式開發模型。此外,畫面顯示的 DeepSWE v1.1 評測圖表也納入了多款模型的平均每個任務成本與效能表現,包含 claude-opus-5、claude-fable-5、kimi-k3、gpt-5.6-sol、claude-sonnet-5、grok-4.5、muse-spark-1.1、claude-opus-4.8、gemini-3.6-flash 與 glm-5.2 等。完整評測結果可參閱 DeepSWE 評測網站。 互動風格與行為差異 在運作機制上,Opus 5 傾向安靜作業,而 Fable 5 則會隨時旁白說明其正在執行的動作: Opus 5 只為 11% 的工具呼叫加上說明,相較之下 Fable 5 的比例高達 65%。 在工作結束後,Opus 5 總是會提供總結,而 Fable 5 則完全不會提供。 DeepSWE v1.1 評測圖表展示多個模型的平均每個任務成本與效能表現 Opus 5 與 Fable 5 的工具呼叫旁白比例對照:Opus 5 僅 11%、Fable 5 達 65% 成本效益比較 在執行成本方面,Opus 5 展現出顯著的經濟效益: Opus 5 平均每個任務的成本比 Fable 5 減少了 45%。 根據測試數據,Opus 5(共 449 次試驗)的平均成本為 $11.84、中位數為 $10.51;而 Fable 5(共 432 次試驗)的平均成本則為 $21.63、中位數為 $19.23,兩者平均成本差距達到 $9.79。 Opus 5 與 Fable 5 每 task 成本比較長條圖Opus 5 與 Fable 5 的工具呼叫旁白比例對照:Opus 5 僅 11%、Fable 5 達 65% 影片中的 Prompt 與操作:操作步驟: 1. NONE原文:https://easyvibecoding.app/curated/2753-claude-opus-5-achieves-top-score-on-deepswe-benchmark
Embed this episode
NOW PLAYING
Claude Opus 5 在 DeepSWE 評測奪得最高分
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.