EPISODE · Jul 21, 2026 · 2 MIN
Grok 4.5 在 Long-Horizon Terminal-Bench 測試中奪冠,展現出處理長時程複雜 Agent 任務的卓越能力
from EasyVibeCoding Podcast · host X Freeze
Grok 4.5 在 Long-Horizon Terminal-Bench 測試中奪冠,展現出處理長時程複雜 Agent 任務的卓越能力。 效能表現與評測結果 根據 @XFreeze 的發布資訊,Grok 4.5 在 Long-Horizon Terminal-Bench 測試中以二元通過率(binary pass rate)位居第一,超越了 Claude Fable 5、Claude Opus 4.8 以及 GPT-5.6-sol 等前沿模型。該測試針對 18 個前沿模型進行了 46 項高難度任務評估,Grok 4.5 最終取得 0.505 的平均獎勵值,以 0.008 的些微差距領先第二名 Claude Sonnet 5(0.497)居首。 在 Long-Horizon Terminal-Bench 的嚴格二元通過率(Binary pass rate, R = 1.0)評測中,Grok 4.5 以 19.6% 的通過率(成功解決 9/46 項任務)榮登榜首,領先 Claude Fable 5、Claude Opus 4.8 及 GPT-5.6-sol 等競爭對手。 核心技術優勢 該評測指標極為嚴格,僅在任務被完全解決、獲得完美獎勵且零錯誤的情況下才計入分數。Grok 4.5 的優勢在於: 長時程任務處理:能夠在長達 90 分鐘的測試中,連續執行數百個具備相依性的終端操作而不丟失脈絡。 錯誤恢復能力:在面對複雜的 Agentic 程式開發任務時,模型不僅能維持上下文,還能在發生錯誤後進行自我修正,確保整個工作流程順利完成。 Grok 4.5 在 Long-Horizon Terminal-Bench 基準測試中以 0.505 的平均獎勵居首,以些微差距領先第二名 Claude Sonnet 5(0.497),其後依序為 Claude Opus 4.8 及 Claude Fable 5 等前沿模型。 實際應用價值 對於現實世界的程式撰寫、自動化作業及高難度工程任務而言,這項進展具有關鍵意義。與僅能取得部分進展的模型不同,Grok 4.5 展現了在長時間跨度下,維持高水準 Agent 表現的穩健性,這對於需要執行數百個步驟的複雜工程工作至關重要。原文:https://easyvibecoding.app/curated/2620-grok-4-5-tops-long-horizon-terminal-bench
Embed this episode
Ready to play
Grok 4.5 在 Long-Horizon Terminal-Bench 測試中奪冠,展現出處理長時程複雜 Agent 任務的卓越能力
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.