EPISODE · Aug 23, 2026 · 2 MIN
Vero 測試 GPT-5.5 xhigh 在真實專案中同時完成程式碼與證明,90 分鐘解決 27/43 個實例
from EasyVibeCoding Podcast · host Dawn Song
Vero 測試 GPT-5.5 xhigh 在真實專案中同時完成程式碼與證明,90 分鐘解決 27/43 個實例。最強的 GPT-5.5 xhigh 設定在 90 分鐘限制內,於 code-and-proof 模式完成 27/43 個實例。測試設計 Vero 收錄 43 個源自真實專案的多模組 Lean 4 儲存庫,涵蓋 Python、Dafny、Verus 與 Coq 等來源語言。每個實例都提供固定 API、人工整理的規格與參考實作,要求 Agent 在既定介面與規格下完成工作。Vero 的端對端建構與評估工作流程圖,分為 1 BENCHMARK CURATION(包含 1A REAL-WORLD REPOSITORIES、1B HUMAN-GATED CURATION、1C CURATED LEAN 4 BENCHMARK)、2 AGENT GENERATION(包含 2A PROOF-ONLY MODE 與 2B CODE + PROOF MODE)以及 3 EVALUATION(包含 3A INDEPENDENT GRADER 與 3B FORMAL AUDIT ROUTE),下方附有標題 Figure 1 與詳細說明文字。proof-only:只合成機器可檢查的證明。 code-and-proof:同時實作程式碼並完成證明。評測結果 @dawnsongtweets 表示,最強設定在 code-and-proof 模式完成 27/43 個實例;在 proof-only 模式則完成 25/43 個。這組結果顯示,當任務從單純證明擴大到同時實作程式碼與證明時,仍有許多實例無法在有限時間內完全解決。Vero 基準測試包含 43 個實例,其中 Track 1(形式化)在 APIs、Specs 與 Source LoC 的平均數皆高於 Track 2(非形式化)。方法與可信度 Vero 另設稽核機制,用於處理規格或參考實作彼此不一致的情況,避免評測結果受到不合理題目條件影響。官方貼文附上的結果圖比較兩種模式下的模型表現,而〈Vero 基準測試論文〉提供正式方法與完整的測試規範。原文:https://easyvibecoding.app/curated/3105-vero-tests-gpt-5-5-xhigh-code-proof-27-of-43
Embed this episode
Ready to play
Vero 測試 GPT-5.5 xhigh 在真實專案中同時完成程式碼與證明,90 分鐘解決 27/43 個實例
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.