EPISODE · Jun 8, 2026 · 4 MIN
@cognition:Cognition 發布 FrontierCode 評測生產級程式碼品質。 Cognition 團隊指出,現有的程式碼評測基準多僅關注「功能正確性」,導致…
from EasyVibeCoding Podcast · host Cognition
Cognition 發布 FrontierCode 評測生產級程式碼品質。 Cognition 團隊指出,現有的程式碼評測基準多僅關注「功能正確性」,導致模型常產出雖然能執行但結構混亂、難以維護的程式碼。FrontierCode 是首個專注於「可合併性」(mergeability)的評測工具,透過與 36 個頂尖開源專案的維護者合作,定義了真實生產環境下的程式碼標準。 根據 Cognition 的評測數據,FrontierCode 展現出更簡潔的提示長度(僅任務描述時中位數為 982),但需要修改更具挑戰性的程式碼行數(中位數 308 行),且在程式語言分布上相較於 SWE-bench Pro 與 DeepSWE 更為多元均衡。 核心評測標準 FrontierCode 不僅測試程式碼是否能通過單元測試,更要求模型符合以下維護標準: 行為正確性:補丁是否確實解決問題。 回歸安全性:是否破壞既有程式庫功能。 機械整潔度:是否通過專案的建置、Lint 與風格檢查。 測試品質:模型自行撰寫的測試是否有效捕捉預期行為。 範疇控制:補丁是否僅更動必要範圍。 程式碼品質:是否符合專案慣例、遵循設計模式並具備可讀性。 這是一份顯示程式碼重構任務完成進度的檢查清單,其中有兩項關於多行警告處理的項目尚未通過驗證。 開發與品質控管 為了確保評測的嚴謹度,Cognition 採取了高強度的開發流程: 專家參與:由 20 多位頂尖開源開發者耗時超過 40 小時打造每個任務,並親自定義其專案的「可合併」標準。 嚴格品管:建立包含對抗性測試、校準與多階段審查的品管管線,且每個任務均由 Cognition 研究人員手動審核。 錯誤率降低:透過上述機制,FrontierCode 的錯誤分類率較「SWE-Bench Pro」降低了 81%。 FrontierCode 透過嚴格的品質控制,顯著降低了評估軌跡中的偽陽性(6.9%)與偽陰性(4.1%)比例,其分類錯誤率遠低於 SWE-Bench Pro 與 DeepSWE。 評測結果與現狀 FrontierCode 包含三個難度等級:Extended(150 個任務)、Main(100 個任務)與 Diamond(50 個最難任務)。目前的測試結果顯示,即使是頂尖模型在面對生產級程式碼需求時仍有巨大進步空間: 頂尖模型在 Diamond 難度集中的表現僅獲得 13.4/100 分。 Claude Opus 4.8 在各級別中表現領先,但在 Diamond 級別仍未達飽和。 評測發現 GPT-5.5 雖然得分略低於 Claude Opus 4.8,但在 token 使用量上節省了高達 4 倍,展現了更佳的成本與智慧平衡。 開源模型與閉源模型之間仍存在顯著差距,目前表現最佳的開源模型 Kimi K2.6 在 Diamond 級別僅取得 3.8 分。 在 FrontierCode 程式碼評測基準中,Claude Opus 4.8 在 Extended、Main 與 Diamond 三個子資料集任務中皆取得最高分(分別為 51.8%、34.3% 與 13.4%),顯著領先其他模型如 GPT-5.5 與 Claude Opus 4.7。 在 FrontierCode Diamond 基準測試中,Claude Opus 4.8 以 13.4% 的得分位居第一,顯著領先其他模型如 GPT-5.5(6.3%)與 Claude Opus 4.7(5.2%)。 Celery 的執行長兼技術負責人 Tomer Nosrati 對 FrontierCode 在 AI 評估領域的專業能力給予高度評價。 Budibase 共同創辦人兼技術長 Martin McKeaveney 對 FrontierCode 基準測試的評價,強調其在評估大型語言模型真實智慧與創造力方面的深度與獨特性。 Cognition 表示,為了避免資料污染,目前暫不公開任務內容,但已開放模型開發者進行評測,詳細技術實作細節可參考 Cognition 官方部落格 。原文:https://easyvibecoding.app/curated/1826
Embed this episode
Ready to play
@cognition:Cognition 發布 FrontierCode 評測生產級程式碼品質。 Cognition 團隊指出,現有的程式碼評測基準多僅關注「功能正確性」,導致…
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.