近三分之一可能判錯,你信的 AI 寫程式排行榜出了什麼問題 episode artwork

EPISODE · May 30, 2026 · 8 MIN

近三分之一可能判錯,你信的 AI 寫程式排行榜出了什麼問題

from 脈報 · host 思思主播

新評測 DeepSWE 回頭檢查主流 AI 寫程式排行榜,發現近三分之一判定可能不可信。問題出在答案能被 AI 直接抄,加上評分又測錯東西。這篇拆解病灶與 DeepSWE 的修法。 ⭐ 文章深度讀:完整拆解這 32% 判定怎麼被戳破,以及 DeepSWE 用什麼修法把漏洞堵死 → https://heymaibao.com/ai-coding-benchmark-deepswe/ ⚡ 章節重點 開場 00:00 近三分之一判錯的震撼數字 00:26 兩個病灶 污染與弱驗證 01:32 DeepSWE 怎麼防作弊 03:15 不同 AI 的寫程式性格 04:28 該怎麼看這份報告 06:18 📝 懶人包 ∙ DeepSWE 團隊請一個 AI 重新逐筆檢查 SWE-bench Pro 的判分,發現有 32% 的「過 / 不過」判定,跟仔細讀過程的人看法不一致。換成他們自家的 DeepSWE 評測,這個數字只有 1.4%。 ∙ 病灶有兩個。一是「污染」:標準答案就藏在程式碼的版本紀錄裡,AI 翻一下就抄到。二是「弱驗證」:負責改考卷的評分程式測錯了東西,誤殺對的答案,也放過了沒真正做事的答案。 ∙ DeepSWE 的修法很直接:題目全部重新出、不把答案放進考場、評分只看「行為對不對」而不是「寫法像不像標準答案」。 ∙ 我的觀察:以後看這類排行榜,真正該盯的不是誰排第一,而是「這個分數是怎麼判出來的」。但要提醒一句,這份審計是 DeepSWE 自己做的,數字漂亮的一方剛好也是出題的一方,看的時候得把這層關係放在心上。 📚 參考資料 DeepSWE: Measuring frontier coding agents on original, long-horizon engineering tasks (Wenqi Huang et al., 2026) → https://deepswe.datacurve.ai/blog

Episode metadata supplied by the publisher feed · Published May 30, 2026

Embed this episode

Ready to play

近三分之一可能判錯,你信的 AI 寫程式排行榜出了什麼問題

0:00 8:33

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

Frequently Asked Questions

How long is this episode of 脈報?

This episode is 8 minutes long.

When was this 脈報 episode published?

This episode was published on May 30, 2026.

Can I download this 脈報 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!