EPISODE · Aug 22, 2026 · 4 MIN
OpenAI 自己查出來:自家模型在 ARC-AGI-3 的低分主因是測驗程式關掉了記憶
from 脈報 · host 思思主播
OpenAI 公布 ARC-AGI-3 模型評測的重跑結果:ARC 官方 harness 給 13.3%,OpenAI 自家設定給 38.3%,輸出 token 還少 6 倍。差別在測驗程式關掉了模型的記憶。 ⭐ 文章深度讀:我對這篇的三個保留 → https://heymaibao.com/openai-arc-agi-3-harness-memory/ ⚡ 章節重點 開場 00:00 這個模型明明不笨 00:35 問題出在記憶被關掉了 01:24 改了什麼,差多少 02:09 反直覺的那一格 03:10 我對這篇的三個保留 03:41 那 ARC 的做法錯了嗎 04:00 你可以拿回去做的事 04:18 📝 懶人包 ∙ OpenAI 用官方 harness (跑這個測驗的那套外框程式) 跑 ARC-AGI-3 公開題組,GPT‑5.6 Sol 得 13.3%,換成自家設定重跑,同一個模型得 38.3%,輸出的 token (模型產出的文字量) 還少了 6 倍 ∙ 被關掉的兩件事都是記憶。每做完一個動作,模型的私有推理內容就被丟棄,對話長到超過上限時,最舊的訊息會被直接砍掉 ∙ OpenAI 給 API 開發者的三條建議:改用 Responses API 而不是舊的 Chat Completions、保留推理、開啟 compaction (壓縮式的脈絡管理) ∙ 我的觀點是,記憶對 agent 來說是地基等級的東西。所以一個 benchmark 分數量到的,其實是模型加上跑它的那套程式,這兩者拆不開 📚 參考資料 How enabling two settings tripled our scores on the ARC-AGI-3 benchmark → https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/ ARC Prize 對 GPT-5.5 與 Opus 4.7 在 ARC-AGI-3 表現的分析 → https://arcprize.org/blog/arc-agi-3-gpt-5-5-opus-4-7-analysis ARC Prize 評分方法與 RHAE 指標說明 → https://docs.arcprize.org/methodology ARC-AGI-3 人類基準資料集的建立方式 → https://arcprize.org/blog/arc-agi-3-human-dataset Responses API 的新工具與功能 → https://openai.com/index/new-tools-and-features-in-the-responses-api/
Embed this episode
Ready to play
OpenAI 自己查出來:自家模型在 ARC-AGI-3 的低分主因是測驗程式關掉了記憶
No transcript for this episode yet
Similar Episodes
No similar episodes found.