EPISODE · Jul 11, 2026 · 4 MIN
OpenAI 發布 GPT-5.6 系列模型,其中 Sol 版本以 Claude Fable 5 三分之一的成本提供相近的智慧水準
from EasyVibeCoding Podcast · host Artificial Analysis
OpenAI 發布 GPT-5.6 系列模型,其中 Sol 版本以 Claude Fable 5 三分之一的成本提供相近的智慧水準。 這張圖表呈現了 Artificial Analysis 針對多款 AI 模型在不同任務領域(如推理、編碼、科學與長文本處理)的獨立效能評測數據。 Artificial Analysis 透過最新的「Artificial Analysis Intelligence Index」評測指出,GPT-5.6 系列包含 Sol、Terra 與 Luna 三款模型,在成本與效能的帕雷托前沿(Pareto frontier)上均有顯著提升。 GPT-5.6 系列效能與成本分析 GPT-5.6 Sol (max):在 Intelligence Index 獲得 59 分,僅比 Claude Fable 5 (max) 低 1 分,但每項任務成本僅為 1.04 美元,約為後者的三分之一。 階梯式成本結構:Terra (max) 與 Luna (max) 在 Intelligence Index 分別獲得 55 與 51 分,每項任務成本較 Sol 分別降低約 50% 與 80%。 帕雷托前沿優勢:Luna 與 Sol 在效能與成本的權衡上始終優於 Terra;對於任何 Terra 的投入程度,Luna 或 Sol 都能以更低成本提供相同或更高的智慧水準。 GPT-5.6 各系列模型在不同推理強度下均超越前代 GPT-5.5 並推動 Pareto 前沿,其中 GPT-5.6 Luna 與 Sol 始終處於領先 Terra 的 Pareto 最優前沿上,而 GPT-5.6 Sol (max) 則以約三分之一的成本逼近 Claude Fable 5 的智慧水準。 程式開發與 Agent 評測表現 Coding Agent Index 領先:GPT-5.6 Sol (max) 在 OpenAI 的 Codex harness 中以 80 分領先所有模型,三項評測皆居首,其中 SWE-Atlas-QnA 與 Grok 4.5 並列第一。 成本效益:相較於 Claude Fable 5 (max) 與 Opus 4.8 (max),Sol 在執行程式開發任務時,每項任務成本分別降低了約 40% 與 10%。 GPT-5.6 Sol (max) 在 Artificial Analysis 程式代理指標中領先,在 Terminal-Bench v2 取得 88 分、SWE-Atlas-QnA 取得 84 分,且其每項任務成本顯著低於 Claude Fable 5 (max)。 專業知識工作與科學研究能力 AA-Briefcase 表現:在針對複雜專案知識工作的評測中,GPT-5.6 Sol (max) 排名第二,僅次於 Claude Fable 5 (max),但在 Presentation Elo(簡報呈現品質)指標上表現最為突出,其產出的 PowerPoint 與 Excel 檔案視覺吸引力為所有模型之冠。整體居次的原因也很明確:Fable 5 在 Rubric Score(56% vs 42%)與分析品質上仍明顯領先;另在 AA-Omniscience 知識測驗中,Sol 的準確率雖有提升,幻覺率卻升至 89%,為本次受測模型中最高。 科學研究突破:在由 Argonne 與 UIUC 開發的物理研究基準測試「CritPt」中,GPT-5.6 Sol (max) 擊敗 Claude Fable 5,展現出在處理前沿科學研究問題上的強大潛力。該基準測試包含 71 項由全球 30 多個機構的物理學家所提供的未公開研究挑戰。 在 CritPt: Score 基準測試中,GPT-5.6 Sol (max) 以 32.3% 的得分位居榜首,相較於 GPT-5.5 (xhigh) 的 27.1% 有顯著提升。 技術架構與定價策略 快取寫入定價:GPT-5.6 是 OpenAI 首度引入「快取寫入」(cache-write)定價的模型系列。 定價細節:Sol、Terra 與 Luna 的輸入/輸出 token 價格分別為每百萬 token 5/30 美元、2.5/15 美元與 1/6 美元。 成本機制:OpenAI 維持了 90% 的快取讀取折扣,並跟進 Anthropic 引入快取寫入費用(為輸入 token 價格的 1.25 倍),以更精確反映模型在記憶體佔用上的實際成本。 token 使用效率:GPT-5.6 Sol (max) 在 Intelligence Index 中每項任務僅使用 15k token,相較於 GPT-5.5 的 16k token 展現了更高的 token 使用效率,且在智慧水準上超越了 Claude Opus 4.8 (max)、GLM-5.2 (max) 與 Gemini 3.5 Flash (high)。 GPT-5.6 Sol (max) 在 Artificial Analysis 智慧指數中以 59 分緊追 Claude Fable 5 (max)(60 分),且成本僅其約三分之一;同時在 Coding Agent 指數中,搭配 Codex 評估套件以 80 分奪冠。 GPT-5.6 Sol 在 Artificial Analysis 智慧指數中僅以 1 分之差(59分對60分)緊追 Claude Fable 5,但成本僅為其約三分之一($1.04 對 $2.75);同時 GPT-5.6 Luna (max) 在更低的成本下,智慧表現達到或超越了 GLM-5.2 (max) 與 Gemini 3.5 Flash,與 Sol 共同在帕雷托前沿(Pareto frontier)上提供極具性價比的選擇。 在 Artificial Analysis 的 AA-Briefcase Elo 基準測試中,GPT-5.6 Sol (max) 以 1495 分位居第二,僅次於 Claude Fable 5 (with fallback) 的 1583 分。 GPT-5.6 Sol 在 Artificial Analysis 智慧指數中以僅三分之一的成本緊追 Claude Fable 5(得分僅低 1 分),並在 OpenAI 的 Codex 架構下領先 Coding Agent 指數。 在 GDPval-AA v2 排行榜中,Claude Fable 5 (with fallback) 以 1760 分奪冠,而 GPT-5.6 Sol (max) 以 1748 分緊隨其後位居第二,且 GPT-5.6 旗下多款模型(Sol、Terra、Luna)表現均大幅超越人類基準線(1,000 分)。 根據 Artificial Analysis 的評測,GPT-5.6 Sol (max) 在 AA-Omniscience Index 獲得 22 分、Accuracy 為 59%;Claude Fable 5 分別為 40 分與 61%。圖中也顯示 Sol 的 hallucination rate 為 89%。 GPT-5.6 Sol (max) 在簡報 Elo 評測中以 1656 分奪冠,相較於前代 GPT-5.5 (xhigh) 的 1122 分展現出顯著的跨代提升。原文:https://easyvibecoding.app/curated/2453-gpt-5-6-sol-costs-a-third-of-fable-5
Embed this episode
Ready to play
OpenAI 發布 GPT-5.6 系列模型,其中 Sol 版本以 Claude Fable 5 三分之一的成本提供相近的智慧水準
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.