EPISODE · Sep 30, 2026 · 2 MIN
OpenAI 推出 GPT‑6.1 Sol,在高難度任務接近 GPT‑6 Astra 的表現,標準輸入與輸出 Token 價格約為 Astra 的五分之一
from EasyVibeCoding Podcast · host Tibo
OpenAI 推出 GPT‑6.1 Sol,在高難度任務接近 GPT‑6 Astra 的表現,標準輸入與輸出 Token 價格約為 Astra 的五分之一。 OpenAI 公布的測試:看任務,也看條件 | 測試 | 公告中的比較結果 | 測試範圍與閱讀限制 | |---|---|---| | DeepSWE v1.1 | Sol 在真實程式碼庫的長程軟體工程任務上,分數追平 Astra,單任務成本約為五分之一;比 GPT‑6 Sol 的最佳分數高 6.4 個百分點,而且推理 effort 較低。 | 評估代理在原始程式碼庫中完成複雜工程任務。 | | GDP.pdf | 在複雜 PDF 問答上,Sol 分數高於含 fallback 的 Opus 5.5,單次任務成本不到一半;接近 Astra 時,成本約為五分之一。 | 文件含表格、圖表、示意圖與細字,來自金融、醫療、法律等十個專業領域。 | | AutomationBench | medium effort 下,比 Opus 5.5 高 2.2 個百分點、成本約三分之一;比 GPT‑6 Sol 同設定高 4.8 個百分點。 | 以 47 種工具跑銷售、行銷、營運、客服、財務、人資的端到端流程。OpenAI 指出 Claude Fable 5.1 的成本未計入約 40% 任務使用的 fallback。 | | OSWorld 2.0 offline | max effort 比 GPT‑6 Sol 高 7 個百分點;與 Astra 相差 2.1 個百分點,成本約為 Astra 的七分之一。 | 以 2026-08-08 離線資料集評估電腦操作工作流程,採 partial reward;不是完整互動式線上測試。 | | Terminal-Bench Science 0.1 | max effort 的 Sol 每任務平均 5.47 美元,低於 Opus 5.5 的 23.21 美元與 Astra 的 23.80 美元;但 Astra 仍以 68.1% 得分居首。 | 涵蓋資料分析、模擬與定理證明;最難的科學研究任務,OpenAI 仍建議使用 Astra。 | OpenAI 也報告,在使用者曾標記舊模型錯誤的困難提示中,low effort 的事實錯誤比例由 GPT‑6 Sol 的 11.4% 降至 7.7%;所有 OpenAI 模型測試在研究環境或 API 執行,與正式 ChatGPT 的系統提示、工具和 effort 可能不同;競品數據取自公開報告。 獨立的整體指標:Artificial Analysis Artificial Analysis(AA)的 Intelligence Index v4.3.2 將十項評估加權成一個分數:Agents 30%、Coding 20%、Scientific Reasoning 20%、General 30%。該指標以文字、英文測試為主。AA 於 2026 年 9 月 29 日列出 Sol(max)52 分、GPT‑6 Astra 53 分;每項 Index 任務成本分別為 0.72 與 3.26 美元。AA 估計整體指數的 95% 信賴區間小於 ±1%,但這是依部分模型各評估重複十次以上所得;單一評估的區間可能較寬。 | 評估來源 | Sol(max) | Astra(max) | 可以怎麼讀 | |---|---:|---:|---| | AA Intelligence Index v4.3.2 | 52 分;每項 Index 任務 $0.72 | 53 分;$3.26 | 跨十項評估的加權指數與任務成本;AA 同時指出 Sol 比 GPT‑6 Sol 多用約 10–30% 輸出 Token。 | | OpenAI 各項任務 | 各測試分開報告,沒有單一總分 | 各測試表現不同 | 上表保留測試名稱、推理設定、資料版本與成本條件;結果由 OpenAI 公布。 | 價格、入口與適用情境 OpenAI API 標準價為每百萬輸入 Token 2 美元、快取輸入 0.10 美元、輸出 10 美元;快取價比標準輸入低 95%,適合重複引用長上下文的代理流程。Plus、Pro、Business、Enterprise、Edu 可在 ChatGPT Work 與 Codex 使用,模型當時尚未提供於一般 Chat;API 型號為 gpt-6.1-sol。同日中文發布頁稱 Astra 與 Sol Ultrafast 一併推出,但英文評測頁寫 Sol Ultrafast 將於接下來幾天推出,Tibo 貼文也稱即將推出;兩個語言版本對 Sol Ultrafast 的推出時點記載不同。 綜合官方任務測試與 AA 指數,Sol 的吸引力在於把長程程式開發、文件理解、多步驟辦公與電腦操作的能力放進較低的任務成本。來源:OpenAI GPT‑6.1 Sol 評估與定價、Artificial Analysis 發布分析、AA 指數方法。原文:https://easyvibecoding.app/curated/3404-gpt-6-1-sol-benchmarks-openai-artificial-analysis-cost
Embed this episode
Ready to play
OpenAI 推出 GPT‑6.1 Sol,在高難度任務接近 GPT‑6 Astra 的表現,標準輸入與輸出 Token 價格約為 Astra 的五分之一
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.