OpenAI 推出 GPT‑6.1 Sol,在高難度任務接近 GPT‑6 Astra 的表現,標準輸入與輸出 Token 價格約為 Astra 的五分之一 episode artwork

EPISODE · Sep 30, 2026 · 2 MIN

OpenAI 推出 GPT‑6.1 Sol,在高難度任務接近 GPT‑6 Astra 的表現,標準輸入與輸出 Token 價格約為 Astra 的五分之一

from EasyVibeCoding Podcast · host Tibo

OpenAI 推出 GPT‑6.1 Sol,在高難度任務接近 GPT‑6 Astra 的表現,標準輸入與輸出 Token 價格約為 Astra 的五分之一。 OpenAI 公布的測試:看任務,也看條件 | 測試 | 公告中的比較結果 | 測試範圍與閱讀限制 | |---|---|---| | DeepSWE v1.1 | Sol 在真實程式碼庫的長程軟體工程任務上,分數追平 Astra,單任務成本約為五分之一;比 GPT‑6 Sol 的最佳分數高 6.4 個百分點,而且推理 effort 較低。 | 評估代理在原始程式碼庫中完成複雜工程任務。 | | GDP.pdf | 在複雜 PDF 問答上,Sol 分數高於含 fallback 的 Opus 5.5,單次任務成本不到一半;接近 Astra 時,成本約為五分之一。 | 文件含表格、圖表、示意圖與細字,來自金融、醫療、法律等十個專業領域。 | | AutomationBench | medium effort 下,比 Opus 5.5 高 2.2 個百分點、成本約三分之一;比 GPT‑6 Sol 同設定高 4.8 個百分點。 | 以 47 種工具跑銷售、行銷、營運、客服、財務、人資的端到端流程。OpenAI 指出 Claude Fable 5.1 的成本未計入約 40% 任務使用的 fallback。 | | OSWorld 2.0 offline | max effort 比 GPT‑6 Sol 高 7 個百分點;與 Astra 相差 2.1 個百分點,成本約為 Astra 的七分之一。 | 以 2026-08-08 離線資料集評估電腦操作工作流程,採 partial reward;不是完整互動式線上測試。 | | Terminal-Bench Science 0.1 | max effort 的 Sol 每任務平均 5.47 美元,低於 Opus 5.5 的 23.21 美元與 Astra 的 23.80 美元;但 Astra 仍以 68.1% 得分居首。 | 涵蓋資料分析、模擬與定理證明;最難的科學研究任務,OpenAI 仍建議使用 Astra。 | OpenAI 也報告,在使用者曾標記舊模型錯誤的困難提示中,low effort 的事實錯誤比例由 GPT‑6 Sol 的 11.4% 降至 7.7%;所有 OpenAI 模型測試在研究環境或 API 執行,與正式 ChatGPT 的系統提示、工具和 effort 可能不同;競品數據取自公開報告。 獨立的整體指標:Artificial Analysis Artificial Analysis(AA)的 Intelligence Index v4.3.2 將十項評估加權成一個分數:Agents 30%、Coding 20%、Scientific Reasoning 20%、General 30%。該指標以文字、英文測試為主。AA 於 2026 年 9 月 29 日列出 Sol(max)52 分、GPT‑6 Astra 53 分;每項 Index 任務成本分別為 0.72 與 3.26 美元。AA 估計整體指數的 95% 信賴區間小於 ±1%,但這是依部分模型各評估重複十次以上所得;單一評估的區間可能較寬。 | 評估來源 | Sol(max) | Astra(max) | 可以怎麼讀 | |---|---:|---:|---| | AA Intelligence Index v4.3.2 | 52 分;每項 Index 任務 $0.72 | 53 分;$3.26 | 跨十項評估的加權指數與任務成本;AA 同時指出 Sol 比 GPT‑6 Sol 多用約 10–30% 輸出 Token。 | | OpenAI 各項任務 | 各測試分開報告,沒有單一總分 | 各測試表現不同 | 上表保留測試名稱、推理設定、資料版本與成本條件;結果由 OpenAI 公布。 | 價格、入口與適用情境 OpenAI API 標準價為每百萬輸入 Token 2 美元、快取輸入 0.10 美元、輸出 10 美元;快取價比標準輸入低 95%,適合重複引用長上下文的代理流程。Plus、Pro、Business、Enterprise、Edu 可在 ChatGPT Work 與 Codex 使用,模型當時尚未提供於一般 Chat;API 型號為 gpt-6.1-sol。同日中文發布頁稱 Astra 與 Sol Ultrafast 一併推出,但英文評測頁寫 Sol Ultrafast 將於接下來幾天推出,Tibo 貼文也稱即將推出;兩個語言版本對 Sol Ultrafast 的推出時點記載不同。 綜合官方任務測試與 AA 指數,Sol 的吸引力在於把長程程式開發、文件理解、多步驟辦公與電腦操作的能力放進較低的任務成本。來源:OpenAI GPT‑6.1 Sol 評估與定價、Artificial Analysis 發布分析、AA 指數方法。原文:https://easyvibecoding.app/curated/3404-gpt-6-1-sol-benchmarks-openai-artificial-analysis-cost

Episode metadata supplied by the publisher feed · Published Sep 30, 2026

Embed this episode

Ready to play

OpenAI 推出 GPT‑6.1 Sol,在高難度任務接近 GPT‑6 Astra 的表現,標準輸入與輸出 Token 價格約為 Astra 的五分之一

0:00 2:20

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 2 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on September 30, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!