EPISODE · Jul 19, 2026 · 2 MIN
Kimi K3 與 GPT-5.6 等四款模型在八天內密集發布,使頂尖 AI 實驗室數量在六週內從兩家擴增至六家
from EasyVibeCoding Podcast · host Artificial Analysis
Kimi K3 與 GPT-5.6 等四款模型在八天內密集發布,使頂尖 AI 實驗室數量在六週內從兩家擴增至六家。 市場格局劇變 根據 Artificial Analysis 的最新數據,人工智慧領域在 7 月 8 日至 7 月 17 日的八天內迎來四款前沿模型發布,包括 SpaceXAI 的 Grok 4.5、OpenAI 的 GPT-5.6(包含 Sol、Terra、Luna 三個版本)、Meta 的 Muse Spark 1.1 以及 Moonshot AI 的 Kimi K3。目前在「Artificial Analysis Intelligence Index」評分超過 50 分的實驗室已從 6 月初的兩家增加至六家,顯示前沿模型的競爭已進入白熱化階段。 Claude Fable 5 (with fallback) 以 60 分蟬聯 Artificial Analysis 智慧指數榜首,但其領先優勢已縮小至 1 分,近期發布的 GPT-5.6 Sol (59 分) 與 Kimi K3 (57 分) 緊隨其後,且 Kimi K3 在性價比上表現優異,能以約一半的成本提供與 Claude Opus 4.8 相當的智慧水準。 Kimi K3 的強勢表現 Moonshot AI 推出的 Kimi K3 以 57 分的評分空降排行榜第三名,超越了 Claude Opus 4.8(56 分)。其核心優勢在於: 在 GDPval-AA v2 基準測試中獲得 1668 Elo,位居第三。 在針對長週期知識工作的 AA-Briefcase 基準測試中表現亮眼,以 1547 Elo 排名第二,僅次於 Claude Fable 5,且其分析品質 Elo(1760)與 Claude Fable 5(1764)幾乎持平。 具備極高的成本效益,每項 Intelligence Index 任務成本約為 0.94 美元,僅為 Claude Opus 4.8(1.80 美元)成本的一半左右。 價格與效能的快速迭代 儘管 Anthropic 的 Claude Fable 5 自 6 月 9 日以來持續穩居榜首,但其領先優勢已從 4 分縮小至 1 分,且市場整體的智慧成本出現顯著下降: GPT-5.6 Sol 的每項任務成本為 1.04 美元,效能僅比 Claude Fable 5 低 1 分,但價格大幅降低。 Grok 4.5 以 0.31 美元的成本提供 54 分的效能,相較於 GPT-5.5(0.99 美元)性價比提升超過三倍。 在 51 分的效能區間,GPT-5.6 Luna(0.21 美元)與 Muse Spark 1.1(0.26 美元)均已低於一週前該區間最便宜的 GLM-5.2(0.32 美元)。 原文:https://easyvibecoding.app/curated/2588-ai-labs-triple-in-six-weeks-model-race
Embed this episode
Ready to play
Kimi K3 與 GPT-5.6 等四款模型在八天內密集發布,使頂尖 AI 實驗室數量在六週內從兩家擴增至六家
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.