OpenAI 發布 Jalapeño:每瓦 AI 工作量提升 1.5 至 1.9 倍,預計 2026 年底部署 episode artwork

EPISODE · Aug 26, 2026 · 4 MIN

OpenAI 發布 Jalapeño:每瓦 AI 工作量提升 1.5 至 1.9 倍,預計 2026 年底部署

from EasyVibeCoding Podcast · host OpenAI

OpenAI 發布 Jalapeño:每瓦 AI 工作量提升 1.5 至 1.9 倍,預計 2026 年底部署。 核心進展 OpenAI 在 2026 年 8 月 26 日分享首款自研推論晶片 Jalapeño 的實驗室結果,強調同一套架構同時提高吞吐量、降低延遲,不必在兩者之間取捨。官方表示,這將帶來更快的 ChatGPT 回應、更靈敏的 Codex session 與 Agent,以及需求持續成長時更可靠的服務存取。Jalapeño 預計在 2026 年底開始部署到 OpenAI 的運算基礎架構;Gen 2 已深入開發,Gen 3 也正在成形。 實測數據 OpenAI 以公開 benchmark InferenceX,在相同使用者體驗與功耗條件下,比較 Jalapeño 和商用 AI 系統,涵蓋 GPT‑OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T: 三個模型的峰值每瓦 AI 工作量成長為 1.5 至 1.9 倍。 端到端延遲降低為原本的 1/1.7 至 1/3.6。 面向高度互動的工作負載,效能成長為 2.1 至 4.1 倍。 在最大的公開模型 Kimi K2.5 1T 上,每瓦峰值效能約成長為 1.5 倍,端到端延遲降低為 1/3.4。 晶片額定功耗為 700W,但測試工作負載的持續實測功耗維持在 550W 以下。 Jalapeño 在 Interactivity 提升 2.1x–4.1x、E2E latency 降低 1.7x–3.6x,且 Perf/W 在 previous-best TBT 與 peak throughput 分別提升 8.6x–104.3x 及 1.5x–1.9x。 SemiAnalysis 也在實驗室驗證部分 InferenceX 執行結果,稱 Jalapeño 在多種情境的每瓦效能超越已測試的 NVIDIA、AMD 與 Google 晶片,包含 Blackwell。不過,這些數字由 OpenAI 提供,SemiAnalysis 並未執行完整 InferenceX 測試,也尚未取得 AgentX 結果;其指出,長 context、多輪互動和 agentic 工作負載會額外考驗路由器、前綴快取與整體快取管理,因此目前結果不代表所有生產情境。SemiAnalysis 也認為,Jalapeño 更適合拿來和採用 HBM4 的 NVIDIA Vera Rubin 比較,而非只和 Blackwell 比較。 架構取向 Jalapeño 從一開始就以現代與未來的語言模型推論為目標,將晶片、記憶體、網路、軟體與機架級系統一起設計。Prefill 主要受運算能力限制,decode 則更依賴記憶體頻寬;Jalapeño 會把模型狀態與生成回應所需的 KV cache 保持在適當的本地位置,減少核心與晶片間的資料搬移。它不把 prefill 和 decode 固定拆到不同晶片池,而是採用較均一的資源池,以因應工作負載比例隨模型世代改變。 AI 輔助開發 OpenAI 表示,AI 協助 Jalapeño 從初始設計走到 tapeout,僅花約 9 個月,並縮短設計、量測與驗證 loop。團隊使用 Codex 搭配 GPT‑Astra,在兩個月內讓原本不在生產計畫中的三個 open-weight 模型達到高效能;部分 GPT‑OSS attention 與 mixture-of-experts block 的 AI 生成實作,比原先由人類專家撰寫的版本快 1.5 至 1.8 倍,但這只適用於指定 block,並非完整模型。 Jalapeño 晶片安放於綠色主機板插槽上的特寫鏡頭 後續規劃 Jalapeño 目前仍在進行 production qualification、軟體成熟化、規模化營運準備與更多模型的效能驗證。Tibo 同時提到 /ultrafast 需求非常大,OpenAI 將繼續和 Cerebras 合作,探索更快的模型推論;Cerebras 則表示,Jalapeño 與下一代 Cerebras 解決方案預計在 2027 年一同進入生產。OpenAI 也表示,訓練與推論仍將廣泛部署 NVIDIA 與其他合作夥伴的加速器。原文:https://easyvibecoding.app/curated/3142-openai-jalapeno-tests-ai-workload-latency-improvements

Episode metadata supplied by the publisher feed · Published Aug 26, 2026

Embed this episode

Ready to play

OpenAI 發布 Jalapeño:每瓦 AI 工作量提升 1.5 至 1.9 倍,預計 2026 年底部署

0:00 4:49

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 4 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on August 26, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!