OpenAI 自研推論晶片 Jalapeño 首批基準結果公開:端到端快 1.7–3.6 倍,2027 年才放量
OpenAI 在 Hot Chips 2026 公開自研推論處理器 Jalapeño 的首批基準結果,與 Broadcom 共同開發,端到端回應時間較標準商用配置快 1.7 至 3.6 倍。但晶片尚未量產,2026 年底僅極小量部署,2027 年才會有較顯著規模。
美西時間 2026 年 8 月 25 日,OpenAI 在 Hot Chips 2026 大會上公開自家推論處理器 Jalapeño 的首批基準結果,並同步在官方頁面 openai.com/index/jalapeno-first-results/ 發布數據。這是 OpenAI 第一款自己設計的 AI 推論專用晶片,由 OpenAI 與 Broadcom 共同開發。
必須先講清楚一件事:這場發布公開的是「基準測試結果」,不是產品上市。OpenAI 說明部署時程為 2026 年底僅「極小量(very small volumes)」上線,2027 年才會有較顯著規模,官方也尚未公布定價與詳細製程規格。換句話說,現在沒有任何人能買到或直接用到 Jalapeño。
公開了哪些數字
OpenAI 採用 SemiAnalysis 的 InferenceX 基準實測,公開的關鍵結果有三項:
- 在「每用戶 token 數(tokens per user)」這項指標上勝過現行最先進的推論處理器。
- 在「每千瓦吞吐量(throughput per kilowatt)」上同樣勝出,也就是在相同耗電功率下能吐出更多 token。
- 端到端回應時間較標準商用配置快 1.7 到 3.6 倍;官方未說明這個區間差異的成因。
多家媒體在報導中點名,比較對象包含 NVIDIA Blackwell 系統。要注意的是,這些數字由晶片設計方自行提出,官方未提及第三方獨立複測。
架構重點:讓資料不必一直搬
Jalapeño 的設計思路不是堆算力,而是砍延遲。OpenAI 指出,推論流程中真正卡住時間的常是兩段:prefill(把提示詞讀進來、建立初始狀態)與各晶片之間的通訊階段。這兩段的共通特徵是大量資料在記憶體與晶片之間來回搬移,算力再高也只能等。
因此 Jalapeño 的做法是減少資料搬移,並把 KV cache(模型在生成過程中反覆讀取的鍵值快取)就地化,讓它盡量待在運算單元旁邊。這也解釋了為什麼提升主要反映在「回應時間」與「每千瓦效率」,而不是峰值算力數字——省下來的是等待與電力,不是浮點運算。
為什麼一家模型公司要自己做晶片
OpenAI 把 Jalapeño 定位為整合 AI 產品、模型、晶片與記憶體的跨世代平台。放進 2026 年的產業脈絡看,這一步並不孤立:8 月 24 日 NVIDIA 才宣布 Groq 3 LPX 全面量產,推論專用矽的競爭已經是這一年的主線。差別在於,NVIDIA 賣晶片給所有人,OpenAI 做晶片是為了餵飽自己的服務。
對管理者的意義
模型供應商自建推論矽,動的是「每一次呼叫的成本與延遲」這條底線。對已經把 AI 接進客服、文件處理或流程稽核的企業來說,未來兩年 API 價格與回應速度的變化,可能不只來自模型改版,也來自供應商換硬體。現在值得做的一件事,是把自家 AI 應用的成本結構拆開來看:哪些流程對延遲敏感、哪些批次跑完就好、哪些綁死在單一供應商。等到 2027 年硬體真的換代、價格結構跟著動的時候,手上有這張表的人才有談判與遷移的餘裕。