OpenAI 自研推理芯片 Jalapeño 首批基准结果公开:端到端快 1.7–3.6 倍,2027 年才放量
OpenAI 在 Hot Chips 2026 公开自研推理处理器 Jalapeño 的首批基准结果,与 Broadcom 联合开发,端到端响应时间比标准商用配置快 1.7 至 3.6 倍。但芯片尚未量产,2026 年底仅极小量部署,2027 年才会有较显著规模。
美西时间 2026 年 8 月 25 日,OpenAI 在 Hot Chips 2026 大会上公开了自家推理处理器 Jalapeño 的首批基准结果,并同步在官方页面 openai.com/index/jalapeno-first-results/ 发布数据。这是 OpenAI 第一款自己设计的 AI 推理专用芯片,由 OpenAI 与 Broadcom 联合开发。
必须先讲清楚一件事:这场发布公开的是「基准测试结果」,不是产品上市。OpenAI 说明部署时程为 2026 年底仅「极小量(very small volumes)」上线,2027 年才会有较显著规模,官方也尚未公布定价与详细制程规格。换句话说,现在没有任何人能买到或直接用到 Jalapeño。
公开了哪些数字
OpenAI 采用 SemiAnalysis 的 InferenceX 基准进行实测,公开的关键结果有三项:
- 在「每用户 token 数(tokens per user)」这项指标上胜过现行最先进的推理处理器。
- 在「每千瓦吞吐量(throughput per kilowatt)」上同样胜出,也就是在相同耗电功率下能吐出更多 token。
- 端到端响应时间比标准商用配置快 1.7 到 3.6 倍;官方未说明这个区间差异的成因。
多家媒体在报道中点名,比较对象包含 NVIDIA Blackwell 系统。要注意的是,这些数字由芯片设计方自行提出,官方未提及第三方独立复测。
架构重点:让数据不必一直搬
Jalapeño 的设计思路不是堆算力,而是砍延迟。OpenAI 指出,推理流程中真正卡住时间的常是两段:prefill(把提示词读进来、建立初始状态)与各芯片之间的通信阶段。这两段的共同特征是大量数据在内存与芯片之间来回搬移,算力再高也只能等。
因此 Jalapeño 的做法是减少数据搬移,并把 KV cache(模型在生成过程中反复读取的键值缓存)就地化,让它尽量待在运算单元旁边。这也解释了为什么提升主要体现在「响应时间」与「每千瓦效率」,而不是峰值算力数字——省下来的是等待与电力,不是浮点运算。
为什么一家模型公司要自己做芯片
OpenAI 把 Jalapeño 定位为整合 AI 产品、模型、芯片与内存的跨世代平台。放进 2026 年的产业脉络看,这一步并不孤立:8 月 24 日 NVIDIA 才宣布 Groq 3 LPX 全面量产,推理专用硅的竞争已经是这一年的主线。差别在于,NVIDIA 卖芯片给所有人,OpenAI 做芯片是为了喂饱自己的服务。
对管理者的意义
模型供应商自建推理硅,动的是「每一次调用的成本与延迟」这条底线。对已经把 AI 接进客服、文档处理或流程稽核的企业来说,未来两年 API 价格与响应速度的变化,可能不只来自模型改版,也来自供应商换硬件。现在值得做的一件事,是把自家 AI 应用的成本结构拆开来看:哪些流程对延迟敏感、哪些批量跑完就好、哪些绑死在单一供应商。等到 2027 年硬件真的换代、价格结构跟着动的时候,手上有这张表的人才有谈判与迁移的余地。
大家怎么说 · 3 条留言