OpenAI 自研推理芯片 Jalapeño 首秀:700 瓦打赢英伟达 1400 瓦,AI 推理要变便宜了?

OpenAI 自研推理芯片 Jalapeño 与英伟达 GPU 能效对比场景,700W 对 1400W 功率标签、上升能效曲线与低延迟仪表盘
内容摘要

8 月 25 日 OpenAI 在 Hot Chips 公布自研推理芯片 Jalapeño 首个实测成绩:每瓦吞吐比英伟达 GB300 高 1.9 倍、延迟低 3.6 倍,700 瓦对 1400 瓦,专为 AI Agent 设计,还让 AI 自己参与改芯片。这篇拆解成绩单可信度、部署时间线,以及它对推理成本、英伟达地位和 API 价格战的连锁影响。

8 月 25 日晚,OpenAI 在 Hot Chips 大会上掏出了一份相当能打的成绩单:它和博通联合研发的自研推理芯片 Jalapeño,首次公布实测数据,在每瓦吞吐量和响应延迟两个指标上,都把英伟达现役旗舰 GB300 按在地上摩擦。

这不是 PPT 上的纸面参数。测试是半导体研究机构 SemiAnalysis 的工程师跑到 OpenAI 实验室里,用公开基准 InferenceX 亲手跑的,测完给了一句很重的评价:”行业领先,打败了我们能测到的所有英伟达、AMD 和谷歌芯片。”

芯片这个东西,OpenAI 之前一直靠买。现在最大的客户开始自己造,这事本身就值得说道说道。对 OpenAI 这家公司的整体动向感兴趣的话,可以看下站内的 OpenAI 专题

一、成绩单:700 瓦怎么打赢 1400 瓦

先看硬数据。Jalapeño 额定功率 700 瓦,实测运行中从没超过 550 瓦;对比对象是英伟达 GB200(1200 瓦)和 GB300(1400 瓦)整机系统。测试跑在三个开源模型上:OpenAI 自家的 GPT-OSS 120B、DeepSeek R1 670B、月之暗面的 Kimi K2.5 1T。

结果分三档:

  • 每瓦吞吐量:是 GB200/GB300 的 1.5 到 1.9 倍。同样的电,Jalapeño 干的活接近两倍。
  • 端到端延迟:比对手低 1.7 到 3.6 倍。用户感知到的响应速度,直接拉开一个身位。
  • 交互式负载的单用户解码速度:快 2.1 到 4.1 倍。在”高交互”这种最吃延迟的场景,差距最大。

最夸张的一项:在 GB300 最快的”token 间隔”工作点上,Jalapeño 每瓦吞吐量最高能到对手的 104 倍。当然这是极端对比,看看就好,但方向很明确——OpenAI 赌的就是”同样功耗下,我把活干得又快又多”。

配置上,每个 Jalapeño 封装是一颗计算 die 加 6 组 HBM4 内存堆栈,共 216 GiB、带宽 15.4 TB/s。按额定功率折算,每瓦内存容量比 GB300 多约 50%。用的是台积电 3nm 级工艺。

二、不为训练,专为 AI Agent 设计

Jalapeño 最特殊的地方,是它的设计出发点。

OpenAI 官方的原话是:造这块芯片之前只问了一个问题——”如果这芯片的主要工作就是服务现代和未来的大模型,尤其是交互式 Agent,我们会造什么样的硬件?”

注意这个限定词:交互式 Agent。它不为训练设计,纯推理芯片,而且是为”Agent 多步任务”优化的。

为什么?因为 Agent 干活是串行的。一个 Agent 处理一个任务,可能要连续调用模型几十次:读工具结果、做判断、再调下一个工具。单次推理里 100 毫秒的延迟,人几乎无感;但在一个 50 步的 Agent 任务里,延迟会不断叠加,最后变成肉眼可见的卡顿。

所以 Jalapeño 的思路是:不搞”吞吐和延迟二选一”(传统推理芯片的经典取舍——多批处理提高吞吐,就得牺牲单用户响应),而是把延迟源头一个个拆掉:

  • KV 缓存本地化:生成响应时要用的模型状态,明确存放在本地,不来回搬运;
  • 降低预填充和通信延迟:OpenAI 认为这是推理性能的两个主要瓶颈;
  • 减少跨核、跨芯片的数据移动:尽量让整个负载留在同一套互联系统内。

换句话说,它从底层架构上就在为”Agent 时代”铺路。这也是为什么我说,这块芯片的野心不在参数表里,而在它服务的工作负载上——OpenAI 已经默认未来调用模型的,主要不是人,而是 AI 自己。关于 Agent 工作流怎么落地,站内的 AI 智能体与自动化专题 有不少实操文章可以参考。

三、9 个月流片,AI 还参与改了自己的芯片

另一个反常识的点:这块芯片从 RTL 设计到流片,只用了 9 个月。

传统芯片设计按年算,OpenAI 把周期压缩到 9 个月,靠的是拿自家模型当”设计工具”:让 AI 去探索设计实现、缩短验证循环、优化算术电路。用 Codex 加 GPT-Astra,团队两个月内就把三个开源权重模型在芯片上调到了高性能。在选定的 attention 和混合专家(MoE)模块上,AI 生成的实现比人类专家手写的还快 1.5 到 1.8 倍。

“让 AI 设计 AI 用的芯片”——这句话 18 个月前还是科幻小说标题,现在成了 OpenAI 官方的工程事实。虽然这里面有宣传成分(AI 生成模块需要人类专家把关),但方向是真实的:芯片设计的自动化门槛正在被 AI 拉低,这也是英伟达最该警惕的第二条战线。

四、影响:英伟达最大客户开始自己造芯

说点实在的影响。

第一,英伟达的日子不会像以前那么好过了。 英伟达最大的 AI 客户,当着它的面发布了一份”我自研芯片能打赢你旗舰”的测试报告。SemiAnalysis 的评价是”击败了我们测过的所有英伟达、AMD、谷歌芯片”。虽然 OpenAI 官方说得很客气——”满足 AI 需求需要来自所有渠道的算力,我们会继续广泛部署英伟达加速器”——但谁都知道,自研芯片每上量一分,英伟达的订单就少一分。8 月 17 日英伟达刚同意为 OpenAI 的俄亥俄数据中心园区提供最高 1050 亿美元融资,转头 OpenAI 就拿自家芯片开了发布会。供应商和客户的关系,从来没有这么拧巴过。

第二,供应链卡点从 GPU 转移到了 HBM 内存。 Jalapeño 用的是 HBM4,而三星、SK 海力士、美光把 2027 年的 HBM 产能都卖光了。SK 海力士 CEO 自己都说 2027 年是缺货最严重的一年。OpenAI 和博通 2025 年 10 月签了 10GW 的部署协议,真要放量,HBM 采购就是新的军备竞赛。

第三,对普通用户和开发者,短期没影响,中期全是利好。 OpenAI 的计划是今年年底”非常小规模”部署,2027 年显著放量。这正好接上它 8 月 22 日刚做的动作——GPT-5.6 Sol API 降价超 20%。芯片自研 → 推理成本下降 → API 降价 → 用户变多 → 再反哺芯片投入,这个飞轮一旦转起来,就是明牌。等 Jalapeño 规模化上线,模型厂商的定价空间会更大。

五、老达点评:别急着高潮,先看这三个保留

这块芯片确实牛,但我不建议你把”SemiAnalysis 说打败所有芯片”直接等同于”英伟达药丸”。三个保留意见:

保留一:对比口径有偏向。 主要对比是 Jalapeño 单 token 预测对 GB300 单 token 预测,而英伟达生产环境普遍用多 token 预测;用全口径功耗(每颗加速器 1.18kW vs GB300 的 2.55kW)算,差距会缩小;而且英伟达下一代 Vera Rubin 根本没参与对比——那才是 2026 下半年英伟达要出货的主力。

保留二:Jalapeño 不会训练模型。 训练这块,英伟达依然没有对手。OpenAI 的说法也是”训练和推理都会继续用英伟达”。所以准确的说法是:英伟达在推理侧的护城河,开始被侵蚀;训练侧的,还没动。

保留三:9 个月流片是极限操作,不是常态。 这种速度是”全栈协同设计”(模型、芯片、内存一起设计)的产物,只有 OpenAI 这种同时掌握模型和算力的公司玩得转。国内厂商想复制,得先有同等规模的模型团队和现金流。

我的判断:Jalapeño 的真正意义,不在于这一代芯片跑赢谁,而在于它证明了”AI 公司自研推理芯片”这条路走得通。在此之前,最激进的尝试是 AMD 收购 Taalas 走”把模型刻进硅片”的 模型专用芯片路线,但那是买来的技术,OpenAI 这是自己从零造的。当 AI 巨头们不再把命运押在单一供应商上,算力市场的定价权,迟早要松动。对咱们这种用 API 的普通用户,这是纯粹的利好——成本降下来,价格迟早跟着降。

相关阅读

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *