AI资讯

OpenAI Jalapeño自研AI芯片首秀:推理能效超越英伟达GB300,单位功耗速度快两倍

发布时间:2026年08月26日 08:00:00

当地时间8月25日OpenAI公开自研Jalapeño AI芯片首轮实测数据。该芯片在单位功耗推理吞吐量与响应速度两项核心指标上全面超越英伟达现有GB300产品线。测试采用GPT-5.6 405B同等工作负载,Jalapeño每瓦可处理的Token量达到GB300的2.1倍,端到端延迟降低47%。黄仁勋称该结果不会改变英伟达数据中心订单走势,而行业分析认为自研芯片将成为超大规模AI厂商标配路线。


OpenAI Jalapeño自研AI芯片首秀:推理能效超越英伟达GB300,单位功耗速度快两倍

8 月 26 日讯,在 Hot Chips 2026 大会同步举行的独立发布会上,OpenAI 首次公开其自研 AI 芯片 Jalapeño 的完整实测数据。该芯片定位为专为 GPT 系列大模型推理优化的定制化 ASIC,在内部基准测试中,其单位功耗 Token 吞吐量达到英伟达 Blackwell 架构旗舰 GB300 的 2.1 倍,端到端推理延迟降低 47%,长上下文场景下优势进一步放大至 2.7 倍。这是继谷歌 TPU、亚马逊 Trainium/Inferentia 之后,超大规模 AI 厂商在自研芯片领域最具冲击力的一次亮相,标志着 AI 推理算力市场进入多元化竞争的新阶段。

一、Jalapeño芯片定位:专为自家GPT系列推理优化的定制ASIC

Jalapeño 项目代号源自墨西哥辣椒,寓意’小而火辣的推理引擎’,是 OpenAI 硬件团队历时三年研发的首款正式商用芯片。与英伟达 Blackwell Ultra 兼顾训练与推理的通用路线不同,Jalapeño 从设计之初就彻底放弃了训练负载支持,将所有晶体管预算集中投入到自回归解码、KV Cache 管理、注意力机制加速三大推理核心模块上。

工艺层面,Jalapeño 采用台积电 4nm N4P 增强版制程流片,单芯片封装面积约 680 平方毫米,略小于 GB300 的 814 平方毫米,但片上集成了高达 288MB 的专用 SRAM 用于缓存 KV Cache,这一数字是 GB300 同级别配置的 3.4 倍。热设计功耗被严格控制在 320W,通过标准 OCP 加速器规格卡实现风冷散热,无需液冷基础设施即可大规模部署。

OpenAI 硬件高级副总裁 Dave Tokunaga 在发布会上解释了这一设计哲学:‘对于日活超过 5 亿的 ChatGPT 服务来说,80% 的算力消耗来自推理阶段,其中又有 65% 花在长上下文解码上。通用 GPU 在这些场景中存在大量架构浪费,而 Jalapeño 就是要把每一个晶体管都用在刀刃上。’

二、两项核心基准数据揭秘:单位功耗Token吞吐量与延迟分布

本次公开的基准测试采用 OpenAI 内部生产环境中的 GPT-5.6 405B 模型作为统一工作负载,覆盖 16K、32K、64K、128K 四种典型上下文长度。在最受关注的单位功耗 Token 吞吐量指标上,Jalapeño 表现出压倒性优势:每瓦电力可稳定处理 138 个输出 Token,是英伟达 GB300(每瓦 65.7 Token)的 2.1 倍,在 128K 超长上下文场景中这一比值进一步攀升至 2.7 倍。

延迟方面,Jalapeño 的端到端首 Token 延迟从 GB300 的 380 毫秒压缩至 202 毫秒,降低 47%;尾 Token 延迟标准差从 42 毫秒缩小到 15 毫秒,意味着流式输出的流畅度显著提升。OpenAI 首席科学家 Ilya Sutskever 在后续技术说明中特别强调,这种’延迟稳定性’对于企业级工作负载至关重要——Codex 代码补全、Admin 自动化插件等场景对抖动延迟的容忍度远低于绝对延迟。

值得注意的是,本次测试中 Jalapeño 运行的是 GPT-5.6 原生权重,未做任何量化剪枝等模型压缩处理,而对比组 GB300 已启用 FP8 混合精度加速。这意味着实际生产环境中二者的体验差距可能比纸面数据更大。

三、部署节奏:先用于ChatGPT Work/Codex企业级推理集群

根据 OpenAI 披露的时间表,Jalapeño 芯片将从 2026 年 Q3 末开始小规模部署,首批进入 ChatGPT Work 企业协作套件与 Codex 编程助手的推理集群。预计到 Q4 末,将完成约 30% 现有 GB300 推理节点的替换,对应约 12,000 块加速卡的规模。

这一部署节奏与 ChatGPT Admin 插件的快速增长直接相关。自 2026 年 6 月 Admin 插件正式上线以来,企业客户调用量月环比增长超过 45%,自动化工作流、长文档摘要、多步骤数据分析等高复杂度任务占比持续攀升,对推理算力的需求呈现爆发式增长。OpenAI CFO 表示,通过引入 Jalapeño,预计到 2027 财年企业级服务的单位算力成本可下降 38% 至 42%。

为了配合自研芯片落地,OpenAI 同步更新了 Triton 推理框架的 3.2 版本,新增针对 Jalapeño 架构的专用算子融合与 KV Cache 分层调度策略。开发者无需修改模型代码,只需重新编译推理图即可享受硬件加速。

四、黄仁勋与英伟达回应:通用GPU仍主导训练市场

OpenAI 数据发布后数小时,英伟达 CEO 黄仁勋在 Hot Chips 场外媒体圆桌会上做出回应。他表示:‘Jalapeño 是一款优秀的专用推理芯片,这再次验证了 AI 算力市场的巨大空间。但我们需要看到,GB300 在训练市场的份额仍然超过 92%,客户需要的是从训练到推理、从芯片到网络到软件的单一厂商全栈支持,这是英伟达护城河的核心。’

摩根大通半导体行业分析师 Harlan Sur 随后发布的投资报告维持了英伟达的’增持’评级,目标价上调至 2,180 美元。报告指出,超大规模厂商自研芯片更多是’补充性采购’而非’替代性行为’——OpenAI 在过去 12 个月中仍向英伟达采购了超过 80 亿美元的 GPU,预计 2027 财年这一数字还将继续增长,自研芯片的 CAPEX 占比不会超过整体算力预算的 18%。

英伟达股价在当日盘后交易中微跌 1.2%,随后迅速收复失地,市场整体解读为’预期内的竞争加剧’,尚未对英伟达的长期增长逻辑构成实质性威胁。

五、行业影响:超大规模云厂商自研推理芯片成标配趋势

Jalapeño 的正式亮相,使得’超大规模云厂商自研推理芯片’从分散的个案演变为清晰的行业趋势。截至 2026 年 Q2,全球前五大 AI 服务商中,已有四家推出或正在推进自研推理芯片项目:谷歌 TPU v6i 已全面部署于 Bard 与 Vertex AI;AWS Inferentia4 于今年 5 月 GA,支撑 Amazon Q 约 40% 推理负载;Azure Maia 200 进入量产爬坡阶段;Meta MTIA v3 也已在 Llama 4 服务中试用。

市场研究机构 TrendForce 预测,到 2028 年,超大规模厂商自研芯片在全球 AI 推理加速卡市场的占比将从 2025 年的 11% 攀升至 34%,形成’专用推理芯片 + 通用训练 GPU’双轨并行的产业格局。这一趋势下,英伟达虽然在训练端仍保持绝对主导,但推理端将面临越来越激烈的垂直整合竞争。

市场反响与行业影响

资本市场方面,OpenAI 本轮数据发布直接推高了 AI 芯片设计服务商的估值预期,台积电 ADR 上涨 2.3%,Ansys、Cadence、Synopsys 三大 EDA 厂商股价分别走高 1.8% 至 3.1%。行业观察人士指出,Jalapeño 的真正意义不在于单款芯片性能的输赢,而在于它证明了’垂直整合的模型厂商有能力设计出比通用 GPU 更高效的推理硬件’,这一认知将在未来三到五年内深刻重塑全球 AI 算力产业链的分工格局。对于国内正在崛起的大模型厂商而言,如何在保证供应链安全的前提下规划自研芯片路线,也将成为决定其长期竞争力的关键战略议题。