AI资讯

英伟达Groq 3 LPX推理加速器全面量产:每秒3400 Token创历史纪录,较替代方案快4倍

发布时间:2026年08月25日 08:00:00

8月24日Hot Chips 2026大会上英伟达宣布Groq 3 LPX交互式AI推理加速器进入全面量产。该芯片是Vera Rubin平台扩展,专为超快Token生成设计。Artificial Analysis基准测试显示运行Gemma 4 31B模型在10万Token上下文下达到每秒3400个输出Token的历史最高纪录,是最近替代方案的4倍。Nebius为首个采用的AI云服务商。黄仁勋称这将改变智能体AI的产出方式。


英伟达Groq 3 LPX推理加速器全面量产:每秒3400 Token创历史纪录,较替代方案快4倍

8 月 25 日消息,在 8 月 24 日召开的 Hot Chips 2026 大会上,英伟达正式宣布 Groq 3 LPX 交互式 AI 推理加速器进入全面量产阶段。这款被定位为 Vera Rubin 平台扩展的专用芯片,将超快 Token 生成能力推向新高度——独立评测机构 Artificial Analysis 的基准测试显示,Groq 3 LPX 运行 Gemma 4 31B 模型、在 10 万 Token 上下文长度下,达到了每秒 3400 个输出 Token 的历史最高纪录,是距离最近的替代方案的 4 倍速度。AI 云服务商 Nebius 成为首个采用方,将 Groq 3 LPX 部署于其 Token Factory 推理平台。英伟达创始人兼 CEO 黄仁勋在主题演讲中表示,这一突破将彻底改变智能体 AI 的产出方式。

一、Hot Chips 2026 上的重磅发布:Groq 3 LPX 全面量产

Hot Chips 是全球处理器架构领域最具权威性的学术与工业盛会,每年 8 月在斯坦福校园举办。在 2026 年的这场大会上,英伟达选择将 Groq 3 LPX 作为重点议题之一进行详细介绍,足见其在英伟达产品矩阵中的战略地位。

英伟达方面宣布,Groq 3 LPX 交互式 AI 推理加速器已正式进入全面量产阶段。这款芯片并非独立存在,而是英伟达 Vera Rubin 平台的扩展组件,专为低延迟 Token 生成场景量身定制。与传统 GPU 兼顾训练与推理不同,LPX 走的是极致专用化路线,将片上 SRAM、纵向带宽、液冷架构等资源全部聚焦于解码阶段的 Token 输出效率,因此在长上下文、交互式、流式生成等场景中表现出远超通用加速器的性价比。

黄仁勋在演讲中强调,AI 行业正从’一次性生成’走向’持续交互’,智能体需要长时间、多轮次、低延迟地与用户对话和调用工具,而这正是 LPX 所要解决的工程瓶颈。他认为,Groq 3 LPX 的量产将让’智能体 AI 的产出方式被根本性改变’,使实时智能体规模化落地成为可能。

二、Artificial Analysis 基准:每秒 3400 Token 创历史纪录

独立 AI 评测机构 Artificial Analysis 在大会同期发布了针对 Groq 3 LPX 的基准测试结果,数据如下:

测试维度结果
运行模型Gemma 4 31B
上下文长度10 万 Token
输出 Token 速度3400 个/秒
历史对比当前已知最高纪录
与最近替代方案对比快 4 倍
SPEED-Bench 编码基准中位数4767 输出 Token/秒

这一成绩刷新了业界对推理吞吐的认知。作为参照,传统 GPU 在同等模型规模和上下文长度下,输出 Token 速度通常在数百到 1000 出头每秒区间,而 Groq 3 LPX 直接将这一数字提升到 3400,且是在 10 万 Token 这种长上下文条件下取得,含金量极高。

在面向编码场景的 SPEED-Bench 中,Groq 3 LPX 的中位数输出速度达到 4767 Token/秒,这意味着智能体在自动生成代码、补全长函数、重构工程等任务上,可以在秒级时间内产出大量代码,显著缩短人机协作的等待时间。目前英伟达内部披露,AI 编程数据中心已有约四分之一的算力配置采用 Groq 芯片,足见该产品在编程赛道已被大规模采纳。

三、机架架构与硬件规格:256 颗 LPU + 128GB 片上 SRAM

Groq 3 LPX 的性能表现源于其独特的硬件架构。每个 LPX 机架集成 256 颗 LPU 加速器,配备 128GB 片上 SRAM,并提供 640TB/s 的纵向带宽。整套系统采用全液冷 MGX 机架架构,将热量管理做到极致,为高密度 Token 生成提供稳定运行环境。

值得注意的是,Groq 芯片由三星代工,而非英伟达长期合作伙伴台积电。这一选择与 Groq Inc 的历史供应链一脉相承,也反映出英伟达在收购完成后保留了 Groq 的工艺路线,以避免重新流片带来的时间成本。

在软件生态层面,Groq 3 LPX 支持与 Vera Rubin NVL72 的多种协同配置:

  • 预填充-解码分离:由 NVL72 负责长上下文的预填充阶段,LPX 专注解码输出,两者分工降低首 Token 延迟;
  • 注意力-FFN 分离:将注意力计算与 FFN 计算分配到不同硬件,提高整体利用率;
  • 推测外部草稿解码:LPX 作为高速草稿生成器,配合 NVL72 进行验证,实现推测解码加速。

通过这些组合,Groq 3 LPX 不仅能效提升明显,还可扩展至万亿参数级别模型的推理场景,为未来更大规模基础模型预留了充足的硬件余量。

四、收购回顾:200 亿美元史上最大收购与团队整合

Groq 3 LPX 的问世,离不开英伟达在 2025 年 12 月完成的一笔关键收购。彼时英伟达以约 200 亿美元的价格收购了 Groq 相关资产,这是英伟达历史上规模最大的一笔收购。收购完成后,Groq Inc 的创始人 Jonathan Ross 与总裁 Sunny Madra 均加入英伟达,主导 LPX 产品线的继续演进。

这笔收购的战略意义在于:英伟达此前在训练侧几乎垄断市场,但在低延迟推理这一细分赛道,专用 LPU 架构相比通用 GPU 具有天然优势。通过收购 Groq,英伟达一方面获得了成熟的 LPU 设计与软件栈,另一方面避免了在推理市场被垂直整合对手侵蚀。黄仁勋当时表示,Groq 团队在’流式推理’上的积累,是英伟达补全 AI 全栈能力的关键拼图。

五、Nebius 首发采用,部署于 Token Factory 推理平台

作为 Groq 3 LPX 的首个 AI 云采用方,Nebius 将其部署于自研的 Nebius Token Factory 推理平台。Nebius 近年来在 AI 云赛道扩张迅猛,其 Token Factory 平台主打’按 Token 计费’的弹性推理服务,与 LPX 的低延迟特性高度契合。借助 Groq 3 LPX,Nebius 可向企业客户提供更快的智能体响应速度,在竞争激烈的 AI 云市场中形成差异化优势。

英伟达方面预计,自 Blackwell 到 Vera Rubin 这一产品周期内,截至 2027 年,相关产品累计销售额有望达到 1 万亿美元。这一预期反映出英伟达对训练+推理双引擎增长的强烈信心,而 Groq 3 LPX 正是推理侧的核心增长引擎之一。

六、竞争格局:AMD 与 Cerebras 同样瞄准低延迟推理

低延迟推理赛道并非英伟达独舞。AMD 正在推进基于 Instinct 系列的推理专用配置,Cerebras 则凭借晶圆级大芯片在 Token 速度上持续刷新纪录。三家厂商共同争夺’每秒输出 Token’这一关键指标,背后是智能体时代对实时交互能力的刚需。

不过,英伟达凭借 CUDA 生态、MGX 机架标准化、以及训练-推理一体化部署能力,仍占据生态优势。Groq 3 LPX 的量产进一步巩固了这一护城河,使英伟达在’训练霸主’之外,又拿下了’低延迟推理’这一关键标签。对于正在构建智能体应用的开发者与企业而言,3400 Token/秒的速度意味着更自然的对话体验、更短的等待时间,以及更具经济性的 Token 单价——智能体时代的基础设施,正在被重新定义。