AI商业

Cerebras发布CS-4推理系统:WSE-3T推理速度比GPU快30倍,4400 tokens/秒

发布时间:2026年08月19日 16:00:00

8月19日,Cerebras推出新一代晶圆级引擎WSE-3T及CS-4机架系统,芯片频率从1.4GHz翻倍至2.8GHz,稀疏FP16算力达250 PFLOPS,内存带宽43.2 PB/s。CS-4移除交换机让芯片直连,延迟从5微秒降至2微秒,gpt-oss-120b推理速度达每秒4400 token,为大模型推理硬件树立新标杆。


事件概况

8月19日,Cerebras推出新一代晶圆级引擎WSE-3T及CS-4机架系统。芯片频率从1.4GHz翻倍至2.8GHz,稀疏FP16算力达250 PFLOPS,内存带宽43.2 PB/s。CS-4移除交换机让芯片直连,延迟从5微秒降至2微秒,gpt-oss-120b推理速度可达每秒4400 token,为大模型推理硬件树立新标杆。

WSE-3T晶圆级引擎

规格参数

维度WSE-3T前代
芯片频率2.8GHz1.4GHz
频率提升翻倍-
稀疏FP16算力250 PFLOPS-
内存带宽43.2 PB/s-
架构晶圆级晶圆级

核心创新

创新说明
频率翻倍从1.4GHz到2.8GHz
算力提升250 PFLOPS
带宽提升43.2 PB/s
晶圆级设计整片晶圆作为一颗芯片

CS-4机架系统

规格参数

维度CS-4前代CS-3
WSE数量3颗WSE-3T-
交换机移除(芯片直连)有交换机
延迟2微秒5微秒
吞吐量CS-3的10倍-
推理速度4400 tokens/秒-

vs GPU服务器

维度CS-4GPU服务器
单用户推理速度30倍于GPU基准
吞吐量10倍于CS-3-
延迟2微秒更高
部署时间数小时数天

性能基准

模型推理速度
gpt-oss-120b4400 tokens/秒
对比GPU30倍提升

技术意义

晶圆级计算的优势

优势说明
大芯片整片晶圆作为一颗芯片
高带宽片上内存带宽极高
低延迟芯片直连无需交换机
高算力250 PFLOPS

CS-4架构创新

创新效果
移除交换机芯片直连
延迟降低5微秒→2微秒
吞吐量提升CS-3的10倍
部署简化数天→数小时

与OpenAI的合作

GPT-5.6 Sol Ultrafast

此前OpenAI发布了基于Cerebras硬件的GPT-5.6 Sol Ultrafast模式:

维度数据
推理速度750 tokens/秒
硬件Cerebras
对比标准数十倍提升

OpenAI持股Cerebras

维度数据
持股比例4.22%
持股方式行使认股权证

行业影响

对推理市场的影响

维度影响
推理速度4400 tokens/秒创新高
GPU竞争直接挑战NVIDIA推理市场
成本效率更高吞吐量降低单位成本
大模型推理万亿参数模型交互式推理

对NVIDIA的影响

维度影响
推理市场面临Cerebras竞争
训练市场NVIDIA仍有优势
市场定位从通用GPU转向专用AI芯片
价格压力推理成本可能下降

对AI应用的影响

应用场景影响
实时对话更低延迟的AI对话
长文本生成更快的生成速度
Agent执行多步骤任务更快完成
代码生成实时代码补全

竞争格局

公司产品推理速度
CerebrasCS-44400 tokens/秒
NVIDIAGPU服务器基准
GroqLPU高速推理
SambaNovaSN40L高速推理

后续观察

CS-4的出货情况、客户采用率、以及与NVIDIA和Groq的推理性能对比,将是关键观察点。