8月19日,Cerebras推出新一代晶圆级引擎WSE-3T及CS-4机架系统,芯片频率从1.4GHz翻倍至2.8GHz,稀疏FP16算力达250 PFLOPS,内存带宽43.2 PB/s。CS-4移除交换机让芯片直连,延迟从5微秒降至2微秒,gpt-oss-120b推理速度达每秒4400 token,为大模型推理硬件树立新标杆。
事件概况
8月19日,Cerebras推出新一代晶圆级引擎WSE-3T及CS-4机架系统。芯片频率从1.4GHz翻倍至2.8GHz,稀疏FP16算力达250 PFLOPS,内存带宽43.2 PB/s。CS-4移除交换机让芯片直连,延迟从5微秒降至2微秒,gpt-oss-120b推理速度可达每秒4400 token,为大模型推理硬件树立新标杆。
WSE-3T晶圆级引擎
规格参数
| 维度 | WSE-3T | 前代 |
|---|
| 芯片频率 | 2.8GHz | 1.4GHz |
| 频率提升 | 翻倍 | - |
| 稀疏FP16算力 | 250 PFLOPS | - |
| 内存带宽 | 43.2 PB/s | - |
| 架构 | 晶圆级 | 晶圆级 |
核心创新
| 创新 | 说明 |
|---|
| 频率翻倍 | 从1.4GHz到2.8GHz |
| 算力提升 | 250 PFLOPS |
| 带宽提升 | 43.2 PB/s |
| 晶圆级设计 | 整片晶圆作为一颗芯片 |
CS-4机架系统
规格参数
| 维度 | CS-4 | 前代CS-3 |
|---|
| WSE数量 | 3颗WSE-3T | - |
| 交换机 | 移除(芯片直连) | 有交换机 |
| 延迟 | 2微秒 | 5微秒 |
| 吞吐量 | CS-3的10倍 | - |
| 推理速度 | 4400 tokens/秒 | - |
vs GPU服务器
| 维度 | CS-4 | GPU服务器 |
|---|
| 单用户推理速度 | 30倍于GPU | 基准 |
| 吞吐量 | 10倍于CS-3 | - |
| 延迟 | 2微秒 | 更高 |
| 部署时间 | 数小时 | 数天 |
性能基准
| 模型 | 推理速度 |
|---|
| gpt-oss-120b | 4400 tokens/秒 |
| 对比GPU | 30倍提升 |
技术意义
晶圆级计算的优势
| 优势 | 说明 |
|---|
| 大芯片 | 整片晶圆作为一颗芯片 |
| 高带宽 | 片上内存带宽极高 |
| 低延迟 | 芯片直连无需交换机 |
| 高算力 | 250 PFLOPS |
CS-4架构创新
| 创新 | 效果 |
|---|
| 移除交换机 | 芯片直连 |
| 延迟降低 | 5微秒→2微秒 |
| 吞吐量提升 | CS-3的10倍 |
| 部署简化 | 数天→数小时 |
与OpenAI的合作
GPT-5.6 Sol Ultrafast
此前OpenAI发布了基于Cerebras硬件的GPT-5.6 Sol Ultrafast模式:
| 维度 | 数据 |
|---|
| 推理速度 | 750 tokens/秒 |
| 硬件 | Cerebras |
| 对比标准 | 数十倍提升 |
OpenAI持股Cerebras
行业影响
对推理市场的影响
| 维度 | 影响 |
|---|
| 推理速度 | 4400 tokens/秒创新高 |
| GPU竞争 | 直接挑战NVIDIA推理市场 |
| 成本效率 | 更高吞吐量降低单位成本 |
| 大模型推理 | 万亿参数模型交互式推理 |
对NVIDIA的影响
| 维度 | 影响 |
|---|
| 推理市场 | 面临Cerebras竞争 |
| 训练市场 | NVIDIA仍有优势 |
| 市场定位 | 从通用GPU转向专用AI芯片 |
| 价格压力 | 推理成本可能下降 |
对AI应用的影响
| 应用场景 | 影响 |
|---|
| 实时对话 | 更低延迟的AI对话 |
| 长文本生成 | 更快的生成速度 |
| Agent执行 | 多步骤任务更快完成 |
| 代码生成 | 实时代码补全 |
竞争格局
| 公司 | 产品 | 推理速度 |
|---|
| Cerebras | CS-4 | 4400 tokens/秒 |
| NVIDIA | GPU服务器 | 基准 |
| Groq | LPU | 高速推理 |
| SambaNova | SN40L | 高速推理 |
后续观察
CS-4的出货情况、客户采用率、以及与NVIDIA和Groq的推理性能对比,将是关键观察点。