大模型
OpenAI发布GPT-5.6 Sol Ultrafast模式:搭载Cerebras实现750 Tokens/秒,速度提升14倍
发布时间:2026年08月13日 13:00:008月13日,OpenAI为GPT-5.6 Sol推出Ultrafast模式,由Cerebras驱动,生成速度达750 tokens/秒,比标准处理快14倍。目前处于限量预览阶段,面向时间敏感型企业工作流。早期客户包括Jane Street、Podium、Basis和Rogo。OpenAI表示该模式在不牺牲前沿智能的前提下为较小模型提供极速推理。
发布概况
8月13日,OpenAI为GPT-5.6 Sol推出Ultrafast模式,这是一种由Cerebras芯片驱动的新型API服务层级。目前处于限量预览阶段。
技术规格
速度表现
- 生成速度:最高750 output tokens/秒
- 对比:比标准处理快14倍
- 驱动:Cerebras芯片
模型定位
- 基于GPT-5.6 Sol(较小模型)
- 不牺牲前沿智能
- 在速度和智能之间取得平衡
目标场景
Ultrafast模式面向时间敏感型企业工作流:
- 事件响应:安全事件快速分析和处理
- 金融研究:实时市场分析和报告生成
- 客户支持:毫秒级响应的客服Agent
- 实时实验:快速迭代和A/B测试
早期客户
首批使用Ultrafast模式的企业包括:
| 客户 | 领域 |
|---|---|
| Jane Street | 金融交易 |
| Podium | 客户沟通 |
| Basis | 数据分析 |
| Rogo | 金融研究 |
技术背景
Cerebras合作
- Cerebras以大晶圆级芯片(Wafer-Scale Engine)闻名
- 芯片面积远大于传统GPU,提供极高推理吞吐
- 与OpenAI合作提供专用推理加速
为什么需要Ultrafast
- Agent工作流需要大量推理调用
- 传统推理速度成为Agent效率瓶颈
- 14倍速度提升可显著缩短Agent任务完成时间
行业影响
对推理基础设施的影响
- Cerebras作为NVIDIA替代方案获得OpenAI背书
- 推理加速芯片市场竞争加剧
- 专用推理芯片可能成为AI基础设施新趋势
对Agent生态的影响
- 750 tokens/秒使实时Agent交互成为可能
- 降低Agent工作流的延迟和成本
- 为高频率Agent调用场景提供基础设施支持
对竞争格局的影响
- OpenAI在速度维度上建立新优势
- 与Google Gemini 3.7 Flash的低价策略形成差异化
- 与DeepSeek V4-Pro的低价策略形成差异化
后续观察
Ultrafast模式的正式上线时间、定价方案、以及Cerebras合作是否扩展到更多模型,将是关键观察点。