大模型

OpenAI发布GPT-5.6 Sol Ultrafast模式:搭载Cerebras实现750 Tokens/秒,速度提升14倍

发布时间:2026年08月13日 13:00:00

8月13日,OpenAI为GPT-5.6 Sol推出Ultrafast模式,由Cerebras驱动,生成速度达750 tokens/秒,比标准处理快14倍。目前处于限量预览阶段,面向时间敏感型企业工作流。早期客户包括Jane Street、Podium、Basis和Rogo。OpenAI表示该模式在不牺牲前沿智能的前提下为较小模型提供极速推理。


发布概况

8月13日,OpenAI为GPT-5.6 Sol推出Ultrafast模式,这是一种由Cerebras芯片驱动的新型API服务层级。目前处于限量预览阶段。

技术规格

速度表现

  • 生成速度:最高750 output tokens/秒
  • 对比:比标准处理快14倍
  • 驱动:Cerebras芯片

模型定位

  • 基于GPT-5.6 Sol(较小模型)
  • 不牺牲前沿智能
  • 在速度和智能之间取得平衡

目标场景

Ultrafast模式面向时间敏感型企业工作流:

  • 事件响应:安全事件快速分析和处理
  • 金融研究:实时市场分析和报告生成
  • 客户支持:毫秒级响应的客服Agent
  • 实时实验:快速迭代和A/B测试

早期客户

首批使用Ultrafast模式的企业包括:

客户领域
Jane Street金融交易
Podium客户沟通
Basis数据分析
Rogo金融研究

技术背景

Cerebras合作

  • Cerebras以大晶圆级芯片(Wafer-Scale Engine)闻名
  • 芯片面积远大于传统GPU,提供极高推理吞吐
  • 与OpenAI合作提供专用推理加速

为什么需要Ultrafast

  • Agent工作流需要大量推理调用
  • 传统推理速度成为Agent效率瓶颈
  • 14倍速度提升可显著缩短Agent任务完成时间

行业影响

对推理基础设施的影响

  • Cerebras作为NVIDIA替代方案获得OpenAI背书
  • 推理加速芯片市场竞争加剧
  • 专用推理芯片可能成为AI基础设施新趋势

对Agent生态的影响

  • 750 tokens/秒使实时Agent交互成为可能
  • 降低Agent工作流的延迟和成本
  • 为高频率Agent调用场景提供基础设施支持

对竞争格局的影响

  • OpenAI在速度维度上建立新优势
  • 与Google Gemini 3.7 Flash的低价策略形成差异化
  • 与DeepSeek V4-Pro的低价策略形成差异化

后续观察

Ultrafast模式的正式上线时间、定价方案、以及Cerebras合作是否扩展到更多模型,将是关键观察点。