产品发布

OpenAI公布GPT-Live全双工语音架构细节:语音层与推理层解耦,对话不再轮次分明

发布时间:2026年08月04日 16:00:00

8月4日,OpenAI发布GPT-Live全双工语音系统的技术架构详情。经过约六个月的底层改造,GPT-Live放弃了传统的逐轮对话模式,采用原生全双工架构,可同时听与说。系统将语音交互层与推理层解耦:前台负责低延迟自然对话,遇到复杂任务时后台无缝调用更强模型处理,完成后切回对话流。


技术发布概况

8月4日,OpenAI进一步披露GPT-Live全双工语音系统的技术架构详情。该系统的开发历时约六个月,核心是放弃传统的"轮流说话"模式,采用原生全双工架构。

核心架构创新

全双工架构

GPT-Live的核心创新在于:

  • 同时听与说:而不是交替等待
  • 随时打断:用户可在AI说话时随时打断,以"嗯"“对"等语气词自然衔接
  • 持续推理:模型在用户说话时持续推理,而非等待用户说完

语音层与推理层解耦

系统将语音交互层与推理层进行解耦:

  • 前台(语音层):负责低延迟自然对话,处理语音的实时编解码、流式传输
  • 后台(推理层):遇到复杂任务时,后台无缝调用更强模型(如GPT-5.5)处理
  • 切换机制:复杂任务完成后自动切回对话流,用户无感知

技术实现

持续推理

  • 模型在用户说话过程中持续推理,而非等待用户说完一整句
  • 支持状态保持,在连续对话中保持上下文

快速媒体流

  • 优化端到端延迟,降低语音传输延迟
  • 支持音频的实时流式处理

委托处理

GPT-Live支持在不阻塞对话的情况下进行委托处理:

  • AI可在对话中执行后台任务
  • 从连续语音中提取离散指令
  • 快速启动协议,会话建立更迅速

应用场景

支撑GPT-Live开放API

该架构将为后续GPT-Live开放API提供技术基础:

  • 开发者可基于此构建自己的语音应用
  • 支持多种语音交互场景
  • 被视为语音助手从"问答机"走向"对话者"的关键一步

实际应用场景

  • 自然对话:更接近人与人之间的真实交流
  • 多任务处理:AI可在对话中同时执行搜索、计算等任务
  • 复杂任务处理:简单对话由前台处理,复杂任务由后台更强模型处理
  • 教育辅导:学生可随时打断提问,获得即时反馈

行业影响

语音交互的范式转变

GPT-Live标志着AI语音交互从"问答机器"向"对话伙伴"的转变:

  • 语音不再只是文字输入的替代,而是独立的交互范式
  • 实时语音正变得像实时运行时(runtime)而非听写工具
  • 为智能体应用开辟了新的交互维度

竞品对比

同日消息显示,微软的MAI Realtime也以隐藏预览形式出现在MAI Playground中,支持双向全双工语音。语音AI的竞争正在从"谁更聪明"转向"谁更自然”。

后续观察

GPT-Live开放API的时间表、支持的平台和语言范围、以及更多第三方集成的推出,将是关键观察点。