产品发布

OpenAI发布GPT-Live连续语音交互:无轮次双向语音模型,对话更自然流畅

发布时间:2026年08月03日 15:00:00

8月3日,OpenAI发布GPT-Live连续语音交互技术,采用无轮次语音模型和低延迟架构,实现与AI的连续语音交互。不同于传统的逐轮对话模式,GPT-Live支持双向同时语音流,用户可随时打断、追问,AI也能同时进行多任务处理,使AI语音对话更接近真实人际交流。


产品概况

8月3日,OpenAI发布GPT-Live连续语音交互技术。该技术采用无轮次(turnless)语音模型和低延迟架构,使用户与AI的语音交互不再局限于逐轮对话,而是实现连续、自然的双向交流。

技术特点

无轮次语音模型

GPT-Live的核心创新在于突破了传统语音助手的"轮次"限制:

  • 双向同时语音:AI可以听和说同时进行,而不是交替等待
  • 随时打断:用户可以在AI说话时随时打断和追问
  • 自然对话节奏:对话更接近真实人际交流的节奏和流

低延迟架构

  • 持续推理:模型在用户说话时持续推理,而非等待用户说完
  • 快速媒体流:优化的媒体传输管道,将端到端延迟降至最低
  • 状态保持:在连续对话中保持对话状态和上下文

委托处理

GPT-Live支持在不阻塞对话的情况下进行委托处理:

  • AI可在对话中执行后台任务
  • 从连续语音中提取离散指令
  • 快速启动协议,会话建立更迅速

工程实现

六个月的开发周期

OpenAI工程师Justin Uberti和Zahan Malkani介绍,团队在六个月内完成了从概念到生产系统的开发:

  • 从轮次模式转向流式架构
  • 实现持续推理管线
  • 在生产环境中用真实数据安全测试

应用场景

GPT-Live的连续语音交互能力为多个场景带来新可能:

  • 实时翻译:自然流畅的双向语音翻译
  • 语音助手:更自然的智能助手交互体验
  • 教育辅导:学生可随时打断提问,获得即时反馈
  • 会议助手:在会议中实时参与讨论
  • 多任务协助:用户说话的同时AI可执行搜索、计算等操作

行业影响

语音交互的范式转变

GPT-Live标志着AI语音交互从"问答机器"向"对话伙伴"的转变:

  • 语音不再只是文字输入的替代,而是独立的交互范式
  • 实时语音正变得像实时运行时(runtime)而非听写工具
  • 为智能体应用开辟了新的交互维度

对竞品的影响

  • Microsoft MAI Realtime也以隐藏预览形式出现在MAI Playground中,支持双向全双工语音
  • 字节跳动SeedRealtime同样支持实时音视频交互
  • 语音AI竞争正在从"谁更聪明"转向"谁更自然"

后续观察

GPT-Live的正式上线时间、支持的平台和语言范围、以及更多第三方集成的推出,将是关键观察点。