产品发布
OpenAI发布GPT-Live连续语音交互:无轮次双向语音模型,对话更自然流畅
发布时间:2026年08月03日 15:00:008月3日,OpenAI发布GPT-Live连续语音交互技术,采用无轮次语音模型和低延迟架构,实现与AI的连续语音交互。不同于传统的逐轮对话模式,GPT-Live支持双向同时语音流,用户可随时打断、追问,AI也能同时进行多任务处理,使AI语音对话更接近真实人际交流。
产品概况
8月3日,OpenAI发布GPT-Live连续语音交互技术。该技术采用无轮次(turnless)语音模型和低延迟架构,使用户与AI的语音交互不再局限于逐轮对话,而是实现连续、自然的双向交流。
技术特点
无轮次语音模型
GPT-Live的核心创新在于突破了传统语音助手的"轮次"限制:
- 双向同时语音:AI可以听和说同时进行,而不是交替等待
- 随时打断:用户可以在AI说话时随时打断和追问
- 自然对话节奏:对话更接近真实人际交流的节奏和流
低延迟架构
- 持续推理:模型在用户说话时持续推理,而非等待用户说完
- 快速媒体流:优化的媒体传输管道,将端到端延迟降至最低
- 状态保持:在连续对话中保持对话状态和上下文
委托处理
GPT-Live支持在不阻塞对话的情况下进行委托处理:
- AI可在对话中执行后台任务
- 从连续语音中提取离散指令
- 快速启动协议,会话建立更迅速
工程实现
六个月的开发周期
OpenAI工程师Justin Uberti和Zahan Malkani介绍,团队在六个月内完成了从概念到生产系统的开发:
- 从轮次模式转向流式架构
- 实现持续推理管线
- 在生产环境中用真实数据安全测试
应用场景
GPT-Live的连续语音交互能力为多个场景带来新可能:
- 实时翻译:自然流畅的双向语音翻译
- 语音助手:更自然的智能助手交互体验
- 教育辅导:学生可随时打断提问,获得即时反馈
- 会议助手:在会议中实时参与讨论
- 多任务协助:用户说话的同时AI可执行搜索、计算等操作
行业影响
语音交互的范式转变
GPT-Live标志着AI语音交互从"问答机器"向"对话伙伴"的转变:
- 语音不再只是文字输入的替代,而是独立的交互范式
- 实时语音正变得像实时运行时(runtime)而非听写工具
- 为智能体应用开辟了新的交互维度
对竞品的影响
- Microsoft MAI Realtime也以隐藏预览形式出现在MAI Playground中,支持双向全双工语音
- 字节跳动SeedRealtime同样支持实时音视频交互
- 语音AI竞争正在从"谁更聪明"转向"谁更自然"
后续观察
GPT-Live的正式上线时间、支持的平台和语言范围、以及更多第三方集成的推出,将是关键观察点。