AI产品

OpenAI发布GPT-Live-Transcribe和GPT-Transcribe,转录错误率大幅下降

发布时间:2026年07月29日 10:00:00

OpenAI推出两种新一代转录模型:GPT-Live-Transcribe(低延迟实时)和GPT-Transcribe(批量异步),在22种语言上转录错误率仅19.27%,较Whisper的40.37%大幅改善。


产品发布

2026年7月29日,OpenAI在X平台发布公告,正式推出两种新一代转录模型,并支持通过API方式调用:

  • GPT-Live-Transcribe:专为低延迟实时转录而构建
  • GPT-Transcribe:优化已完成音频文件和批量工作负载的异步转录

核心能力

相比此前的Whisper模型,新模型在以下方面实现突破:

更好的上下文理解

在Context Aware ASR基准测试上:

  • GPT-Transcribe语义准确率从无自由形式上下文的41.6%提高到有上下文的45.2%
  • 能够更好地理解上下文,提供更准确的转录结果

多语言支持

在Common Voice的22种语言上:

  • GPT-Transcribe的转录错误率为19.27%
  • Whisper (whisper-1)为40.37%

真实世界音频表现

在真实世界音频录制基准的九种语言上:

  • GPT-Transcribe实现了**8.98%**的转录错误率
  • Whisper (whisper-1)为15.21%

技术优势

新模型的设计理念围绕实际使用场景优化:

  • 低延迟实时处理:GPT-Live-Transcribe针对实时流式音频优化,延迟显著降低
  • 批量异步处理:GPT-Transcribe针对长音频文件和批量任务优化
  • 强抗噪能力:支持带有响亮背景噪音的语音转录
  • 专业术语识别:准确处理短语、数字和专业术语

应用场景

两种模型可广泛应用于:

  • 实时会议记录和字幕
  • 客服通话分析
  • 媒体内容转录
  • 医疗记录整理
  • 教育课程转录
  • 多语言内容本地化

产业影响

成本效益

OpenAI官方表示,相比此前模型,两种转录模型可以更好地理解上下文,并能在各种口音和语言的真实世界音频上提供更准确的转录。

API生态

通过API开放调用,开发者和企业可以快速集成先进的转录能力,加速语音转写、智能客服、内容分析等应用场景的落地。

竞争格局

此次发布延续了OpenAI在语音AI领域的领先地位,同时也为开发者提供了更高效的工具选择。