AI产品
OpenAI发布GPT-Live-Transcribe和GPT-Transcribe,转录错误率大幅下降
发布时间:2026年07月29日 10:00:00OpenAI推出两种新一代转录模型:GPT-Live-Transcribe(低延迟实时)和GPT-Transcribe(批量异步),在22种语言上转录错误率仅19.27%,较Whisper的40.37%大幅改善。
产品发布
2026年7月29日,OpenAI在X平台发布公告,正式推出两种新一代转录模型,并支持通过API方式调用:
- GPT-Live-Transcribe:专为低延迟实时转录而构建
- GPT-Transcribe:优化已完成音频文件和批量工作负载的异步转录
核心能力
相比此前的Whisper模型,新模型在以下方面实现突破:
更好的上下文理解
在Context Aware ASR基准测试上:
- GPT-Transcribe语义准确率从无自由形式上下文的41.6%提高到有上下文的45.2%
- 能够更好地理解上下文,提供更准确的转录结果
多语言支持
在Common Voice的22种语言上:
- GPT-Transcribe的转录错误率为19.27%
- Whisper (whisper-1)为40.37%
真实世界音频表现
在真实世界音频录制基准的九种语言上:
- GPT-Transcribe实现了**8.98%**的转录错误率
- Whisper (whisper-1)为15.21%
技术优势
新模型的设计理念围绕实际使用场景优化:
- 低延迟实时处理:GPT-Live-Transcribe针对实时流式音频优化,延迟显著降低
- 批量异步处理:GPT-Transcribe针对长音频文件和批量任务优化
- 强抗噪能力:支持带有响亮背景噪音的语音转录
- 专业术语识别:准确处理短语、数字和专业术语
应用场景
两种模型可广泛应用于:
- 实时会议记录和字幕
- 客服通话分析
- 媒体内容转录
- 医疗记录整理
- 教育课程转录
- 多语言内容本地化
产业影响
成本效益
OpenAI官方表示,相比此前模型,两种转录模型可以更好地理解上下文,并能在各种口音和语言的真实世界音频上提供更准确的转录。
API生态
通过API开放调用,开发者和企业可以快速集成先进的转录能力,加速语音转写、智能客服、内容分析等应用场景的落地。
竞争格局
此次发布延续了OpenAI在语音AI领域的领先地位,同时也为开发者提供了更高效的工具选择。