大模型
腾讯混元发布Hy ASR 3.0 preview语音识别模型:普通话WER 3.34%,融合语义理解能力
发布时间:2026年08月04日 10:00:008月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview,创新性融合Hy3大模型语义理解能力与高精度语音识别技术。开源评测数据显示,普通话词错误率3.34%、英语2.62%、粤语3.12%,同时适配十余种方言、专业术语、高噪音、耳语等复杂场景,已上线腾讯云开放API调用。
发布概况
8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。该模型打破了传统语音识别"仅能逐字转写"的局限,迈入理解语境、适配多场景的智能识别新阶段。
技术规格
识别精度
在开源评测集中,Hy ASR 3.0 preview的多语种词错误率控制在一流水平:
- 普通话:3.34%
- 英语:2.62%
- 粤语:3.12%
复杂场景适配
模型在以下复杂场景中表现优异:
- 十余种方言:覆盖中国主要方言
- 专业术语:医疗、法律、金融等领域的专业术语识别
- 高噪音环境:嘈杂环境下的语音识别
- 耳语/低音量:低音量语音的精确识别
技术架构
高效MoE架构
Hy ASR 3.0 preview采用高效MoE(混合专家)架构,搭载自研无监督语音编码器。
训练数据
- 依托数千万小时语音数据训练
- 通过联合预训练与多阶段强化学习
- 解决方言识别、语义纠错、漏识别等行业痛点
语义理解融合
该模型的核心创新在于将Hy3大模型的语义理解能力与高精度语音识别技术深度融合:
- 传统语音识别:逐字转写 -> 可能产生语境错误
- Hy ASR 3.0:理解上下文 -> 自动纠错与语义优化
应用场景
已接入场景
- 腾讯AI助手元宝:已首发接入,免费向用户开放方言识别、语境智能纠错等功能
- 腾讯云API:已上线开放API调用
- WorkBuddy:办公产品正在适配上线
商业应用场景
- 智能客服
- 语音搜索
- 内容转写
- 会议实时转写
- 游戏语音交互
行业影响
腾讯模型矩阵战略
Hy ASR 3.0 preview的发布是腾讯"模型矩阵"战略的重要落子:
- Hy3大模型已在文本生成与推理领域建立口碑
- ASR模型的补齐使混元生态覆盖"听-说-读-写"全模态能力
- 对微信生态内的语音输入、腾讯会议、游戏语音交互具有直接赋能价值
语音识别行业的演进
Hy ASR 3.0 preview标志着语音识别从"文字转换工具"向"智能交互入口"的转变,全链路技术升级让语音识别不再是简单文字转换,而是贴合用户真实意图的智能交互。
后续观察
模型在更多实际场景中的表现、与竞品的横向对比、以及腾讯混元后续在语音合成和全双工语音交互方面的布局,将是关键观察点。