大模型

腾讯混元发布Hy ASR 3.0 preview语音识别模型:普通话WER 3.34%,融合语义理解能力

发布时间:2026年08月04日 10:00:00

8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview,创新性融合Hy3大模型语义理解能力与高精度语音识别技术。开源评测数据显示,普通话词错误率3.34%、英语2.62%、粤语3.12%,同时适配十余种方言、专业术语、高噪音、耳语等复杂场景,已上线腾讯云开放API调用。


发布概况

8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。该模型打破了传统语音识别"仅能逐字转写"的局限,迈入理解语境、适配多场景的智能识别新阶段。

技术规格

识别精度

在开源评测集中,Hy ASR 3.0 preview的多语种词错误率控制在一流水平:

  • 普通话:3.34%
  • 英语:2.62%
  • 粤语:3.12%

复杂场景适配

模型在以下复杂场景中表现优异:

  • 十余种方言:覆盖中国主要方言
  • 专业术语:医疗、法律、金融等领域的专业术语识别
  • 高噪音环境:嘈杂环境下的语音识别
  • 耳语/低音量:低音量语音的精确识别

技术架构

高效MoE架构

Hy ASR 3.0 preview采用高效MoE(混合专家)架构,搭载自研无监督语音编码器。

训练数据

  • 依托数千万小时语音数据训练
  • 通过联合预训练与多阶段强化学习
  • 解决方言识别、语义纠错、漏识别等行业痛点

语义理解融合

该模型的核心创新在于将Hy3大模型的语义理解能力与高精度语音识别技术深度融合:

  • 传统语音识别:逐字转写 -> 可能产生语境错误
  • Hy ASR 3.0:理解上下文 -> 自动纠错与语义优化

应用场景

已接入场景

  • 腾讯AI助手元宝:已首发接入,免费向用户开放方言识别、语境智能纠错等功能
  • 腾讯云API:已上线开放API调用
  • WorkBuddy:办公产品正在适配上线

商业应用场景

  • 智能客服
  • 语音搜索
  • 内容转写
  • 会议实时转写
  • 游戏语音交互

行业影响

腾讯模型矩阵战略

Hy ASR 3.0 preview的发布是腾讯"模型矩阵"战略的重要落子:

  • Hy3大模型已在文本生成与推理领域建立口碑
  • ASR模型的补齐使混元生态覆盖"听-说-读-写"全模态能力
  • 对微信生态内的语音输入、腾讯会议、游戏语音交互具有直接赋能价值

语音识别行业的演进

Hy ASR 3.0 preview标志着语音识别从"文字转换工具"向"智能交互入口"的转变,全链路技术升级让语音识别不再是简单文字转换,而是贴合用户真实意图的智能交互。

后续观察

模型在更多实际场景中的表现、与竞品的横向对比、以及腾讯混元后续在语音合成和全双工语音交互方面的布局,将是关键观察点。