Hy ASR 3.0 Preview – 腾讯混元发布的新一代语音识别模型

Hy ASR 3.0 Preview是腾讯混元发布的新一代语音识别(ASR)模型。它基于腾讯最新一代大语言模型 Hy3的语言理解能力,将高精度语音识别与深度语义理解深度融合,标志着语音识别从传统的”逐字转写、单点优化”向”理解语境、兼容场景、一键直出“的范式跨越。

该模型已上线腾讯云官网对外提供API服务,腾讯元宝已完成首发接入(用户长按说话即可体验),WorkBuddy等产品也在陆续接入中。

Hy ASR 3.0 Preview - 腾讯混元发布的新一代语音识别模型

Hy ASR 3.0 Preview核心特点

1. 通用识别更精准

  • 普通话、方言、中英混说等场景下识别准确率大幅提升,显著减少错字、漏字问题。

2. 上下文语境理解

  • 结合上下文(Context)进行同音词智能纠错与意图推断,不再逐字孤立判断,而是理解整段语义后输出最合理转写。
  • 例如:根据前后文自动区分”公式”与”公司”、”权利”与”权力”等。

3. 专业术语识别

  • 支持热词注入(Hotword Injection),可针对医疗、法律、金融等垂直领域定制专业词库,提升冷门术语、行业黑话的”听中率”。

4. 复杂声学环境鲁棒性

  • 在高噪音(菜市场、地铁)、耳语、远场、长音频等极端条件下保持稳定转写,长音频错误累积被有效抑制(半小时录音不会越听越偏)。

5. 方言广覆盖

  • 覆盖10大方言片区、20多个二级小片区,包括粤语、吴语、四川话、闽南语等,方言识别能力行业领先。

6. 多语种能力

  • 支持中文普通话、英语、粤语等多语种,各语种WER均控制在极低水平。

Hy ASR 3.0 Preview技术原理

1. 端到端融合架构(区别于传统两段式)

传统ASR是”两段式”:声学模型先将声音转为拼音/字,再由语言模型纠错。两段脱节导致声学模型一旦听错,语言模型往往兜不回来。

Hy ASR 3.0 Preview 将识别与语义理解做成端到端的整体,出错概率在更早环节即被压缩。

2. MoE架构 + Hy3基座

  • 采用混合专家(MoE)架构,兼顾效率与性能。
  • 语言侧基座升级为Hy3大语言模型(总参数2950亿,激活参数210亿,支持256K上下文窗口),提供强大的语言理解、上下文建模和语义推理能力。

3. 自研无监督语音Encoder

  • 声学侧采用混元自研的无监督语音Encoder,用数千万小时级语音数据训练。
  • 专门从复杂音频中提取干净的声音特征,对噪声、口音、语速变化具有强鲁棒性。

4. 多阶段训练优化

  • 数据Scaling:海量多语种、多方言、多场景语音数据联合训练。
  • 多阶段SFT(监督微调:针对通用识别、方言、专业术语等分别精调。
  • 强化学习(RL):引入多阶段强化学习优化,进一步提升转写质量与语境适配能力。

5. 上下文建模机制

  • 利用Hy3的长上下文窗口能力,对整段语音进行全局语义建模,而非逐句独立识别。
  • 实现跨句同音词消歧、指代消解、语境补全等高级语言理解。

Hy ASR 3.0 Preview项目地址

  • 腾讯混元:https://aistudio.tencent.com/visual

  • 腾讯云:https://cloud.tencent.com/document/product/1093/135476


Hy ASR 3.0 Preview性能优势(评测数据)

表格

语种WER(词错误率)
中文普通话3.34%
英语2.62%
粤语3.12%
  • 在多个开源评测集和自建评测集上整体表现领先竞品。
  • 自建评测集覆盖通用识别、10余种方言、上下文语义理解、专业术语及高噪/耳语等复杂声学场景,WER同样保持行业最低水平。
  • WER 3%左右已接近专业人工听写的错误率水平。
Hy ASR 3.0 Preview - 腾讯混元发布的新一代语音识别模型

Hy ASR 3.0 Preview优势总结

表格

维度优势
理解深度不止”听清”,更能”听懂”——语境理解+意图推断
方言覆盖10大方言区、20+二级片区,行业领先
环境鲁棒高噪、耳语、远场、长音频均稳定
专业定制热词注入,垂直领域术语精准识别
架构效率MoE架构兼顾性能与推理成本
生态整合与Hy3大模型、腾讯云、元宝等深度打通

Hy ASR 3.0 Preview应用场景

  1. 智能客服:方言用户来电精准转写,结合上下文理解用户真实意图,减少误判与重复确认。
  2. 会议/内容转写:长音频稳定转写,专业术语(法律、医疗、金融)精准输出,支持会后自动摘要。
  3. 语音搜索:理解口语化、方言化查询表达,提升搜索召回率。
  4. 语音输入法:中英混说、方言输入场景下智能纠错,减少手动修改。
  5. 教育与无障碍:课堂录音转写、听障人士实时字幕,方言授课场景精准适配。
  6. 内容理解与分析:播客、视频、直播等音视频内容的自动文字化,支撑下游NLP分析(情感、摘要、标签)。
  7. 车载/IoT语音交互:高噪声环境下稳定识别,支持多轮对话上下文衔接。

Hy ASR 3.0 Preview与上一代的区别

表格

对比项前代ASRHy ASR 3.0 Preview
识别范式逐字转写、单点优化理解语境、兼容场景、一键直出
架构传统两段式(声学+语言分离)端到端融合
语言底座较小语言模型Hy3(2950亿参数MoE)
上下文能力单句/短窗口长上下文全局建模
方言支持有限10大方言区+20+二级片区
复杂环境易受噪声干扰高噪/耳语/远场稳定

Hy ASR 3.0 Preview的价值在于:让语音识别不再只是”听写工具”,而是真正具备语言理解能力的”听觉大脑”,为下游智能应用提供更准确、更连贯、更贴近用户意图的文本输入。
© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...