Hy ASR 3.0 Preview是腾讯混元发布的新一代语音识别(ASR)模型。它基于腾讯最新一代大语言模型 Hy3的语言理解能力,将高精度语音识别与深度语义理解深度融合,标志着语音识别从传统的”逐字转写、单点优化”向”理解语境、兼容场景、一键直出“的范式跨越。
该模型已上线腾讯云官网对外提供API服务,腾讯元宝已完成首发接入(用户长按说话即可体验),WorkBuddy等产品也在陆续接入中。

Hy ASR 3.0 Preview核心特点
1. 通用识别更精准
- 普通话、方言、中英混说等场景下识别准确率大幅提升,显著减少错字、漏字问题。
2. 上下文语境理解
- 结合上下文(Context)进行同音词智能纠错与意图推断,不再逐字孤立判断,而是理解整段语义后输出最合理转写。
- 例如:根据前后文自动区分”公式”与”公司”、”权利”与”权力”等。
3. 专业术语识别
- 支持热词注入(Hotword Injection),可针对医疗、法律、金融等垂直领域定制专业词库,提升冷门术语、行业黑话的”听中率”。
4. 复杂声学环境鲁棒性
- 在高噪音(菜市场、地铁)、耳语、远场、长音频等极端条件下保持稳定转写,长音频错误累积被有效抑制(半小时录音不会越听越偏)。
5. 方言广覆盖
- 覆盖10大方言片区、20多个二级小片区,包括粤语、吴语、四川话、闽南语等,方言识别能力行业领先。
6. 多语种能力
- 支持中文普通话、英语、粤语等多语种,各语种WER均控制在极低水平。
Hy ASR 3.0 Preview技术原理
1. 端到端融合架构(区别于传统两段式)
传统ASR是”两段式”:声学模型先将声音转为拼音/字,再由语言模型纠错。两段脱节导致声学模型一旦听错,语言模型往往兜不回来。
Hy ASR 3.0 Preview 将识别与语义理解做成端到端的整体,出错概率在更早环节即被压缩。
2. MoE架构 + Hy3基座
- 采用混合专家(MoE)架构,兼顾效率与性能。
- 语言侧基座升级为Hy3大语言模型(总参数2950亿,激活参数210亿,支持256K上下文窗口),提供强大的语言理解、上下文建模和语义推理能力。
3. 自研无监督语音Encoder
- 声学侧采用混元自研的无监督语音Encoder,用数千万小时级语音数据训练。
- 专门从复杂音频中提取干净的声音特征,对噪声、口音、语速变化具有强鲁棒性。
4. 多阶段训练优化
- 数据Scaling:海量多语种、多方言、多场景语音数据联合训练。
- 多阶段SFT(监督微调):针对通用识别、方言、专业术语等分别精调。
- 强化学习(RL):引入多阶段强化学习优化,进一步提升转写质量与语境适配能力。
5. 上下文建模机制
- 利用Hy3的长上下文窗口能力,对整段语音进行全局语义建模,而非逐句独立识别。
- 实现跨句同音词消歧、指代消解、语境补全等高级语言理解。
Hy ASR 3.0 Preview项目地址
腾讯混元:https://aistudio.tencent.com/visual
腾讯云:https://cloud.tencent.com/document/product/1093/135476
Hy ASR 3.0 Preview性能优势(评测数据)
表格
| 语种 | WER(词错误率) |
|---|---|
| 中文普通话 | 3.34% |
| 英语 | 2.62% |
| 粤语 | 3.12% |
- 在多个开源评测集和自建评测集上整体表现领先竞品。
- 自建评测集覆盖通用识别、10余种方言、上下文语义理解、专业术语及高噪/耳语等复杂声学场景,WER同样保持行业最低水平。
- WER 3%左右已接近专业人工听写的错误率水平。

Hy ASR 3.0 Preview优势总结
表格
| 维度 | 优势 |
|---|---|
| 理解深度 | 不止”听清”,更能”听懂”——语境理解+意图推断 |
| 方言覆盖 | 10大方言区、20+二级片区,行业领先 |
| 环境鲁棒 | 高噪、耳语、远场、长音频均稳定 |
| 专业定制 | 热词注入,垂直领域术语精准识别 |
| 架构效率 | MoE架构兼顾性能与推理成本 |
| 生态整合 | 与Hy3大模型、腾讯云、元宝等深度打通 |
Hy ASR 3.0 Preview应用场景
- 智能客服:方言用户来电精准转写,结合上下文理解用户真实意图,减少误判与重复确认。
- 会议/内容转写:长音频稳定转写,专业术语(法律、医疗、金融)精准输出,支持会后自动摘要。
- 语音搜索:理解口语化、方言化查询表达,提升搜索召回率。
- 语音输入法:中英混说、方言输入场景下智能纠错,减少手动修改。
- 教育与无障碍:课堂录音转写、听障人士实时字幕,方言授课场景精准适配。
- 内容理解与分析:播客、视频、直播等音视频内容的自动文字化,支撑下游NLP分析(情感、摘要、标签)。
- 车载/IoT语音交互:高噪声环境下稳定识别,支持多轮对话上下文衔接。
Hy ASR 3.0 Preview与上一代的区别
表格
| 对比项 | 前代ASR | Hy ASR 3.0 Preview |
|---|---|---|
| 识别范式 | 逐字转写、单点优化 | 理解语境、兼容场景、一键直出 |
| 架构 | 传统两段式(声学+语言分离) | 端到端融合 |
| 语言底座 | 较小语言模型 | Hy3(2950亿参数MoE) |
| 上下文能力 | 单句/短窗口 | 长上下文全局建模 |
| 方言支持 | 有限 | 10大方言区+20+二级片区 |
| 复杂环境 | 易受噪声干扰 | 高噪/耳语/远场稳定 |
Hy ASR 3.0 Preview的价值在于:让语音识别不再只是”听写工具”,而是真正具备语言理解能力的”听觉大脑”,为下游智能应用提供更准确、更连贯、更贴近用户意图的文本输入。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



