Spark-ASR-2.0 – 科大讯飞新一代语音识别大模型

Spark-ASR-2.0 是科大讯飞推出的新一代语音识别大模型,依托 Spark-Audio-1.0-Preview 语音基座大模型开发,采用全国产算力完成训练。模型跳出传统语音识别单纯还原语音文字的思路,在转写过程中加入语义层面的文本润色,直接输出通顺可读的文稿。音频输入包含嘈杂环境、小声语音、快速口语、儿童语音、中英混杂对话等复杂类型,对各类方言与行业专业词汇具备较强适配能力。推理开销控制在合理区间,性能提升不会带来成本的大幅上涨,可落地到各类硬件终端与云端业务接口。

Spark-ASR-2.0 - 科大讯飞新一代语音识别大模型

Spark-ASR-2.0特点

Spark-ASR-2.0 在高噪声环境下维持稳定识别效果,适配多样的语音输入条件。

处理中英混合对话、地方方言、行业术语时,词错误率相比前代模型明显下降。

输出文本自带整理能力,自动剔除口语重复、口误、多余语气助词,交付可直接阅读的成文内容。

上下文信息可持续参与识别推理,长段落对话里的指代内容、专有名词可以保持统一。

模型推理开销小幅增加,兼顾识别质量与业务部署成本。

支持端侧设备轻量化部署,可在智能硬件上完成本地语音转写。

Spark-ASR-2.0技术原理

模型融合非自回归语音编码网络与 LLM 增强自回归分支,两条路径协同处理音频信号。

声学编码器将音频波形转换为声学特征,完成声音信号到语言信息的初步映射。

声学与文本联合增强模块对中英混合样本、方言样本做特征优化,减少噪声对识别结果的干扰。

动态上下文注入机制把历史对话信息送入模型,利用前文内容校正当前片段的识别结果。

语言大模型分支负责文本后处理,修正错字、规整语句结构,压缩口语冗余内容。

整套训练流程基于国产算力集群完成,适配国内算力基础设施。

Spark-ASR-2.0功能

流式实时语音转写,接收持续音频流并分段输出识别文字。

离线音频文件解析,支持录音文件批量转文字。

中英文混合识别,自动区分语句内中文与英文词汇。

多类方言识别,覆盖国内主流方言体系。文本自动规整,清理口语赘余内容,优化语句可读性。

输出文字附带时间戳标记,定位每段语音对应的文本位置。

API 接口对外提供调用能力,支持第三方系统接入。

Spark-ASR-2.0应用场景

线上会议记录,实时生成会议文稿,减少人工整理耗时。

课堂授课录音转写,整理教学内容形成课堂笔记。

媒体采访素材处理,快速将采访录音转为文字稿件。

智能硬件语音采集,办公本、AI 眼镜等设备采集语音并生成文本。

客服语音质检,对通话录音做文字解析,辅助业务审核。

医疗、法律等专业场景录音转录,识别领域内专业词汇。

Spark-ASR-2.0如何使用

  1. 进入科大讯飞开放平台,注册开发者账号,创建应用项目,获取 API 调用密钥。
  2. 选择 Spark-ASR-2.0 模型接口,区分实时流式识别与离线文件转写两种调用模式,配置采样率、语言类型等参数。
  3. 接入音频数据源,实时场景推送麦克风音频流,离线场景上传本地音频文件。
  4. 接收接口返回文本,读取时间戳字段,开启文本规整选项获取润色后的文稿。
  5. 调试音频降噪、方言识别等参数,验证嘈杂场景、混合语种场景的识别效果。
  6. 完成测试后配置调用配额,将接口集成到软件、硬件产品,正式上线。

Spark-ASR-2.0同类产品对比

表格

模型研发主体产品定位核心特色适用场景
Spark-ASR-2.0科大讯飞LLM 增强语音识别模型非自回归 + LLM 协同识别,高噪、快语速、中英文混说、方言识别强,识别结果自动润色成文,推理成本增幅低会议转写、实时字幕、录音文稿、输入法语音输入
Fun-ASR-Nano阿里通义百聆轻量级 ASR 语音识别模型小参数量,支持本地部署,中文方言、中英混合识别,推理速度快,可二次开发端侧设备语音采集、轻量化语音转写、嵌入式语音交互
© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...