Spark-Audio-1.0-Preview – 多任务音频生成与理解模型

科大讯飞正式发布语音基座大模型Spark-Audio-1.0-Preview。这是业界首个基于全国产化算力集群训练的语音基座大模型,采用0.65B稠密音频编码器搭配30B-A3B混合专家(MoE)语言模型,使用1300万小时音频及大量文本数据训练而成。该模型支持文本与语音双模态输入、文本输出,覆盖99种语言和202种方言识别,在Fleurs、KeSpeech、LibriSpeech等评测中得分高于Gemini-3.1 Pro,Fleurs中文测试集达到SOTA;目前已在讯飞星火官网开放免费体验,API服务后续将上线讯飞开放平台。

Spark-Audio-1.0-Preview - 多任务音频生成与理解模型

Spark-Audio-1.0-Preview特点

  • 端到端直接理解语音:跳过“先转文字再理解”的级联链路,直接从音频中提取语义、情绪、场景信息,人声、环境音、音乐一次处理完毕。
  • 全国产算力训练:从训练到推理全链路跑在国产算力集群上,为信创、政企等对算力自主可控有硬性要求的场景提供了现成选项。
  • 小尺寸打出大模型效果:训练数据量仅为同尺寸Qwen3.5-omni-flash的十分之一,多语言、多方言识别效果反超,整体表现接近高一个数量级的Qwen3.5-omni-plus。
  • 复杂场景抗干扰强:高噪声、小音量、远距离收音等真实工况下优势明显,这类偏应用类的任务表现优于公开测试集上的纸面成绩。
  • 文本能力不降智:接入音频模态后,通用知识、数学、代码等纯文本任务没有出现明显退化,一套模型能同时兼顾对话与音频处理。

Spark-Audio-1.0-Preview技术原理

传统方案把语音识别、声纹、翻译、情感分析拆成独立模块串联,信息在环节间层层损耗。Spark-Audio-1.0-Preview走的是统一建模路线,具体分三步推进。

音频编码器预训练:先用大规模无标注音频做自监督预训练,把0.65B的Dense编码器喂足,让它在波形层面建立起对音素、韵律、音色、环境声的表征能力,再逐步扩展表征范围。这一步决定了模型能不能“听懂”语气和环境,而不只是“听清”字。

音视频-文本联合预训练:将音频编码器接上30B-A3B的MoE语言模型,用1300万小时音频对齐文本进行跨模态预训练。MoE结构保证每次推理只激活约3B参数,控制推理成本;音频token与文本token进入同一套注意力机制,语义、说话人、情绪在同一空间完成对齐。

多任务后训练:在转写、翻译、方言识别、环境音识别、说话人区分、情感分析、音频问答等任务上做指令微调与偏好优化,同时保留通用对话和推理能力。官方坦承当前版本在指令遵循、多轮对话、复杂音频理解上仍有追赶空间,后续会持续补齐。

Spark-Audio-1.0-Preview功能

  • 语音转写:支持中英日韩法德西阿俄等99种语言及202种方言免切识别,语种混说自动判断,输出带智能标点和大小写。
  • 多方言识别:市级方言全覆盖,粤语、闽南语、川渝话、东北话等均可直接输入,无需提前指定方言种类。
  • 多语言翻译:音频直译文本,跳过中间转写环节,保留原句的语气强弱和停顿节奏。
  • 环境音识别:分辨车流、风雨、机器运转、婴儿啼哭、玻璃破碎等背景声,并纳入场景判断。
  • 说话人识别与分离:多人对话自动区分角色,输出带说话人标签的分段文本。
  • 情感分析:识别愤怒、焦虑、犹豫、满意等情绪状态,可配合情绪强度做分级。
  • 音频问答:针对整段录音提问,比如“客户在第几分钟提出价格异议”“会议最终定了哪三个结论”。

Spark-Audio-1.0-Preview应用场景

  • 客服质检:全量录音自动过审,话术规范、服务态度、问题解决率一并出结构化报告,替代人工抽检。
  • 会议纪要:多人讨论自动分角色、提取决策点和待办事项,直接生成可归档的结构化纪要。
  • 医疗电子病历:问诊录音转写后抽取主诉、既往史、用药情况,减少医生手工录入。
  • 汽车座舱与机器人交互:嘈杂环境下识别小声指令,结合情绪感知调整回应策略,让多轮对话更连贯。
  • 实时同传与跨语言会议:保留说话人的语气韵律,译文不生硬,适合外事、商务谈判场合。
  • 内容审核与舆情:同步判断说了什么、用什么情绪说、背景是什么环境,降低误判率。
  • 涉外与方言地区服务:99语种加202方言免切,适合口岸、文旅、基层政务窗口这类口音混杂的场景。

Spark-Audio-1.0-Preview使用教程

网页端体验

  1. 打开讯飞星火官网,登录或注册账号。
  2. 在首页模型选择区域找到Spark-Audio-1.0-Preview,或在体验入口页(xfyun.cn/experience/spark-audio)直接进入。
  3. 点击上传音频文件,支持常见格式如WAV、MP3、M4A、PCM,单文件时长建议控制在数分钟到一小时内以保证响应速度。
  4. 选择任务类型:转写、翻译、方言识别、情感分析、音频问答等,部分任务需额外填写目标语种或提问内容。
  5. 提交后等待结果,可在页面上查看分段文本、说话人标签、情绪标注,问答类任务会直接给出定位到时间点的回答。
  6. 体验结果支持复制导出,用于效果验证和内部比对。

接入准备(API尚未开放)

  • 官方已明确API后续将上线讯飞开放平台,现阶段无法通过接口调用。有集成需求的团队可以先用网页端跑通效果验证,准备好典型音频样本和验收指标。
  • 正式接入时大概率沿用讯飞开放平台现有的鉴权方式(AppID、APIKey、APISecret),计费口径可能按音频时长结算,具体以平台公告为准。
  • 若已有业务跑在讯飞的实时语音听写、录音文件转写等旧接口上,迁移时要注意新旧模型的返回字段差异,特别是说话人标签和情绪字段属于新增能力,老解析逻辑需要补适配。

Spark-Audio-1.0-Preview同类产品对比

表格

项目Spark-Audio-1.0-PreviewQwen3.5-omni-Flash
研发主体科大讯飞阿里通义实验室
模型定位全国产算力训练语音基座大模型,音频原生理解,支持音频问答、多语种多方言识别多模态通用基座模型,集成音频、图像、文本能力,音频为其中一个模态
核心特色0.65B 音频编码器 + 30B-A3B MoE 架构;99 种语言 + 202 种方言;高噪、小音量复杂音频表现突出,国产算力全链路训练生态完善,音图文一体;部署工具链成熟,综合多模态能力均衡
适用场景语音转写、声纹识别、音频情感分析、嘈杂环境语音交互、国产化业务落地通用多模态问答、图文 + 音频混合任务、轻量多模态 Agent
© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...