FireRedAudio – 小红书FireRed团队推出的音频模型

FireRedAudio 是小红书 FireRed 团队推出的通用音频语言模型,隶属于 FireRed 模型矩阵,基于 90 亿参数的 Qwen3.5 架构打造,采用解耦连续表征设计,在同一套自回归框架内同时实现音频理解与语音生成能力。模型覆盖语音识别、音频问答、长时音频理解、零样本语音合成、指令驱动语音合成、语音编辑六大核心任务,在多语种语音识别、指令语音合成等多项基准测试中处于行业领先水平。整套模型相关权重与推理代码开源开放,开发者可免费获取并做二次适配。

FireRedAudio - 小红书FireRed团队推出的音频模型

FireRedAudio特点

模型采用理解与生成解耦的双通路设计,不用拼接多个独立模型,单一框架即可覆盖从识别到生成的全链路音频需求。理解通路侧重紧凑语义特征,适配长上下文建模;生成通路保留精细声学细节,支撑高保真语音输出。两条通路共享同一套大语言模型主干,参数复用率高,部署成本低于多模型组合方案。

支持 102 种语言的语音识别,覆盖主流语种与大量小语种,跨语言处理能力突出。可直接处理最长 1 小时的长音频,完整留存上下文信息,跨段落的语义关联可以准确捕捉。零样本语音合成无需额外参考音频与微调,输入文本即可输出对应语音,指令驱动模式下可直接调整音色、语速、情绪等属性。

训练阶段引入的语义教师机制,从表征层面抑制生成过程的误差累积问题,语音编辑场景下可以做到修改内容准确、其余声学特征不变、音色不漂移。模型支持流式推理,适配实时交互场景,端到端延迟控制在较低水平。

FireRedAudio技术原理

核心架构围绕解耦连续表征搭建,音频理解与语音生成分别使用独立的输入表征通路,共享 90 亿参数的大语言模型主干。需要识别分析的音频,由专用 Audio Encoder 处理成语义紧凑的特征序列。用于生成的语音输入,则通过 RedAE 通路转换为可重建的声学连续表征。

训练采用两阶段语义蒸馏方案。第一阶段训练 Audio Encoder,让它在语音识别、说话人验证等任务中学习语义与声学双重特征。第二阶段训练 RedAE 生成通路时,将训练完成的 Audio Encoder 冻结作为语义教师,让 RedAE 输出的连续特征与教师输出的特征对齐,最小化语义损失。训练完成后,生成推理阶段不再需要 Audio Encoder 参与,不会额外增加推理耗时与算力开销。

主干网络采用 Qwen3.5 风格的 Transformer 结构,生成端搭配流匹配扩散 Transformer,将模型输出的条件序列转换为连续声学隐变量,最终还原为语音波形。整体采用渐进式多任务训练策略,依次完成语音识别、音频理解、语音合成、语音编辑的能力迭代,逐步解锁全链路能力。RedAE 通路省去常规 KL 正则,避免声学信息被过度压缩,保留更多音色细节。

FireRedAudio项目地址

  • GitHub仓库:https://github.com/FireRedTeam/FireRedAudio
  • HuggingFace模型库:https://huggingface.co/FireRedTeam/FireRedAudio

FireRedAudio功能

多语种语音识别,支持 102 种语言的语音转文字,适配不同口音、不同环境的语音输入,输出对应文本内容。

长音频理解,处理最长 1 小时的音频文件,完成内容摘要、信息抽取、问答交互,跨章节的语义逻辑可以完整关联。

零样本语音合成,输入文本直接生成对应语音,无需提供参考音色做微调,输出自然流畅的人声效果。

指令驱动语音合成,通过自然语言指令调整语音的音色、语速、语调、情绪,生成符合要求的语音素材。

语音编辑,对已有语音做内容修改、属性调整,改动部分与原语音的声学特征保持一致,不会出现音色断层。

音频语义分析,识别语音中的情绪、意图、说话人特征,支撑内容审核、标签分类等需求。

FireRedAudio应用场景

内容平台音频处理,为视频、播客、有声书生成字幕,完成长音频内容的摘要与检索,提升内容生产效率。

智能语音交互场景,嵌入语音助手、客服系统,实现语音转写、语义理解与语音回复的全链路处理,支撑自然对话交互。

有声内容制作,快速生成多语种有声书、广播剧、播报语音,调整语音风格适配不同内容定位,缩短制作周期。

语音后期编辑,修改已有语音的内容、语速、情绪,不用重新录制,提升音频后期的调整效率。

企业内部办公,处理会议录音、培训音频,自动生成会议纪要、内容标签,方便内部资料检索与归档。

多语言服务场景,为跨境客服、多语种资讯提供语音识别与合成能力,降低跨语言沟通的成本。

端侧与边缘设备部署,轻量化版本可嵌入智能硬件、终端设备,实现本地语音交互能力,减少云端依赖。

FireRedAudio同类产品对比

表格

对比维度FireRedAudioQwen‑Audio‑2.5‑8B
研发主体小红书 FireRed 团队阿里通义千问
模型定位统一音频语言大模型,理解与生成双通路解耦架构多模态音频大模型,音频理解 + 语音生成一体化
核心特色解耦连续表征,同时支持 ASR、音频理解、零样本 TTS、语音编辑,单模型兼顾识别与高质量语音生成,降低流水线级联误差中文表现优异,音频事件识别、语音问答能力突出,生态完善,适配各类 LLM 工作流,量化版本丰富
适用场景语音编辑、音频 RAG、端到端语音对话、私有化音频业务部署音频文档解析、语音问答、语音 Agent、API 服务、本地音频知识库
© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...