SALMONN-2是字节跳动联合清华大学推出的开源通用听觉多模态大语言模型,属于 SALMON 系列第二代音频理解底座。它主打全品类音频统一理解,可处理语音、环境音效、音乐、副语言信号,依托自研 SPEAR 自监督音频编码器与多层特征融合适配器,在少量音频文本训练数据下,在主流音频评测基准达到同规模 SOTA 水平,同时原生支持多模态上下文学习(MICL),配套完整推理、LoRA 微调开源代码,提供 8B、30B-A3B 两类权重版本。

SALMONN-2核心特点
- 统一单音频编码器架构 摒弃多分支分离编码方案,仅依靠 SPEAR 一套自监督编码器完成语音、音乐、环境音全类型特征提取,消除多编码器特征割裂问题。
- 多层特征融合(MLF 适配器) 抓取编码器全部层级分层语义特征,充分利用浅层声学细节与高层语义信息,大幅提升复杂音频细粒度识别能力。
- 极低训练数据需求 仅使用 18.2 小时音频文本配对数据,远超多数竞品百万小时级训练数据,数据成本优势显著。
- 原生 MICL 多模态上下文学习 支持多音频输入做上下文提示,可传入发音参考音频辅助稀有词、专有名词识别,优化上下文语音识别效果。
- 时间戳对齐增强建模 内置时间戳注入机制,实现音频时序精准锚定,提升声音事件检测、时序问答类任务精度。
- 轻量化微调方案 冻结音频编码器,仅训练音频连接器与 LLM 的 LoRA 低秩适配器,微调显存占用低,单机即可完成训练。
- 完整开源工程化代码 仓库提供环境部署、批量推理、单条推理、微调全套脚本,兼容 CUDA 加速,支持 FlashAttention 与标准 SDPA 两种注意力方案。
SALMONN-2技术原理
- 底层音频编码:SPEAR 自监督 SSL 框架 SPEAR 通过掩码 token 预测与知识蒸馏预训练,无需标注即可学习通用声学表征,统一覆盖人声、乐器、环境噪音所有音频模态,输出分层多级特征供上层适配器调用。
- MLF 多层特征融合适配器 串联提取 SPEAR 每一层输出表征,统一映射至 LLM 文本嵌入空间,解决单层编码丢失细节、复杂音频推理能力不足的缺陷。
- 时序时间戳注入模块 将音频时间位置信息嵌入特征流,让模型建立声音事件与时间的绑定关系,提升时序类音频任务准确率。
- MICL 多模态上下文训练范式 专门针对性训练多音频上下文能力,支持在 prompt 内插入多段参考音频作为辅助线索,实现带发音参考的上下文语音识别。
- 轻量化微调架构 训练阶段固定 SPEAR 音频编码器权重,仅更新音频连接器与 LLM 侧 LoRA 模块,兼顾微调效率与底座声学能力不退化;支持 DeepSpeed 多卡分布式训练。
- 推理链路 原始音频统一重采样 16kHz,经 SPEAR 提取特征,MLF 融合后映射至 LLM 输入空间,结合文本指令完成跨模态生成,支持单条与批量两种推理模式。
SALMONN-2项目地址
- GitHub仓库:https://github.com/bytedance/SALMONN/tree/salmonn2
- HuggingFace模型库:https://huggingface.co/marcoyang/SALMONN-2-8B
SALMONN-2核心优势
- 同规模性能顶尖,数据消耗极低 8B 版本仅 18.2 小时训练数据,在 MMAU-Pro、MMAR、MMSU 三大音频基准全部超过 Qwen2.5-Omni、Kimi-Audio 等主流 8B 音频模型;30B-A3B 版本指标进一步提升。
- 全音频场景均衡无短板 语音转写、环境音识别、音乐解析、情绪识别、副语言分析五大任务性能均衡,不会出现只擅长语音、音乐识别拉胯的偏科问题。
- 上下文音频识别独有能力 行业少见原生支持多音频参考的上下文 ASR,可借助发音音频纠正生僻人名、专业术语识别错误。
- 部署与微调成本更低 推理支持 FlashAttention 加速降低显存占用;微调无需冻结庞大音频编码器,小 GPU 即可完成定制化音频任务适配。
- 完全开源可商用开发 完整推理、微调代码对外开放,无闭源依赖,开发者可二次封装 API、嵌入自研音频产品。
- 工程配套完善 自带批量推理脚本、单元测试、预提交代码校验工具,支持 conda / 虚拟环境两种部署方案,适配科研与产业开发流程。
SALMONN-2应用场景
- 通用语音处理 多语种语音识别、带专有名词参考的上下文转写、语音翻译、语音情绪 / 音色识别、通话录音转写。
- 音频内容分析 短视频音频理解、播客内容摘要、会议录音结构化总结、音频事件检测(异响、警报、环境音分类)。
- 音乐类 AI 业务 曲风识别、乐器检测、歌词对齐、音乐内容描述、BGM 自动标注。
- 垂直行业音频工具 客服语音质检、教育听力素材解析、媒体音视频字幕自动生成、智能助听器听觉理解模块。
- 科研与模型二次开发 音频大模型算法研究、自定义音频数据集微调、听觉 Agent 底座开发、多模态上下文学习实验。
- 多模态 Agent 底层底座 搭载语音交互智能体、机器人听觉感知、实时语音问答系统。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



