Audio-Visual Flamingo(简称 AVF)是 NVIDIA Nemotron Labs 联合马里兰大学推出的全开源音视频大语言模型(AV-LLM),专门实现音频、图像、长视频的联合感知与时序推理,解决传统多模态模型音、视觉信息割裂、长视频理解薄弱、无法绑定时间戳推理的痛点,提供两套可用版本:AVF-Instruct(指令微调通用版)、AVF-Think(时序链式推理增强版)。

Audio-Visual Flamingo核心特点
- 原生音视频联合感知,非后期融合
不单独处理音频、画面再简单拼接,而是同步解析人声、环境音、音乐、画面帧,依靠时序关联完成综合判断,适配答案需要视听共同佐证的场景。
- 超长视频处理能力
原生支持最长 15 分钟完整视频输入,上下文窗口最高扩展至 32K,兼顾短视频细粒度识别与长纪录片、访谈、赛事全局时序梳理。
- 时序交错 + 旋转时间对齐技术
将同步音视频片段按时间轴交错编码,搭配约束旋转时间嵌入,完整保留事件先后、声音与画面匹配关系,解决长视频时序混淆问题。
- 时间戳链式推理(CoT)
独有时序视听链式思考机制,所有推理过程绑定精确时间戳,输出内容可标注画面、音频对应的起止时段,定位视频内任意事件发生节点。
- 大规模多模态训练数据支撑
总计约 700 万条字幕、问答训练样本,覆盖短、长视频双赛道,训练素材覆盖新闻、烹饪、体育、讲座、影视等多元场景,泛化能力强。
- 多任务基准全面领先
在 15 大类评测基准上实现超越同规模开源模型,覆盖全模态、纯音频、纯视频、语音识别四大赛道;AVF-Think 在时序推理类任务增益显著。
- 完全开源可商用
模型权重、训练数据集、代码、论文全部公开,基于 Qwen2.5-7B 底座轻量化部署,适配 NVIDIA GPU 生态。
Audio-Visual Flamingo技术原理与架构
整体采用双塔编码器 + 时序融合层 + 大语言底座三段式结构,完整流程:输入多模态素材→视听独立编码→时序对齐融合→大模型文本生成。
1. 视觉编码塔:SigLIP 视觉编码器
- 采用 448×448 分辨率输入搭配 Dynamic-S2 多尺度分块预处理,保留高清画面细节;
- 对视频均匀采样帧、静态图片统一编码,输出视觉特征向量,通过独立 MLP 投影层映射至大模型统一维度。
2. 音频编码塔:AF-Whisper 音频编码器
- 音频统一重采样至 16kHz,转换为 128 维对数梅尔频谱特征;
- 采用 30 秒滑动窗口分块处理长音频,同时统一建模人声、环境音效、背景音乐三类声学信号;
- 输出音频特征经专属投影层对齐至语言模型维度。
3. 跨模态时序融合模块
- 按时间戳将同步的视觉片段、音频片段分组;
- 视听特征沿时间轴交错排列;
- 嵌入约束旋转时间嵌入(CRTE),为所有特征注入时序位置信息,锁定画面与声音的时间绑定关系;
- 融合后的统一多模态序列,与用户文本提示拼接,送入语言底座。
4. 语言底座:Qwen2.5-7B 解码器大模型
接收融合后的视听多模态前缀 + 用户提示文本,完成理解、推理、文本生成,支持输出自然描述、结构化问答、带时间戳时序记录,拓展可对接语音输出模块。
5. 分层递进式训练流程(三阶段课程学习)
- 短上下文指令微调
基于 OmniVinci 初始化权重,输入上限 5 分钟视频、16K 上下文,训练纯音频、纯视觉、字幕生成、基础问答等基础能力。
- 长上下文微调(产出 AVF-Instruct)
接入长视频数据集,输入扩展至 15 分钟视频、32K 上下文,训练长视频字幕、时序问答、全局剧情理解,形成通用可用版本。
- CoT 时序推理后训练(产出 AVF-Think)
在 AVF-Instruct 基础上,使用 24K 时序推理样本做 SFT,搭配 GRPO 强化学习优化,强化时间戳定位、事件溯源、多步骤链式推理能力。
6. 训练数据集体系 AV-Skills
总素材包含 10 万小时短视频、14 万小时长视频,合计 700 万训练样本:
- 短视频集:380 万样本,含 280 万条问答对,训练空间感知、情绪识别、计数、因果、幻觉检测等基础视听技能;
- 长视频集:320 万样本,含 200 万条问答对,训练事件排序、子场景拆分、长文本摘要、时序检索等高阶能力;
- 推理子集 AV-Think:24K 带时间戳链式推理样本,专门训练时序溯源逻辑。
Audio-Visual Flamingo项目地址
- 项目官网:https://avflamingo.pages.dev/
- GitHub仓库:https://github.com/NVIDIA/audio-flamingo
Audio-Visual Flamingo核心功能
1. 音视频全局字幕生成
综合画面、人声、背景音乐、环境音效生成完整描述,不单纯依赖字幕转录,可同步描述画面动作、背景声响、人物对话全部信息。
2. 带时间戳的时序结构化解析
输出内容标注画面与音频对应起止时间,精准定位任意食材操作、人物发言、动作、音效出现时段,输出线性时间事件流。
3. 多模态问答推理
支持复杂开放式提问:事件先后排序、声音来源匹配、画面细节检索、跨时段信息对比、视频内容因果推断;AVF-Think 可分步输出推理依据并绑定对应时间戳。
4. 专项音频理解
独立识别音乐、环境噪音、人声转录,语音识别(ASR)在 LibriSpeech、TEDLIUM 等数据集达到主流开源模型水准,可检测音频幻觉错误。
5. 长视频检索与摘要
对 15 分钟长视频做全局浓缩总结,支持 “大海捞针” 式细粒度信息检索,提取分散在不同时段的关联事件。
6. 视频计数、空间与场景理解
统计画面物体、人物数量,识别空间位置关系、人物情绪变化,区分不同子场景并归纳各场景核心内容。
Audio-Visual Flamingo同类产品对比
表格
| 对比维度 | Audio-Visual Flamingo | Qwen2.5-Omni |
|---|---|---|
| 开发主体 | NVIDIA | 阿里通义千问 |
| 核心亮点 | 长时序音视频联合推理,视频 + 音频时序对齐理解 | 全能原生多模态,支持语音对话、实时音视频交互 |
| 开源策略 | 权重开放,可本地部署二次开发 | 提供开源版本,同时上线商用 API 服务 |
| 长视频能力 | 擅长复杂长视频视听协同分析 | 更偏向短视频、实时流式音视频交互 |
| 语言支持 | 英文为主,中文能力一般 | 原生强化中文识别与问答 |
| 适用场景 | 视频内容解析、影视分析、监控视听研判 | 直播实时理解、语音助手、短视频创作 |
| 短板 | 中文交互较弱,缺少语音生成能力 | 超长视频跨时序视听推理偏弱 |
Audio-Visual Flamingo典型应用场景
- 媒体内容分析
新闻直播、纪录片、影视素材自动拆解,生成带时间轴内容摘要,快速定位发言、关键画面、背景音乐片段,用于内容审核、素材剪辑。
- 知识类视频处理
线上课程、讲座、教学视频自动生成结构化笔记,同步标注知识点出现时间,区分讲师语音、PPT 画面、演示操作。
- 生活教程类内容生产
美食、手工、DIY 教程时序化拆解,按步骤输出带时间戳操作流程,自动提取食材、工具、操作要点,适配短视频平台图文脚本生成。
- 体育赛事分析
同步识别赛场画面动作、观众欢呼、解说语音,梳理赛事关键节点、得分时段、选手动作细节,自动生成赛事战报。
- 多模态内容审核
同时校验画面违规内容、人声敏感言论、背景音乐版权,基于视听联合证据降低单一模态漏检、误判概率。
- 智能音视频检索工具
本地 / 云端视频库检索,支持自然语言描述画面 + 声音复合条件检索(如 “视频中出现敲鼓声音且人物穿红色衣服的片段”)。
- 智能会议访谈纪要
访谈、会议录像自动整理发言时序、人物对话、PPT 画面内容,生成结构化会议记录,定位关键讨论节点。
- 多模态 AI 开发基座
开源轻量化底座,用于二次开发视频问答机器人、本地离线音视频分析工具、智能剪辑辅助插件。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



