InstructAV2AV是由北京智源人工智能研究院与北京大学联合团队提出的音视频联合编辑模型,通过单句自然语言指令实现画面与声音的同步编辑,而非传统“先改画面再补声音”的级联流程。该技术将音视频编辑统一为端到端的多模态条件生成问题,解决了长期存在的音画不同步难题,相关成果已被SIGGRAPH Asia 2026接收,且代码、模型及8万级数据集全部开源。

InstructAV2AV核心特点
1. 真正的音视频联合编辑
- 端到端同步修改:画面与声音在同一生成过程中响应指令,避免级联处理导致的音画错位。
- 选择性编辑能力:仅修改目标对象及其关联声音(如替换人物时同步更新音色),严格保留无关背景与环境声(如风声、背景音乐)。
2. 自然语言零门槛操作
- 用户无需绘制掩码或边界框,仅需输入类似“将男人换成棕色头发的年轻女人,穿着灰色西装外套,台词改为‘I really think we should give it another chance’”的指令即可完成编辑。
3. 多粒度可控编辑
- 支持四类基础编辑任务:
- 身份保持的语音修改(仅改台词,保留说话人音色)。
- 音视频实例替换(同步更换人物外观与声音)。
- 实例插入/移除(添加或删除对象及其声学痕迹)。
- 可对人物外观、说话内容、音色进行组合控制,实现细粒度调整。
InstructAV2AV技术原理
1. 数据构建:自动化生成8万级训练集
- InsAVE-80K数据集通过三阶段流水线构建:
- 素材筛选:从YouTube等开放来源提取声画对应明确的视频(如口型与语音同步、物体运动与声音匹配)。
- 指令与目标生成:利用Qwen3-Omni等模型自动生成语义自洽的视觉+音频成对指令,并通过Grounded-SAM-2定位目标实体。
- 音视频同步处理:音频侧采用“分离—生成—混合”路径(如用SAM-Audio分离人声与环境音,再合成新目标声音)。
2. 模型改造:从生成到编辑的范式转换
- 基于预训练音视频生成模型(如DiT架构),将其改造为文本驱动的联合编辑模型:
- 输入结构:将原始视频、编辑指令作为联合条件,引导模型生成目标音视频。
- 同步建模:通过跨模态注意力机制强制画面与声音的时空对齐,确保修改后的口型、动作与新音频严格匹配。
- 关键约束:模型需同时满足指令遵从度(准确执行编辑)和背景保真度(保留无关内容)。
InstructAV2AV核心优势
1. 音画同步质量显著提升
- 传统级联方案因分步处理易导致音画错位,而InstructAV2AV的联合建模使音画同步指标提升26%以上,从根本上解决违和感问题。
2. 端到端流程避免误差累积
- 级联方案需串联多个子模型(视频编辑+音频生成+对齐修复),每步误差会逐级放大;InstructAV2AV的单一模型直接输出结果,大幅降低失败率。
3. 开源生态支持快速落地
- 完整公开推理代码、模型权重、训练脚本及InsAVE-80K数据集,显著降低技术复现门槛,推动行业应用。
InstructAV2AV项目地址
- 项目官网:https://hjzheng.net/projects/InstructAV2AV/
- GitHub仓库:https://github.com/suimuc/InstructAV2AV
- HuggingFace模型库:https://huggingface.co/suimu/InstructAV2AV
InstructAV2AV典型应用场景
1. 影视与短视频制作
- 台词修改:调整角色对白后自动同步嘴型与音色,无需重新配音或手动对齐。
- 场景替换:将雨天街道改为阳光海滩时,同步替换背景音(雨声→海浪声),避免人工补录。
2. 虚拟人内容生成
- 为虚拟主播实时更换形象与语音风格,保持动作与声音的自然协调,提升交互真实感。
3. 广告与创意生产
- 快速生成多版本广告素材(如更换产品演示者及其解说),确保画面与声音逻辑一致,缩短制作周期。
4. 无障碍技术拓展
- 为听力障碍者生成与画面事件严格同步的文字描述,或为视力障碍者提供基于音频线索的场景解析。
最后想说
当前效果仍受底层音视频生成模型的制约,在复杂物体交互、大幅相机运动等场景中可能出现物理失真或光照不一致问题。未来需进一步提升长视频稳定性与分辨率,但其统一音视频编辑范式已为影视后期、虚拟制作等领域提供了关键技术路径——让AI真正理解“视听一体”的真实世界逻辑,而非割裂处理画面与声音。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



