CoinVE-200K – 面向组合式指令引导视频编辑的大规模高质量数据集

CoinVE-200K是一个面向组合式指令引导视频编辑的大规模高质量数据集。它是目前专注于多意图组合编辑的视频编辑数据集,旨在解决现有数据集仅支持单一编辑操作、无法处理”一句话包含多个编辑需求”的瓶颈问题。

该数据集包含 20万+ 条视频-指令对,每条样本涉及 2 到 5 个原子编辑操作的组合,覆盖人物、物体、背景等多类目标主体。

CoinVE-200K - 面向组合式指令引导视频编辑的大规模高质量数据集


CoinVE-200K特点

表格

维度具体特点
规模20万+ 视频-指令对,数据量约 2.8TB
分辨率1080P 高清视频
时长单条视频最长 201 帧
组合性每条指令包含 2-5 个原子编辑操作的组合
编辑类型6 种原子编辑类型:添加、删除、修改、风格化等
目标主体覆盖人物、物体、背景等多类主体
质量控制经过精心设计的生成与过滤流水线,确保指令忠实度、视觉质量、时序一致性和组合多样性
区域感知支持按指令对视频中不同区域进行精准编辑
标注粒度提供逐指令和组合后的区域标注
与现有指令式视频编辑数据集相比,CoinVE-200K 更强调:
  • 多意图组合(Multi-intent Composition)
  • 区域感知编辑(Region-aware Editing)
  • 不同编辑操作间的复杂交互(Complex Interactions)

CoinVE-200K技术原理

1. 数据构建流程

CoinVE-200K 采用了一套多阶段数据生成与质量过滤流水线
  • 生成阶段:通过精心设计的流程合成视频编辑对
  • 过滤阶段:多维度质量筛选,确保:
    • 指令忠实度(Instruction Faithfulness):编辑结果严格遵循指令描述
    • 视觉质量(Visual Quality):输出画面清晰、自然
    • 时序一致性(Temporal Consistency):视频帧间过渡平滑连贯
    • 组合多样性(Compositional Diversity):覆盖丰富的编辑组合场景

2. CoinVE-Edit 模型架构

CoinVE-Edit 是一个 220 亿参数的组合式视频编辑模型,其技术架构基于两个核心组件:
表格

复制
组件模型作用
视频生成基座Wan2.1-T2V-14B提供高质量视频生成能力
视觉语言理解Qwen3-VL-8B-Instruct解析复杂的多意图编辑指令
核心技术机制
  • 区域感知注意力解耦(Region-aware Attention Disentanglement):将不同编辑指令对应的注意力机制进行解耦,使模型能够:
    • 精准定位并编辑多个不同区域
    • 保留与编辑无关的内容不变
    • 维持整体时序连贯性
  • 多区域并行编辑:在单次前向传播中同时执行 2-5 个编辑操作,避免传统串行编辑带来的误差累积问题。

CoinVE-200K功能

CoinVE-200K 及其配套工具链提供以下核心功能:
  1. 组合式视频编辑训练数据:为模型提供大规模、高质量的多意图编辑训练样本
  2. 统一评估基准(CoinVE-Bench):覆盖多样化的编辑主体、操作类型和指令复杂度,为组合式指令视频编辑提供标准化评测协议
  3. 基线模型(CoinVE-Edit):开箱即用的 22B 组合式视频编辑模型,支持:
    • 单指令视频编辑
    • 多指令组合视频编辑
    • 区域感知精准编辑
    • 内容保留与风格迁移
评测指标维度
  • 编辑准确率(Edit. Acc.)
  • 物理自然度(Phys. Natural.)
  • 语义保留度(Seman. Pres.)
  • 视频质量(Video Quality)
在 CoinVE-Bench 上,CoinVE-Edit 在多项指标上超越了 Seedance 2.0、Kling O3、VINO 等现有模型。

CoinVE-200K项目地址

  • 项目官网:https://coinve200k.github.io/
  • GitHub仓库:https://github.com/coinve200k/CoinVE-200K
  • HuggingFace模型库:https://huggingface.co/datasets/FireCRT/CoinVE-200K

CoinVE-200K应用场景

CoinVE-200K 及 CoinVE-Edit 可广泛应用于以下场景:
表格

场景说明
影视后期制作通过自然语言指令一次性完成”将背景换成夕阳+给主角加帽子+调暖色调”等多步编辑
广告与营销视频快速批量生成同一视频的多版本变体(替换产品、调整风格、修改背景等)
短视频内容创作创作者用一句话描述复杂编辑需求,AI 自动执行多区域、多操作的视频修改
虚拟试衣/试妆同时修改人物服装、发型、背景等多个元素
游戏与动画制作批量修改场景中的多个对象属性(添加道具、移除障碍物、改变天气等)
AI 视频编辑模型研发作为训练数据和评测基准,推动组合式视频编辑领域的研究发展
智能视频修复与增强同时进行去噪、调色、对象移除、内容添加等复合操作

CoinVE-200K配套资源

  • 数据集:CoinVE-200K(20万+ 样本)
  • 评测基准:CoinVE-Bench(组合式编辑专用评测集)
  • 基线模型:CoinVE-Edit(22B 参数,基于 Wan2.1 + Qwen3-VL)
  • 开源地址:GitHub 主页 coinve200k.github.io,模型和数据集已上架 ModelScope

总结:CoinVE-200K 填补了”组合式指令视频编辑”领域的数据空白,通过高质量的多意图编辑数据、专用评测基准和强大的基线模型,推动视频编辑从”单步操作”迈向”一句话完成复杂多区域编辑”的新阶段。
© 版权声明
为这篇文章评分
0.0/ 10
0 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...