CoinVE-200K是一个面向组合式指令引导视频编辑的大规模高质量数据集。它是目前专注于多意图组合编辑的视频编辑数据集,旨在解决现有数据集仅支持单一编辑操作、无法处理”一句话包含多个编辑需求”的瓶颈问题。
该数据集包含 20万+ 条视频-指令对,每条样本涉及 2 到 5 个原子编辑操作的组合,覆盖人物、物体、背景等多类目标主体。

CoinVE-200K特点
表格
| 维度 | 具体特点 |
|---|---|
| 规模 | 20万+ 视频-指令对,数据量约 2.8TB |
| 分辨率 | 1080P 高清视频 |
| 时长 | 单条视频最长 201 帧 |
| 组合性 | 每条指令包含 2-5 个原子编辑操作的组合 |
| 编辑类型 | 6 种原子编辑类型:添加、删除、修改、风格化等 |
| 目标主体 | 覆盖人物、物体、背景等多类主体 |
| 质量控制 | 经过精心设计的生成与过滤流水线,确保指令忠实度、视觉质量、时序一致性和组合多样性 |
| 区域感知 | 支持按指令对视频中不同区域进行精准编辑 |
| 标注粒度 | 提供逐指令和组合后的区域标注 |
与现有指令式视频编辑数据集相比,CoinVE-200K 更强调:
- 多意图组合(Multi-intent Composition)
- 区域感知编辑(Region-aware Editing)
- 不同编辑操作间的复杂交互(Complex Interactions)
CoinVE-200K技术原理
1. 数据构建流程
CoinVE-200K 采用了一套多阶段数据生成与质量过滤流水线:
- 生成阶段:通过精心设计的流程合成视频编辑对
- 过滤阶段:多维度质量筛选,确保:
- 指令忠实度(Instruction Faithfulness):编辑结果严格遵循指令描述
- 视觉质量(Visual Quality):输出画面清晰、自然
- 时序一致性(Temporal Consistency):视频帧间过渡平滑连贯
- 组合多样性(Compositional Diversity):覆盖丰富的编辑组合场景
2. CoinVE-Edit 模型架构
CoinVE-Edit 是一个 220 亿参数的组合式视频编辑模型,其技术架构基于两个核心组件:
表格
| 组件 | 模型 | 作用 |
|---|---|---|
| 视频生成基座 | Wan2.1-T2V-14B | 提供高质量视频生成能力 |
| 视觉语言理解 | Qwen3-VL-8B-Instruct | 解析复杂的多意图编辑指令 |
核心技术机制:
- 区域感知注意力解耦(Region-aware Attention Disentanglement):将不同编辑指令对应的注意力机制进行解耦,使模型能够:
- 精准定位并编辑多个不同区域
- 保留与编辑无关的内容不变
- 维持整体时序连贯性
- 多区域并行编辑:在单次前向传播中同时执行 2-5 个编辑操作,避免传统串行编辑带来的误差累积问题。
CoinVE-200K功能
CoinVE-200K 及其配套工具链提供以下核心功能:
- 组合式视频编辑训练数据:为模型提供大规模、高质量的多意图编辑训练样本
- 统一评估基准(CoinVE-Bench):覆盖多样化的编辑主体、操作类型和指令复杂度,为组合式指令视频编辑提供标准化评测协议
- 基线模型(CoinVE-Edit):开箱即用的 22B 组合式视频编辑模型,支持:
- 单指令视频编辑
- 多指令组合视频编辑
- 区域感知精准编辑
- 内容保留与风格迁移
评测指标维度:
- 编辑准确率(Edit. Acc.)
- 物理自然度(Phys. Natural.)
- 语义保留度(Seman. Pres.)
- 视频质量(Video Quality)
在 CoinVE-Bench 上,CoinVE-Edit 在多项指标上超越了 Seedance 2.0、Kling O3、VINO 等现有模型。
CoinVE-200K项目地址
- 项目官网:https://coinve200k.github.io/
- GitHub仓库:https://github.com/coinve200k/CoinVE-200K
- HuggingFace模型库:https://huggingface.co/datasets/FireCRT/CoinVE-200K
CoinVE-200K应用场景
CoinVE-200K 及 CoinVE-Edit 可广泛应用于以下场景:
表格
| 场景 | 说明 |
|---|---|
| 影视后期制作 | 通过自然语言指令一次性完成”将背景换成夕阳+给主角加帽子+调暖色调”等多步编辑 |
| 广告与营销视频 | 快速批量生成同一视频的多版本变体(替换产品、调整风格、修改背景等) |
| 短视频内容创作 | 创作者用一句话描述复杂编辑需求,AI 自动执行多区域、多操作的视频修改 |
| 虚拟试衣/试妆 | 同时修改人物服装、发型、背景等多个元素 |
| 游戏与动画制作 | 批量修改场景中的多个对象属性(添加道具、移除障碍物、改变天气等) |
| AI 视频编辑模型研发 | 作为训练数据和评测基准,推动组合式视频编辑领域的研究发展 |
| 智能视频修复与增强 | 同时进行去噪、调色、对象移除、内容添加等复合操作 |
CoinVE-200K配套资源
- 数据集:CoinVE-200K(20万+ 样本)
- 评测基准:CoinVE-Bench(组合式编辑专用评测集)
- 基线模型:CoinVE-Edit(22B 参数,基于 Wan2.1 + Qwen3-VL)
- 开源地址:GitHub 主页
coinve200k.github.io,模型和数据集已上架 ModelScope
总结:CoinVE-200K 填补了”组合式指令视频编辑”领域的数据空白,通过高质量的多意图编辑数据、专用评测基准和强大的基线模型,推动视频编辑从”单步操作”迈向”一句话完成复杂多区域编辑”的新阶段。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



