JoyAI-Video-Edit是京东探索研究院于2026年8月5日正式开源自研的实时流式视频编辑模型。该模型于2026年7月18日在世界人工智能大会(WAIC)上首次亮相,8月5日在 Hugging Face 和 GitHub 平台正式开源。打破了传统视频”先成片再剪辑”的固有模式,实现“边播边改”——用户可以在视频播放过程中,通过自然语言指令实时修改人物、服装、商品、背景和画面风格,让视频创作从”先有素材再修改”变为可实时互动编辑。
在业界权威的 OpenVE-Bench 通用评测中,JoyAI-Video-Edit 超越目前所有流式编辑方法(包括 SANA Streaming、LiveEdit 等国际主流模型),各项指标全面领先,达到世界一流水平。

JoyAI-Video-Edit核心特点
1. 实时流式编辑
- 在 720P 分辨率下实现每秒30帧的模型推理速度,画面处理无明显延迟卡顿,能够匹配常见影视视频的播放节奏。
- 用户无需暂停视频、无需等待渲染,播放过程中即可实时修改画面内容。
2. 任意时长稳定处理
- 突破了此前流式编辑模型只能处理几秒或分钟级片段的限制,支持超长视频不间断流式处理。
- 视频长度不再是编辑的瓶颈,可应对任意长度的视频内容。
3. 自然语言驱动编辑
- 用户面对变化中的视频画面,可以直接用自然语言增删物体、替换人物、迁移服装,甚至重构整个场景。
- 支持自定义画面和边预览边修改,交互方式直观自然。
4. 多类型实时编辑
- 支持实时更换人物着装、实体物件、整体场景与画面艺术风格。
- 涵盖全局风格转换、局部物体替换、特定元素删除等多种编辑任务。
5. 完全开源
- 模型代码与权重在 Hugging Face 和 GitHub 平台全部开放。
- 开发者可自主部署调试或进行功能二次开发。
JoyAI-Video-Edit技术原理
1. 全自研 JoyAI-Video 架构
- 基于京东全自研的 JoyAI-Video 基础大模型底座构建,专为视频生成与编辑任务设计。
- 模型不是对一帧一帧图片做独立处理,而是在理解视频上下文的基础上,保持编辑区域的时序一致性。
2. 流式处理机制
- 采用因果流式架构,模型以滑动窗口方式逐段接收视频帧,在保持对已处理内容记忆的同时,实时生成编辑后的新帧。
- 这种设计使得模型无需一次性加载整段视频,从而支持任意时长的连续编辑。
3. 上下文感知的编辑生成
- 模型在生成每一帧编辑结果时,会参考前序帧的编辑状态和运动信息,确保:
- 编辑区域的时序连贯性(不会出现闪烁或跳变)
- 未编辑区域的内容保持(背景、人物动作等不受影响)
- 编辑指令的语义一致性(同一指令在整个视频中保持一致效果)
4. 指令理解与空间定位
- 通过文本编码器将自然语言编辑指令转化为语义向量。
- 结合视频帧的视觉特征,精确定位需要编辑的区域和对象。
- 在扩散/生成过程中,将编辑意图注入对应区域,同时约束非编辑区域保持不变。
5. 实时推理优化
- 针对30fps实时性要求,模型在推理管线中进行了深度优化:
- 减少扩散去噪步数
- 采用高效的注意力计算策略
- 优化帧间信息传递的缓存机制
- 确保在保持画面质量的同时,推理速度严格匹配播放帧率。
JoyAI-Video-Edit核心优势
1. 性能全面领先
- 在 OpenVE-Bench 通用评测中,超越目前所有流式编辑方法。
- 特别在全局风格调整、局部画面替换、元素删除及需要精准理解编辑意图的复杂场景中表现突出。
- 超越 SANA Streaming、LiveEdit 等国际主流竞品。
2. 真正的实时性
- 720P@30fps 的实时处理能力,意味着模型推理速度完全跟上视频播放速度。
- 无卡顿、无延迟,实现真正的”所见即所得”编辑体验。
3. 突破时长限制
- 此前行业流式编辑模型只能处理数秒到分钟级片段。
- JoyAI-Video-Edit 支持任意时长的稳定流式编辑,适用于长视频、直播等场景。
4. 交互方式革新
- 从传统的”时间线剪辑”变为”自然语言对话式编辑”。
- 降低了视频编辑的专业门槛,普通用户也能完成复杂编辑操作。
5. 开源生态价值
- 作为京东 JoyAI 模型矩阵的重要组成(年内已发布7个基础模型),与 JoyAI-Image-Edit、JoyAI-Echo、JoyAI-VL-Interaction 等形成完整生态。
- 完全开源,推动实时视频编辑技术的普及和二次创新。
JoyAI-Video-Edit项目地址
- GitHub仓库:https://github.com/jd-opensource/JoyAI-Video-Edit
- HuggingFace模型库:https://huggingface.co/jdopensource/JoyAI-Video-Edit
JoyAI-Video-Edit应用场景
1. 电商直播
- 主播可在直播过程中实时切换服装颜色、更换背景场景、替换展示商品。
- 服饰试穿场景中,实现不同颜色单品的即时演示效果,无需等待后期剪辑。
- 大幅提升直播互动性和转化率。

2. 家装设计
- 快速替换视频中的家具款式、墙面颜色、装修风格。
- 客户可在视频预览中实时看到不同设计方案的效果,加速决策过程。

3. 影视制作
- 即时调整场景与人物造型,节省传统后期制作的时间与成本。
- 导演可在拍摄现场实时预览不同视觉方案,辅助创意决策。
- 减少重复拍摄,降低制作周期。
4. 零售营销
- 为商品视频快速生成多版本(不同背景、不同模特、不同风格)。
- 支持A/B测试,实时生成不同创意方向的营销素材。
5. 具身智能数据合成
- 为机器人训练大规模合成多样化场景数据。
- 通过实时编辑改变训练视频中的物体、场景、光照条件等,扩充数据多样性。
- 降低高危场景(如火灾、化学品泄漏)的素材采集成本。
6. 内容创作与社交媒体
- 创作者可在视频播放中随时调整画面风格、添加/删除元素。
- 大幅缩短短视频制作周期,实现”即拍即改即发”。
最后想说
JoyAI-Video-Edit将视频编辑从”离线批处理”推进到”实时流式交互”时代。通过全自研的 JoyAI-Video 架构实现720P@30fps的实时推理,结合任意时长的稳定流式处理能力和自然语言驱动的编辑方式,彻底改变了视频创作的工作流。其在 OpenVE-Bench 上全面超越国际竞品的表现,标志着中国在实时视频编辑领域已达到世界一流水平。作为京东 JoyAI 模型矩阵的关键一环,它与京东的电商、物流、具身智能等业务场景深度结合,正在从技术突破走向大规模产业应用。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



