EchoWM – 京东JoyAI开源全模态可交互世界模型

EchoWM,全称 JoyAI-EchoWM,是京东探索研究院推出的全模态世界模型,支持跟随连续 6 自由度导航轨迹,同步生成 720p 视频、环境音效、背景音乐与人声。不同于常规视频生成方案,这套模型可以接收持续的镜头移动指令,画面与音频随用户操作实时变化,打造可供探索的虚拟场景。项目配套基础版本与 EchoWM-Flash 四步快速推理版本,在 WBench 导航评测基准中取得不错成绩,完整开放推理代码与模型权重,供研究人员开展二次开发。

EchoWM - 京东JoyAI开源全模态可交互世界模型

EchoWM特点

音画原生联动生成,场景内的环境声、语音、配乐会跟随镜头移动、物体动作同步变化,不会出现画面与音频脱节。

统一相机意图控制体系,第一人称、第三人称场景共用一套控制接口,离散按键指令转化为连续空间位姿轨迹。

长时序场景维持空间一致性,持续移动探索过程中,物体形态、场景结构能够稳定延续,减少画面崩坏。

提供双推理版本,标准版侧重画面细节与交互精度,EchoWM-Flash 以更少采样步数完成推理,降低运行耗时。

开源工程完整释放,推理脚本、模型权重、评测数据集配套对外公开,降低世界模型方向的实验门槛。

EchoWM技术原理

模型以相机意图作为统一控制表达,将用户输入映射为 3D 空间 6 自由度轨迹,统一描述镜头平移与旋转动作。采用渐进式训练方案,完成视听联合生成预训练后,叠加自回归后训练流程,提升长时序生成能力。

内部构建互补多模态数据引擎,融合室内、户外、奇幻场景的影像、音频、相机轨迹数据,学习场景空间规律与声音演化逻辑。生成主干在输出视频帧的同时并行计算音频序列,建立画面内容和声学信息之间的关联。Flash 版本依托因果流式采样技术,压缩采样步数,在交互任务上保留原有交互指标。

JoyAI-EchoWM项目地址

  • 项目官网:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/
  • GitHub仓库:https://github.com/jd-opensource/JoyAI-Echo

EchoWM功能

交互式场景漫游,输入移动、转向指令,实时生成连贯 720p 画面与配套音频,自由在虚拟场景中探索。

视角切换生成,在第一人称沉浸式漫游和第三人称跟随镜头之间切换,镜头与场景主体保持协同。

场景内容续写,在已有场景基础上持续拓展空间,移动过程中不断生成新区域,维持场景逻辑连贯。

音视频联合输出,同步产出画面、环境噪音、人物语音与背景音乐,构建完整沉浸式视听内容。

模型微调与二次推理,开发者基于开源权重,针对特定场景做微调,定制专属虚拟环境。

EchoWM应用场景

影视前期预可视化,导演快速搭建虚拟场景,漫游勘景,调整镜头机位,评估分镜效果。

游戏原型快速制作,生成可交互场景小样,验证关卡布局、环境氛围,缩短前期原型开发周期。

机器人仿真训练,构建虚拟环境用于智能体空间导航训练,采集感知与决策样本。

数字内容研发,打造沉浸式虚拟体验项目,支持用户在虚拟空间自由移动探索。

科研机构开展世界模型相关对照实验,测试不同控制策略、长时序生成方案的表现。

EchoWM同类产品对比

表格

对比维度EchoWMHiD-World
研发主体京东探索研究院HiD 团队
产品定位全模态可交互世界模型,支持连续 6 自由度轨迹导航,音画一体化生成开源视觉世界模型,聚焦第一人称场景画面生成,支持相机轨迹控制
核心特色原生同步输出 720p 视频、环境音、音乐、语音;支持第一 / 第三人称交互,长时序场景一致性强,提供 EchoWM-Flash 高速版本侧重视觉渲染质量,场景物理连贯性好,支持连续相机漫游,音频需外部模型补充生成
适用场景沉浸式虚拟场景漫游、交互式数字环境、虚实融合内容制作、具身智能仿真AI 虚拟场景构建、第一人称漫游视频生成、机器人视觉仿真环境搭建
© 版权声明
为这篇文章评分
0.0/ 10
0 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...