HiDream-O1-World 是智象未来(HiDream.ai)发布的原生全模态交互式世界模型。它支持文本、图像及交互式操控等多模态输入,具备漫游、编辑、交互三大核心功能,能够一键生成时空一致、符合物理规律、可长时推演的完整动态世界。
该模型的相关底层研究(Geometry-then-Appearance 两阶段框架)已入选 ECCV 2026,项目主页为 DreamWorld。

HiDream-O1-World核心特点
表格
| 特点 | 说明 |
|---|---|
| 时空一致性 | 镜头推拉摇移时,场景几何结构保持高度稳定,物体不会消失或变形 |
| 物理一致性 | 物体间的碰撞、遮挡、重力响应高度符合真实世界的因果逻辑 |
| 长时推演 | 支持长时间交互,场景不会”重置”或漂移,实现”人走了,世界还在” |
| 原生全模态 | 文本、图像、动作指令、空间坐标等统一处理,非模态拼接 |
| 视角自由 | 支持第一人称、第三人称视角自由切换与探索 |
HiDream-O1-World技术原理
1. UiT(Unified Transformer)原生全模态架构
传统多模态系统采用”拼接逻辑”:文本有文本编码器,图像有图像编码器(VAE),视频有视频处理模块,各自独立后再翻译交换,容易丢失跨模态因果逻辑。
HiDream-O1-World 采用自研 UiT 架构,摒弃独立文本编码器和 VAE,将图像像素、文本 Token、视频体素、音频、动作指令、空间坐标等所有原始信号,统一映射到同一个共享 Token 空间,在同一套 Transformer 网络里交互、理解、生成。这意味着模型在底层表征空间直接完成跨模态对齐,而非事后拼接。
2. Geometry-then-Appearance 两阶段生成
现有视频扩散模型大多直接根据初始图像和相机轨迹生成新视角视频,容易出现几何结构不合理、物体形变等问题。
HiDream-O1-World 采用几何-外观解耦的两阶段框架:
- 第一阶段(几何生成):根据输入图像和相机轨迹,借助预训练 3D 基础模型提取多尺度几何特征,通过 Geometry Video Diffusion Model 在几何特征空间中补全遮挡、空洞和结构缺失,生成完整的几何表示。
- 第二阶段(外观生成):以第一阶段的几何表示为结构条件,由 Appearance Video Diffusion Model 在 VAE 潜空间中条件去噪,最终解码为高保真 RGB 视频帧。
几何阶段专注结构完整与跨视角一致性,外观阶段专注纹理细节与视觉保真,互不干扰。
3. 3D 先验记忆注入 + Test-Time Training(TTT)
- Memory 3D 先验记忆:建立持续的空间记忆,保存场景中的几何拓扑、空间坐标及物体之间的关联关系。即使用户离开当前区域再返回,场景也能保持此前的空间状态。
- TTT 推理在线自适应:在推理阶段动态适配当前相机轨迹和场景结构,实时微调模型表征,让每一次交互、每一次视角切换都严格贴合 3D 几何约束,全程结构稳定、无畸变。
4. 物理一致性双端强化
- 训练端:针对互联网视频中稀缺的物理难例(刚体碰撞、流体流动、柔性形变等)进行强化,让模型学习物体状态变化与运动结果之间的对应关系。
- 推理端:借助 TTT 在线自适应机制,面对训练数据未完全覆盖的新场景、新材质时,模型可根据当前环境在线适配,保证运动轨迹、物体交互、场景演化符合现实因果逻辑。
HiDream-O1-World项目地址
- 项目官网:https://yanghb22-fdu.github.io/DreamWorld/
HiDream-O1-World核心功能
表格
| 功能 | 描述 |
|---|---|
| 世界漫游 | 用户自定义相机轨迹,以第一或第三人称视角自由探索生成的 3D 场景 |
| 实时编辑 | 对场景中的物体、环境进行实时修改和调整 |
| 物理交互 | 与场景中的物体进行碰撞、推动等交互,响应符合物理规律 |
| 多模态操控 | 支持文本描述、图像输入、交互指令等多种方式驱动生成与操控 |
HiDream-O1-World应用场景
表格
| 场景 | 具体说明 |
|---|---|
| AI 互动影游 | 角色、环境与剧情可在运行中实时生成,观众可探索背景街道、改变人物行动,影视内容获得更高状态自由度 |
| 游戏开发 | 替代部分游戏引擎、3D 软件、仿真平台的工作,降低开放世界游戏的制作成本 |
| 影视预演 | 根据剧本描述快速生成分镜画面,辅助叙事可视化与前期创作规划 |
| 虚拟仿真 | 构建物理一致、可长时推演的虚拟环境,用于训练、测试与模拟 |
| 空间设计 | 设计师可漫游生成的室内/室外场景,实时调整布局与材质 |
最后想说
HiDream-O1-World 是一款基于 UiT 原生全模态架构和 Geometry-then-Appearance 两阶段框架的交互式世界模型,通过统一 Token 空间、3D 几何先验与物理一致性强化,实现了可漫游、可编辑、可交互且符合真实物理规律的动态世界生成。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



