H3‑World 是腾讯、新加坡国立大学、香港理工大学联合推出的交互式世界模型,依托 MiniMax‑H3 视频生成底座完成轻量改造,可接收键盘类游戏操作输入,输出角色与相机运动可控的连续视频画面arXiv。这套方案不搭建独立动作网络,将按键动作转译为简短文本指令,把指令和对应时段的视频隐变量做绑定对齐,借助 rank‑32 规格 LoRA 完成微调训练,仅少量可训练参数即可实现时序精准的画面控制,能够在奇幻、都市、荒漠等完全不同的视觉环境中完成角色移动、镜头推拉摇移等交互生成任务,项目配套公开项目页面、论文文档与开源代码仓库,供开发者开展二次实验与研究验证。

H3‑World特点
控制逻辑依托模型原有语言通路实现,不新增专门用于动作解析的独立神经网络模块,主干模型权重保持冻结状态,仅更新少量 LoRA 参数。
时序粒度控制精细,不同时间节点可以下发完全不同的动作指令,各段动作只作用于对应视频片段,不会出现动作指令跨时间片段干扰画面内容的现象arXiv。
支持动作组合泛化,训练阶段没有见过的动作搭配,只要拆分后的基础单元属于训练样本覆盖范围,模型也可以输出连贯合理的运动画面央广网。
适配多元初始场景,输入仅需要一张起始画面,无论是第一人称、第三人称视角,室内空间、开放户外,幻想题材、现代都市风格都可以承接交互控制指令arXiv。
训练数据规模要求低,仅使用八千条游戏玩法片段即可完成适配训练,不需要海量多场景交互数据集。
H3‑World技术原理
整体以 MiniMax‑H3 预训练视频生成模型作为基础底座,原始模型本身具备文本驱动画面运动的基础能力。外部传入的键盘按键信号,逐帧转换成描述角色位移、相机转动的自然语言短句,动作文本 token 和视频视觉隐变量拼接成完整序列送入模型内部计算。
引入定向注意力掩码路由机制,每一条动作文本指令只能访问绑定的对应时段视频隐变量,切断指令对其他时间片段视觉 token 的信息通路,规避控制信号泄露问题,视频侧隐变量保留原有双向注意力链路,保障画面运动的连续性。
采用 rank‑32 的低秩 LoRA,仅对自注意力投影层做局部微调,绝大部分主干参数维持预训练状态,训练过程优化文本指令与画面运动之间的映射关系,把抽象按键操作转化成时序对齐的视频动态结果。
H3‑World功能
角色运动控制,接收 WASD 类按键信号,完成角色前进、后退、横向平移,在保持人物形象不变前提下输出连贯位移画面。
相机视角调控,接收对应按键指令,实现镜头平移、俯仰转动、快速摇镜,完成第一人称、第三人称视角的镜头动态变化。
时序分段动作执行,同一段视频的不同时间区间,分别加载互不相同的角色、相机动作,完成分段变化的交互视频生成。
跨场景动作泛化,基于单张起始画面,在未参与训练的全新场景中,复现经过学习的基础角色与镜头运动。
交互视频样本输出,把连续按键操作完整转成时序可控视频片段,产出可用于仿真、原型演示的连续视觉素材。
H3-World项目地址
- 项目官网:https://danzer1xxxxchan.github.io/H3-World/
- GitHub仓库:https://github.com/Danzer1xxxxChan/H3-World
H3‑World应用场景
游戏原型快速验证,美术团队输入场景初始帧,通过按键交互快速预览角色移动、镜头运镜效果,用于关卡、镜头脚本前期原型推演。
具身智能仿真研究,作为视觉仿真环境,给智能体提供可交互视觉反馈,开展具身感知与行为策略的相关实验。
影视动画分镜预演,导入概念原画作为起始画面,通过按键操控镜头运动,快速产出分镜动态预览,辅助镜头方案评估。
生成式视频技术研发,开发者基于开源代码开展二次改造,研究文本、外设信号驱动视频生成的技术路径,复现论文实验结果。
数字内容创作实验,面向开放世界类 AI 内容,探索用户实时输入直接驱动虚拟世界画面生成的实现方式。
H3‑World使用教程
环境准备:从项目开源仓库下载项目代码、模型权重文件与 LoRA 适配文件,完成运行环境配置,部署 MiniMax‑H3 基础模型。项目依赖视频生成框架、深度学习计算库,确认硬件显存满足大模型运行条件。
输入素材准备:准备单张起始场景图像作为生成初始帧,图片包含完整场景、角色主体,画面风格无强制约束。整理动作序列,录入按键操作序列,也可以直接输入对应文本动作描述,定义每一个时间区间的角色、相机行为。
启动推理流程:加载基础模型与配套 LoRA 适配权重,开启定向注意力掩码模块,传入初始图像与完整动作序列。系统把按键序列转换为逐段文本指令,文本与视觉隐变量完成绑定对齐,执行迭代推理,输出连续视频片段。
效果核验与参数调整:查看生成视频,核对角色位移轨迹、相机运动轨迹是否匹配输入动作序列。出现画面抖动、动作错位,调整注意力掩码配置、动作文本描述细节,重新发起推理。
结果导出与二次复用:把推理产出的连续视频帧导出为视频文件。研究人员可以导出中间层的文本 token、视频隐变量,用于后续技术分析。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



