Atlas – World Labs推出的新一代空间智能世界模型

Atlas 是李飞飞创办的 World Labs 推出的新一代空间智能世界模型,也是全球首个原生打通文本、图像、视频与 3D 数据的多模态世界模型。模型从零开始完成全量预训练,采用多模态自回归扩散 Transformer 架构,将所有输入信息融合到统一的共享空间上下文当中,在三维空间逻辑下完成内容生成、场景重建与时空模拟。目前模型面向少数合作伙伴开放早期测试,未来将作为 World Labs 旗下 3D 内容产品 Marble 的底层技术底座。

Atlas - World Labs推出的新一代空间智能世界模型

Atlas特点

模型将相机位姿作为原生输入参数,支持像素级精准的镜头控制。只需 1 到 6 张参考图片搭配指定的镜头轨迹,就能生成最高 1440p 分辨率、最长 1 分钟的视频片段,画面空间几何关系保持一致,运镜过程平滑稳定,不用依赖模糊的文字描述调整镜头效果。

仅需单张或少量图片即可重建完整三维场景。模型会自主推测镜头视野之外的空间内容,补充画面外的场景结构,输入图片数量越多,重建的真实度越高。重建结果既可以输出任意视角的图像帧,也可以直接生成点云、3D 高斯泼溅格式的立体数据。

支持时空联合建模,可基于已有视频完成空间与时间的双重推演。可以对原视频重新构图、切换视角,也可以延续时间轴生成后续的画面内容,让静态的视频素材变成可交互的三维空间片段。

模型性能遵循缩放定律,训练计算量提升的同时,生成质量、空间一致性、推理精度都会同步稳步提升,后续可通过持续扩容迭代解锁更强的能力。

Atlas技术原理

底层采用多模态自回归扩散 Transformer 架构,文本、图像、视频、3D 数据与相机位姿参数,会统一转换为特征序列输入同一套主干网络,最终映射到同一个共享空间上下文当中。模型不需要拆分独立的图像、视频、3D 处理模块,所有模态的信息在三维空间逻辑下完成统一编码与解码。

预训练阶段从零开始引入全模态数据,让模型从基础层面学习物理空间规则、物体空间关系、光影变化规律与时间演化逻辑。不同于在现有图文模型上嫁接视频或 3D 能力的方案,这套训练方式让空间逻辑成为模型的原生能力,生成与重建的内容都能保持稳定的三维一致性。

生成过程基于空间上下文自回归推演,每生成一帧画面都会参考已有的所有空间信息,确保新生成的内容和已见场景在位置、比例、光影上完全对齐。模型同时内置扩散生成机制,在保证空间结构准确的前提下,提升画面的细节丰富度与真实感。

Atlas项目地址

  • 项目官网:https://www.worldlabs.ai/blog/atlas

Atlas功能

相机控制生成,输入参考图片与指定的相机位姿、运动轨迹,生成对应视角的图像与视频片段,支持运镜速度、角度、焦距的精准调节,输出最高 1440p、最长 1 分钟的视频内容。

空间场景重建,基于 1 到数十张真实场景照片,重建完整的三维空间场景。可输出任意新视角的图像画面,也可导出点云、3D 高斯泼溅等格式的立体数据,直接对接后续的 3D 工作流程。

时空模拟推演,基于输入的视频素材,对空间与时间做联合建模。可对原视频进行重新构图、切换镜头视角,也可以沿时间轴继续推演后续画面,模拟场景的连续变化。

文生图与全景生成,根据文字描述生成对应场景的图像内容,支持生成 360 度全景场景,也可结合参考图完成风格融合与内容拓展。

Atlas应用场景

影视内容制作,用于快速生成镜头预演、虚拟场景片段、视角转场素材,减少实景拍摄与三维制作的成本,缩短创意迭代的周期。

游戏开发流程,用少量参考图快速搭建可交互的 3D 场景,生成游戏环境原型,也可批量产出过场动画、场景镜头素材,提升内容生产效率。

机器人仿真训练,通过真实场景照片快速构建虚拟训练环境,让机械臂、移动机器人在仿真空间中完成动作规划、路径测试,降低实体训练的成本与风险。

数字孪生与空间测绘,针对实体场景快速重建三维数字孪生,用于城市规划、园区巡检、建筑可视化等场景,支撑空间数据的展示与分析。

创意设计与建筑可视化,将设计草图、概念图转化为可漫游的三维空间,快速验证设计方案的空间效果,输出不同视角的展示素材。

Atlas同类产品对比

表格

对比维度Atlas(World Labs)Google Genie 3
研发主体World Labs(李飞飞团队)Google DeepMind
模型定位统一多模态世界模型,原生支持相机位姿输入,兼顾可控视频生成、稀疏 3D 重建、机器人 Real‑to‑Sim 仿真交互式世界生成模型,主打实时可交互虚拟场景生成
核心特色自回归扩散 Transformer 架构,直接接收相机位姿参数;少量图片即可做 3D 场景重建,输出点云、高斯泼溅 3D 数据,长时 1440p 可控视频输出,面向机器人仿真高帧率交互式场景渲染,侧重游戏化可漫游虚拟世界,支持用户实时交互操作,偏向内容娱乐场景
适用场景影视虚拟运镜、稀疏视角 3D 重建、机器人仿真训练、真实场景转虚拟空间、VFX 特效制作交互式游戏场景、虚拟漫游内容、实时互动视频体验、AIGC 游戏资产生成
© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...