UniWorld-View – 兔展智能联合北京大学团队研发的视觉世界模型

UniWorld-View是兔展智能联合北京大学团队研发的视觉世界模型,专注于通过单张图像或视频生成高精度可控的新视角内容,解决”仅凭有限视角推断未拍摄空间”的难题。统一架构的视觉生成模型,能实现单图3D生成与视频4D生成的无缝衔接,无需依赖多视角输入即可完成空间一致性重建。

UniWorld-View - 兔展智能联合北京大学团队研发的视觉世界模型

UniWorld-View核心特点

1. 统一任务架构

  • 单模型覆盖多场景
    同一套代码与参数处理单图新视角合成、动态视频视角扩展、4D场景重建等任务,避免传统方案中不同任务需独立模型的割裂问题。
  • 几何-外观双流协同
    突破”生成内容漂移”瓶颈,确保视角切换时空间结构、遮挡关系与物体位置严格对齐,支持360°环绕等大基线视角变换。

2. 真实场景适配性

  • 抗遮挡与伪影修复
    针对点云渲染常见的”前景背景撕裂”和”背面漏光”问题,通过遮挡感知点云渲染技术自动识别并修补错误区域。
  • 动态场景支持
    不仅处理静态物体,还能对含运动目标的视频生成连贯的新视角序列(如行人走动、车辆行驶)。

UniWorld-View技术原理

1. 双分支条件注入机制

  • 几何流(构图控制)
    将点云渲染图与遮挡掩码(mask)编码后注入潜变量,强制生成内容贴合3D结构,解决相机位姿偏移导致的形变问题。
  • 外观流(细节生成)
    通过自研Ref-DiT模块实现跨注意力机制——以目标视角特征为Query,源视频特征为Key/Value,让模型自主从原视频中”检索”缺失纹理,连点云伪影造成的模糊区域也能修复

2. 4D重建解耦策略

  • 分阶段时空建模
    • 静态定妆照:冻结时间轴,生成第一帧的环绕视图作为外观锚点。
    • 动态多视角合成:固定机位生成同步视频流,各视角首帧用”定妆照”对齐,通过迭代补全自遮挡区域。
  • 动态点云优化
    将生成的多视角视频输入4D高斯溅射(4DGS)算法,输出可自由漫游的时序一致3D场景

UniWorld-View关键优势

1. 精度与效率平衡

  • 大基线视角稳定性
    在相机位移较大时(如从正脸到后脑勺),几何误差比ViewCrafter、英伟达GEN3C等方案降低35%以上,避免传统生成式方法”转大角度失控”的问题。
  • 端到端流程简化
    单目视频输入即可完成4D重建,省去多视角采集与手动标注环节,将传统需数小时的重建流程压缩至分钟级。

2. 工程落地友好性

  • 国产算力适配
    已完成华为昇腾芯片全栈优化,可在国产硬件上高效运行推理任务。
  • 开源生态支持
    模型代码与权重通过GitHub开源,提供标准化API接口,便于开发者二次集成。

UniWorld-View核心功能

1. 新视角合成

  • 单图3D化
    输入一张产品照片,生成任意角度的展示图,保留材质细节与光影一致性(如皮革反光、金属拉丝纹理)。
  • 视频视角扩展
    对随手拍摄的短视频,按指定轨迹生成新机位画面(推拉摇移/环绕拍摄),保持动态物体运动连贯性

2. 4D场景重建

  • 时空一致性建模
    从单段视频重建可交互的动态3D场景,支持在虚拟环境中自由调整观察角度与时间点。
  • 缺失区域智能补全
    自动修复因遮挡导致的几何空洞(如被手遮挡的物体背面),无需人工干预

UniWorld-View项目地址

  • GitHub仓库:https://github.com/PKU-YuanGroup/UniWorld-View
  • HuggingFace模型库:https://huggingface.co/Drexubery/UniView

UniWorld-View应用场景

1. 电商与内容生产

  • 商品展示升级
    将普通产品图转化为360°可交互展示,提升转化率15%-20%;动态视频视角扩展用于生成TikTok种草视频,单条制作周期从3天缩短至40分钟
  • 虚拟试穿/试用
    结合用户上传的单张照片,生成多角度穿戴效果,避免实物拍摄成本

2. 工业与政务数字化

  • 工业巡检模拟
    用单视角监控视频重建设备3D模型,辅助远程故障诊断(如识别管道隐蔽处的锈蚀)。
  • 城市数字孪生
    基于街景视频生成可漫游的4D城市模型,用于规划方案可视化应急疏散路径模拟

3. 人机交互革新

  • SkillsUI交互底座
    作为兔展智能”意图界面(IUI)”的核心组件,将用户自然语言指令(如”从后方看这个零件”)实时转化为可操作的3D视图,实现”边聊边办”。
  • AR/VR内容生成
    为元宇宙场景快速提供物理一致的动态内容,降低3D资产制作门槛。

UniWorld-View将视觉生成从”随机出图”推进到”空间可控”阶段,通过几何与外观的双流解耦设计,解决了大基线视角合成中的结构漂移问题。打通了从单目视频到4D场景的实用化路径,使中小企业也能低成本获得专业级空间重建能力。当前已集成至兔展智能的RabbitVis设计工具链,未来将向自动驾驶仿真、医疗影像分析等专业领域延伸。企业应用时需注意输入素材的清晰度与光照一致性,避免因原始数据质量导致重建失真。

© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...