LTX-2.5 – LTX发布的新一代开源视频生成与世界模型

LTX-2.5开放世界模型公司LTX发布的新一代开源视频生成与世界模型。该模型以22B参数的扩散Transformer(DiT)作为主生成器,以LTX-2.3为基础进行近乎全面的管道重构,在生成速度、画质保真度、多镜头连贯性和指令遵循能力上实现了代际跃升。在2张英伟达GB200芯片的自托管配置下,LTX-2.5生成10秒720P视频仅需6.8秒,速度快于实时播放速度,约为快手可灵Kling 3.0 Pro(398秒)的1/58。模型通过Hugging Face、ComfyUI原生集成和LTX API三种渠道开放获取,年度经常性收入(ARR)低于1000万美元的组织可免费使用并允许微调,累计下载量已突破3300万次。

LTX-2.5 - LTX发布的新一代开源视频生成与世界模型

LTX-2.5核心特点

  • 超实时生成速度:在2张GB200上6.8秒生成10秒720P视频,经托管API以1080P渲染同一任务耗时23.7秒,官方端到端实测速度远超Google Gemini Omni Flash(52秒)、xAI Grok 1.5(63秒)、Google Veo 3.1(70秒/8秒片段)、字节Seedance 2.5(317秒)和快手可灵3.0 Pro(398秒)。
  • 扩散保真渲染(Diffusion Fidelity Rendering):首创”先结构后细节”的两阶段渲染策略,根据场景复杂度动态分配计算资源——高运动、细纹理和难还原区域获得更多算力预算,静态简单场景自动节省资源,在保障像素级画质的同时提升整体生成效率。
  • 原生多镜头生成:单次推理即可产出多个连续剪辑镜头,在镜头切换间保持角色形象、环境氛围、光照条件、声音和整体风格的高度一致性,从根本上解决AI视频创作中”主角换脸”的痛点。
  • 全新扩散视频解码器(DiffVAE):与传统VAE视频解码器相辅相成,通过提供第二条解码路径提升最终渲染视频的质量,重点改善人脸、纹理、画面内文字和高运动场景的伪影问题。
  • 开放权重可微调:22B参数权重完全开源,支持本地部署与领域微调,敏感IP数据无需经过第三方云服务。LTX-2.3训练的LoRA大部分可直接复用。
  • 原生集成ComfyUI:与ComfyUI达成战略合作实现零日集成,提供文生视频、图生视频、首尾帧插值三种开箱即用的原生工作流。
  • 广泛硬件适配:针对NVIDIA RTX GPU、DGX Spark进行联合优化,性能提升2倍、内存占用降低40%;蒸馏版可在消费级显卡甚至Mac上本地运行。

LTX-2.5技术原理

  • 22B参数DiT主生成器:采用大规模扩散Transformer架构作为核心生成引擎,提供Dev完整版(可训练/微调、最高质量)和Distilled蒸馏版(固定8步推理、CFG=1、极致速度)两个版本,满足不同场景的质量-速度权衡需求。
  • 定制Gemma 4 12B文本编码器:基于Gemma 4 E2B和定制Gemma 4 12B构建提示词处理模块,能在复杂提示词中准确保留多个主体、动作、光影和相机方向等细粒度语义信息。
  • 提示词增强器(Prompt Enhancer):内置轻量级模型,可将用户输入的简短提示词自动扩展为包含镜头景别、场景光照、角色动作、相机运动和音频描述的详细电影级指令,大幅降低提示词工程门槛。
  • 扩散保真渲染(DFR)两阶段策略:第一阶段在8×时间压缩的潜空间中构建运动、构图和镜头框架,并自适应生成高保真关键帧;第二阶段从结构和关键帧共同扩散渲染出最终视频,以像素级精度解析纹理、材质和面部细节。
  • 扩散视频解码器(DiffVAE):与传统VAE视频解码器相辅相成,通过提供第二条解码路径提升最终渲染视频的质量。在人脸、纹理、画面内文字和高运动场景下显著减少伪影,改善传统高压缩率方案容易丢失细节的问题。
  • 原生多镜头生成:将完整多镜头序列作为单一输出进行渲染,在模型层面保证跨剪辑镜头的角色、场景和声音一致性,无需后期拼接。
  • Audio VAE独立音频编码:独立的音频潜空间编码器,负责将视频内容映射为匹配的音频表征,实现画面与声音的同步生成,支持48kHz采样率。
  • 时长预测头(Duration Head):部署在扩散过程之前的预测模块,通过理解提示词中的动作语义,自动推断并输出最合适的视频时长,使模型具备对叙事节奏的初步感知能力。
  • NVFP4量化与蒸馏优化:提供Blackwell架构专属的NVFP4量化版本,在同等质量下实现更快推理;与英伟达联合优化的蒸馏模型可在RTX显卡上以更低显存运行。
  • IC-LoRA可控生成:支持Canny边缘、Depth深度图、Pose姿态骨架三种控制模式的条件LoRA,实现从”盲目抽卡”到”实拍骨架+AI风格化覆膜”的可控生产转变。

LTX-2.5主要功能

  • 文生视频(T2V):根据文本提示词直接生成视频,支持空间放大获得更高分辨率,可选使用提示词增强器自动扩展指令。
  • 图生视频(I2V):根据输入图像生成视频,保持首帧视觉内容的基础上进行动态演绎。
  • 首尾帧视频(FLF2V):在首帧图像与末帧图像之间进行插值生成,实现精确的起止状态控制。
  • 原生多镜头生成:一次生成即可产出多个连接式镜头,在镜头切换中保持角色、环境、光照、声音和风格一致。
  • 同步音频生成:视频与48kHz音频同步生成,自带声码器,无需额外配音。
  • 生成式视频编辑:对现有素材进行优化修正,无需从头制作,保留原始运动轨迹与空间结构。
  • 原生4K HDR输出:支持最高4K(3840×2160)分辨率、最高50 FPS帧率,提供RAW/HDR/EXR无损格式,可直接接入专业调色、特效合成与后期剪辑管线。
  • 自动时长预测:根据提示词中的动作描述自动判断视频最佳时长。
  • 精确视频编辑:配合IC-LoRA(Canny/Depth/Pose)实现构图锁定、动作锁定和风格化覆膜。

LTX-2.5项目地址

  • 项目官网:https://ltx.io/model/ltx-2-5

LTX-2.5应用场景

  • 影视预演与虚拟制作:导演可在拍摄现场即时获得接近后期效果的预览,大幅缩短反馈周期。原生4K HDR与RAW/EXR无损输出可直接接入ACES工作流和专业调色管线,满足院线及流媒体级别的后期制作需求。
  • AI短剧与漫剧制作:原生多镜头生成一次性输出连贯叙事分镜,精确视频编辑支持”真人实拍动作骨架+AI角色替换与风格化覆膜”,从根本上解决镜头连续性与动作可控性两大核心难题。
  • 广告与品牌内容:快速迭代高质量商业视频,利用提示词增强器降低提示词工程门槛,蒸馏版支持快速预览、完整版输出最终成片,兼顾效率与品质。10秒720P带音频视频成本约0.9美元(约6元人民币)。
  • 短视频与自媒体:极低的生成成本和极快的出片速度使”批量抽卡”变得可行,适合带货视频、产品展示、创意素材的快速产出。
  • 物理AI与机器人仿真:提供针对非电影领域数据微调的Physical AI Checkpoint预训练检查点,为具身智能团队提供世界模型基础,帮助机器人系统感知物理世界和运动规律。
  • 实时交互与边缘计算:与Asteria、Reactor等平台合作推动低延迟推理在交互式头像、实时机器人等领域的应用;蒸馏版可在RTX显卡和Mac上本地运行,支持数据不出域的隐私场景。
  • 计算摄影与特效:支持计算摄影降噪、水模拟特效、动画关键帧插值等非电影类应用。
  • 企业私有化部署:开放权重+本地部署能力使企业可在自有硬件上完成从验证到生产的全流程,敏感IP无需经过第三方云服务。

LTX-2.5部署与接入方式

表格

方式适用场景说明
Hugging Face下载本地部署、研究微调需申请gated仓库访问权限,接受许可协议
ComfyUI原生工作流创作者快速上手模板库搜索”LTX-2.5″一键下载运行
LTX托管API云端调用、产品集成Fast档$0.09/秒,Pro档$0.12/秒
Python SDK开发者集成ltx-pipelines库,支持Dev/Distilled版本
NVFP4量化版Blackwell GPU加速同质量下更快推理
INT8-convrot量化版低显存本地运行仅限ComfyUI使用,8GB显存可尝试
版本选择建议:快速迭代用Distilled蒸馏版,最终出片用Dev完整版。帧数需满足num_frames % 8 == 1,分辨率需被32整除。
© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...