MAGI-2 Preview是北京AI视频生成创企Sand.ai(清华系团队)正式发布并开源的统一音视频生成模型。该模型总参数约114B(千亿级),采用MoE(混合专家)架构,单次前向计算仅激活约6B参数,是全球首个千亿级开源MoE视频生成模型。发布当天,模型代码与权重全部开源。在 Artificial Analysis Image to Video 视频生成榜单中排名第六,仅用6B激活参数即接近闭源第一梯队水平。
该模型延续了 Sand.ai 在 daVinci-MagiHuman(15B单流音视频模型,2026年3月开源)中验证的技术路线,将参数规模从百亿级跃升至千亿级,同时保持极低的推理成本——蒸馏后生成10秒1080P视频的推理成本仅约0.5元人民币,约为行业主流模型的十分之一。

MAGI-2 Preview核心特点
1. 千亿参数、极低激活
- 总参数114B,但每次前向仅激活约6B,实现了“大容量、低成本”的平衡。
- 在 Artificial Analysis 榜单上,以6B激活参数达到了接近闭源第一梯队的生成质量。
2. 音视频统一生成
- 不是”先生成视频再配音”的流水线模式,而是声音、口型、表情、动作和镜头节奏从生成开始便被共同建模。
- 支持音画同步、 lip-sync(唇形对齐)、自然语音与表情协调。
3. 单流架构
- 文本、视频和音频进入同一个Transformer,在每一层自注意力中直接交换信息。
- 告别传统的多流结构、跨注意力模块或模态专用融合分支。
4. 完全开源
- 代码、权重、推理框架全部开放,开发者可自由使用、微调和商用。
- 配套开源了高性能MoE算子库 MagiMoE。
5. 极致推理性价比
- 蒸馏版在8卡H100上生成10秒1080P视频仅需约0.5元。
- 每秒生成成本约0.05元,为行业主流模型的十分之一。
MAGI-2 Preview技术原理
1. 单流Transformer架构
- 文本、视频和音频被放进同一个上下文序列,在每一层 self-attention 中直接交互。
- 统一主干减少了多套模型串联带来的接口、延迟与维护成本。
- 声音、口型、表情、动作和镜头节奏从生成开始便被共同建模,更适合处理细微的音画对应关系。
2. Multi-Head MoE 机制
- 模型将3072维隐藏表示拆分为12个256维Head。
- 在36层主体网络中采用 Multi-Head MoE。
- 每个Head拥有256个专家,每次选择其中6个。
- 一个Token在12个Head中合计激活72个小专家,在扩大模型总容量的同时将单次计算的激活参数量控制在约6B。
3. 共享专家与模态专属专家
- 模型内部设有共享专家处理三种模态的共性特征(如场景语义、运动趋势)。
- 同时为文本、视频和音频保留了各自的模态专属专家,确保各模态的精细化建模能力。
4. 路由策略与Head Parallel
- 针对MoE模型规模扩大后带来的跨设备通信问题,引入跨节点Head Parallel策略。
- 将路由粒度与通信效率进行联合优化,避免数千个专家在分布式训练/推理中出现通信瓶颈。
5. 高性能算子库 MagiMoE
- Sand.ai 自研的高性能 MoE kernel 库,覆盖路由、专家排序与专家计算的完整链路。
- 将原本分散的步骤合并执行,减少kernel launch开销与内存拷贝。
6. 工程优化
- 混合精度训练/推理:降低显存占用,提升吞吐。
- 激活重计算:以少量重计算换取大幅显存节省,支撑千亿参数训练。
- 蒸馏:提供蒸馏版本,进一步降低部署门槛和推理成本。
7. 统一音视频扩散
- 在扩散模型框架下统一处理音视频生成任务,配合MoE架构实现容量扩展。
MAGI-2 Preview核心优势
1. 视频生成Scaling新范式
- 证明了视频模型的Scaling不能简单照搬LLM的稠密模型路线,MoE稀疏激活是视频生成领域的有效扩展路径。
- 在仅激活6B参数的条件下逼近第一梯队效果,为行业提供了”千亿容量、百亿成本”的新选择。
2. 音画原生同步
- 相比”先生成画面→再配音/对口型”的两阶段方案,单流架构从源头消除了音画脱节问题。
- 唇形、表情、肢体动作与语音在生成过程中联合优化,效果更自然。
3. 极致性价比
- 每秒生成成本约0.05元,为行业主流的十分之一。
- 大幅降低了中小团队和个人创作者使用高质量视频生成的门槛。
4. 开源生态价值
- 全球首个千亿级MoE视频生成模型完全开源,填补了开源社区在该规模上的空白。
- 配套开源MagiMoE算子库,为后续研究者和开发者提供了完整的工程参考。
5. 生成质量全面
- 支持AI漫剧(声台形表俱全)、长镜头运镜、商业广告级画面。
- 视角跟随人物动作切换自如,运镜、对焦和人物表现可与闭源第一梯队同台竞争。
MAGI-2-preview项目地址
- 项目官网:https://sand.ai/blog/magi-2-preview
- GitHub仓库:https://github.com/SandAI-org/MAGI-2-preview
MAGI-2 Preview应用场景
1. AI短剧与漫剧制作
- 一键生成带配音、口型对齐、表情自然的短剧片段。
- 支持多角色对话场景,声音与画面同步生成,无需后期配音对口型。
2. 商业广告与营销视频
- 快速生成产品展示、品牌宣传等商业级视频。
- 运镜、对焦、光影表现达到商用标准,大幅缩短制作周期。
3. 数字人与虚拟直播
- 生成自然语音、逼真表情和协调肢体动作的数字人视频。
- 适用于虚拟主播、在线教育讲师、客服数字人等场景。
4. 影视预演与概念验证
- 导演/编剧可快速将剧本转化为带声音的动态预览。
- 长镜头生成能力支持连续运镜,辅助分镜设计和拍摄规划。
5. 社交媒体与内容创作
- 个人创作者可低成本批量生成短视频内容。
- 支持多语言语音生成,便于跨平台、跨地区内容分发。
6. 游戏与交互内容
- 为游戏过场动画、NPC对话等生成带语音的动态画面。
- 音画同步特性使角色表演更加生动自然。
7. 学术研究与模型迭代
- 作为开源基座,供研究者探索视频生成Scaling、MoE路由优化、多模态融合等前沿方向。
- MagiMoE算子库可作为分布式MoE系统工程研究的参考实现。
最后想说
MAGI-2 Preview用MoE稀疏激活架构为视频生成模型找到了一条”容量可扩展、成本可控制”的Scaling新路。它证明了视频生成领域无需盲目堆叠稠密参数,通过Multi-Head MoE + 单流架构的组合,可以在千亿参数容量下仅激活6B参数即达到顶级生成质量。同时,音视频原生统一生成消除了传统流水线中音画脱节的顽疾,而完全开源的策略则为整个社区提供了可复现、可迭代的千亿级视频生成基座,有望推动AI视频生成从”少数巨头的闭源能力”走向”全行业可及的开源基础设施”。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



