MiniMax H3 Max – 5秒视频不到3秒生成,AI视频跨过实时门槛

MiniMax H3 Max是MiniMax H3的”加速版”。MiniMax开源了H3的模型权重,fal拿到这个基础后,用自有数据重新训练,同时针对自家推理基础设施做了深度适配。结果是:画面更听提示词的话,美学表现更耐看,生成速度快到能改变工作流形态。

8月31日,H3 Max 768P和H3 Max 480P正式接入MiniMax开放平台和MiniMax Design,面向开发者和创作者开放API调用。

MiniMax H3 Max - 5秒视频不到3秒生成,AI视频跨过实时门槛


MiniMax H3 Max核心特点

生成速度快过播放

fal公布的数据显示,5秒、768p视频的后端推理时间约2.5秒,15秒视频约需15秒。这意味着短片还没播完,下一段就已经生成完毕。fal声称其吞吐量约为MiniMax H3官方端点的35倍。

提示词遵循更强

后训练阶段加入了大量新数据,重点优化了模型对复杂提示词的理解能力。用户描述的主体、动作、镜头、声音,模型能更精准地还原。

画面美学提升

fal在优化过程中保留了内部偏好评估机制——只有速度优化没有牺牲画面质量时,才会被采纳。在Artificial Analysis图生视频榜单和Design Arena图生视频榜单中,H3 Max均位于榜首。

原生立体声音频

生成的视频自带同步音频,包括对白、音效、环境音和音乐,不需要后期配音。

价格更低

768p分辨率下,首发折扣价为每分钟2.40美元(标准价4.80美元),比MiniMax H3同分辨率便宜60%。


MiniMax H3 Max技术原理

后训练(Post-training)

fal在H3开放权重的基础上,用新的数据集继续训练模型。这种”二次训练”让模型更贴合实际使用场景,而非仅仅复现基础训练时的分布。

可验证强化学习

fal采用可验证强化学习继续优化模型的指令遵循和画面表现。模型在训练过程中会收到关于输出质量的明确反馈,从而学会生成更符合用户意图的结果。

推理系统协同优化

H3 Max的速度不是单纯靠模型压缩或量化实现的。fal将模型训练与自有推理栈(基于NVIDIA GB200 NVL72系统)进行了协同设计,从模型架构到硬件调度都做了针对性适配。

分辨率取舍

H3 Max目前仅支持480p和768p,放弃了原版H3的2K能力。这种取舍换来了速度上的大幅提升——同样的推理资源,处理768p的帧数远少于2K,延迟自然降低。


MiniMax H3 Max功能

文生视频

输入文字描述,直接生成5至15秒的完整音视频片段。提示词可拆解为主体、动作、镜头、声音四个维度,支持长达数千字符的详细描述。

图生视频

上传一张静态图片作为首帧,模型根据图片内容和文字指令生成动态视频。适合将产品照片、概念设计图转化为动态展示。

多分辨率输出

支持480p和768p两种分辨率,帧率24fps,时长5至15秒,自带32kHz立体声音频。

快速迭代

由于生成速度极快,创作者可以在短时间内生成大量变体,比较不同提示词的效果,再决定哪个方向值得深入打磨。


MiniMax H3 Max应用场景

表格

场景说明
社交媒体内容快速生成抖音、Instagram、TikTok风格的竖屏短视频,9:16比例原生支持
广告创意测试同一产品概念生成多个版本,快速A/B测试视觉方向
电商产品展示将静态产品图转化为动态展示视频,突出卖点
分镜预演导演和摄影师用自然语言快速生成镜头预演,验证构图和运镜
互动原型游戏和UI设计师快速生成动态界面或角色动画原型
AI直播实验生成速度快过播放速度,使得连续生成、实时拼接的直播流成为可能(已有开发者做出概念验证)
概念探索创意团队在短时间内产出大量视觉概念,从中筛选最强方向

与原版MiniMax H3的区别

表格

对比项MiniMax H3 MaxMiniMax H3
出品方fal ResearchMiniMax
分辨率480p、768p最高2K
生成速度5秒视频<3秒未公布具体数据,明显更慢
参考素材控制基础文生/图生支持最多9张图、3个视频、3个音频参考
视频编辑不支持支持局部替换、修改物体、更换背景等
价格(768p)$2.40-$4.80/分钟$4.80/分钟
权重开放计划发布,尚未推出已开源(社区许可证)

MiniMax H3 Max把视频生成从”提交后等几分钟”变成了”改完提示词立刻看到结果”。这种即时反馈循环,对创意工作流的改变远比单点速度纪录更深远。

© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...