MiniMax H3 Max是MiniMax H3的”加速版”。MiniMax开源了H3的模型权重,fal拿到这个基础后,用自有数据重新训练,同时针对自家推理基础设施做了深度适配。结果是:画面更听提示词的话,美学表现更耐看,生成速度快到能改变工作流形态。
8月31日,H3 Max 768P和H3 Max 480P正式接入MiniMax开放平台和MiniMax Design,面向开发者和创作者开放API调用。

MiniMax H3 Max核心特点
生成速度快过播放
fal公布的数据显示,5秒、768p视频的后端推理时间约2.5秒,15秒视频约需15秒。这意味着短片还没播完,下一段就已经生成完毕。fal声称其吞吐量约为MiniMax H3官方端点的35倍。
提示词遵循更强
后训练阶段加入了大量新数据,重点优化了模型对复杂提示词的理解能力。用户描述的主体、动作、镜头、声音,模型能更精准地还原。
画面美学提升
fal在优化过程中保留了内部偏好评估机制——只有速度优化没有牺牲画面质量时,才会被采纳。在Artificial Analysis图生视频榜单和Design Arena图生视频榜单中,H3 Max均位于榜首。
原生立体声音频
生成的视频自带同步音频,包括对白、音效、环境音和音乐,不需要后期配音。
价格更低
768p分辨率下,首发折扣价为每分钟2.40美元(标准价4.80美元),比MiniMax H3同分辨率便宜60%。
MiniMax H3 Max技术原理
后训练(Post-training)
fal在H3开放权重的基础上,用新的数据集继续训练模型。这种”二次训练”让模型更贴合实际使用场景,而非仅仅复现基础训练时的分布。
可验证强化学习
fal采用可验证强化学习继续优化模型的指令遵循和画面表现。模型在训练过程中会收到关于输出质量的明确反馈,从而学会生成更符合用户意图的结果。
推理系统协同优化
H3 Max的速度不是单纯靠模型压缩或量化实现的。fal将模型训练与自有推理栈(基于NVIDIA GB200 NVL72系统)进行了协同设计,从模型架构到硬件调度都做了针对性适配。
分辨率取舍
H3 Max目前仅支持480p和768p,放弃了原版H3的2K能力。这种取舍换来了速度上的大幅提升——同样的推理资源,处理768p的帧数远少于2K,延迟自然降低。
MiniMax H3 Max功能
文生视频
输入文字描述,直接生成5至15秒的完整音视频片段。提示词可拆解为主体、动作、镜头、声音四个维度,支持长达数千字符的详细描述。
图生视频
上传一张静态图片作为首帧,模型根据图片内容和文字指令生成动态视频。适合将产品照片、概念设计图转化为动态展示。
多分辨率输出
支持480p和768p两种分辨率,帧率24fps,时长5至15秒,自带32kHz立体声音频。
快速迭代
由于生成速度极快,创作者可以在短时间内生成大量变体,比较不同提示词的效果,再决定哪个方向值得深入打磨。
MiniMax H3 Max应用场景
表格
| 场景 | 说明 |
|---|---|
| 社交媒体内容 | 快速生成抖音、Instagram、TikTok风格的竖屏短视频,9:16比例原生支持 |
| 广告创意测试 | 同一产品概念生成多个版本,快速A/B测试视觉方向 |
| 电商产品展示 | 将静态产品图转化为动态展示视频,突出卖点 |
| 分镜预演 | 导演和摄影师用自然语言快速生成镜头预演,验证构图和运镜 |
| 互动原型 | 游戏和UI设计师快速生成动态界面或角色动画原型 |
| AI直播实验 | 生成速度快过播放速度,使得连续生成、实时拼接的直播流成为可能(已有开发者做出概念验证) |
| 概念探索 | 创意团队在短时间内产出大量视觉概念,从中筛选最强方向 |
与原版MiniMax H3的区别
表格
| 对比项 | MiniMax H3 Max | MiniMax H3 |
|---|---|---|
| 出品方 | fal Research | MiniMax |
| 分辨率 | 480p、768p | 最高2K |
| 生成速度 | 5秒视频<3秒 | 未公布具体数据,明显更慢 |
| 参考素材控制 | 基础文生/图生 | 支持最多9张图、3个视频、3个音频参考 |
| 视频编辑 | 不支持 | 支持局部替换、修改物体、更换背景等 |
| 价格(768p) | $2.40-$4.80/分钟 | $4.80/分钟 |
| 权重开放 | 计划发布,尚未推出 | 已开源(社区许可证) |
MiniMax H3 Max把视频生成从”提交后等几分钟”变成了”改完提示词立刻看到结果”。这种即时反馈循环,对创意工作流的改变远比单点速度纪录更深远。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



