MiniMax Music 3.0 是MiniMax发布的最新一代开放权重、生产级全能音乐生成模型。它可以根据结构化的音乐描述和可选歌词,生成长达 5 分钟 的完整歌曲,涵盖前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏等完整结构。模型权重已开放,支持本地部署(如 ComfyUI)和官方 API 调用,输出为 32 kHz、16 位立体声音频。

MiniMax Music 3.0核心特点
- 完整长曲生成:突破传统 AI 音乐片段化的局限,可一次性生成结构连贯、长达 5 分钟的完整歌曲。
- 双输入精准控制:通过 结构化描述(Caption) 定义音乐风格、情绪、人声和编曲,通过 带段落标签的歌词(Lyrics) 控制歌曲结构(支持
[Intro]、[Verse]、[Chorus]、[Bridge]、[Instrumental]、[Outro]等标签)。 - 长程一致性:在长序列中保持音乐主题、节奏、人声特征和编曲推进的一致性,避免歌曲后半段偏离创作意图。
- 录音室级人声:全新声音渲染系统大幅减少了生成式人声中常见的高频”数字噪声”,提升旋律、发音、呼吸和多层和声的自然度。
- 商业化导向:专为面向发行的歌曲草稿创作而设计,提供清晰的副歌方向、紧凑的节奏和专业的制作人级质感。
- 开放权重:模型权重开放,开发者可在本地运行,完全控制每个参数。
MiniMax Music 3.0技术原理
MiniMax Music 3.0 采用 分层自回归架构,核心创新在于 Hidden State Fusion(隐藏状态融合),实现了从离散预测到连续声音渲染的跨越:
表格
| 组件 | 规模 | 职责 |
|---|---|---|
| 全局 LLM | 8B | 负责长程音乐结构理解(段落布局、主题发展) |
| 局部 LLM | 0.6B | 负责帧级声学细节(音色、发音、乐器连贯性) |
| Flow-Matching 模块 | 2.4B | 基于融合后的连续 Hidden States 进行音频潜空间合成 |
| Flow-VAE 解码器 | 123M | 将潜空间表征解码为最终音频 |
技术链路:全局与局部 LLM 融合特征 → Flow-Matching → VAE Hidden States → Flow-VAE Decoder → 最终音频。
这一设计的核心突破在于:传统方案将离散声学 token 直接送入解码器,而 Music 3.0 将语言模型的结构理解能力与声学模型的声音还原能力通过 连续表征 直接连接,在保持长程一致性的同时,进一步提升发音准确性、乐器连贯性和细节保真度。
此外,模型引入了 Structured Caption(结构化描述) 机制,将曲风、BPM、拍号、调性、情绪起伏、主辅乐器进入退出时机、演唱方式、和声编排、人声效果等抽象听感转化为可被模型精确执行的专业编曲框架。
MiniMax Music 3.0项目地址
- 项目官网:https://www.minimax.io/blog/minimax-music-3-0-next-generation-open-weights-production-ready-versatile-music-model
- GitHub仓库:https://github.com/MiniMax-AI/MiniMax-Music3
MiniMax Music 3.0主要功能
- 文本生成音乐:根据自然语言描述生成完整歌曲。
- 歌词驱动创作:结合结构化歌词与音乐描述,生成带人声的歌曲。
- 纯音乐/器乐生成:无需歌词,仅通过描述生成影视配乐、氛围音乐等。
- AI Cover(风格改编):上传参考音频,通过自然语言描述目标风格,AI 会重新生成编曲、人声和混音,实现整体风格改编(而非简单的声线替换)。
- 歌词生成与编辑:支持基于提示词自动生成歌词,或对已有歌词进行编辑优化。
- 多格式输出:支持 MP3、WAV、PCM 格式,采样率可选 16/24/32/44.1 kHz,比特率可选 32/64/128/256 kbps。
- Prompt 增强系统:内置模板库,可将用户的简单描述自动扩展为音乐逻辑完整、细节丰富的结构化指令,降低专业创作门槛。
MiniMax Music 3.0应用场景
表格
| 场景 | 说明 |
|---|---|
| 歌曲创作草稿(Demo) | 词曲作者、制作人快速将副歌构思或主歌旋律扩展为完整歌曲框架,验证商业潜力后再投入正式制作。 |
| A&R 风格对比 | 针对同一构思生成明亮/暗沉、流行/R&B/摇滚等不同风格版本,快速筛选最佳方向。 |
| 内容创作者配乐 | 为社交视频、播客、品牌项目快速生成适配的背景音乐或完整歌曲草稿。 |
| 影视配乐 | 根据场景描述生成匹配叙事情绪的古典管弦、极简主义、现代电子、氛围音乐等。 |
| 游戏配乐 | 生成振奋人心或氛围沉浸的游戏背景音乐,支持从极简到极燃的风格跨度。 |
| 广告与品牌片头 | 生成极简科技风格、脉冲合成器驱动的品牌片头音乐。 |
| 助眠与冥想 | 生成节奏极缓、旋律轻柔的摇篮曲、冥想音乐或自然声景(如雨声、白噪音)。 |
| 编曲调整 | 优化人声能量、Drop 段规模、私密感/振奋感/紧张感等制作参数。 |
使用方式与定价
- API 调用:官方提供 REST API,
music-3.0为付费模型(120 请求/分钟),music-3.0-free为免费模型(3 请求/分钟)。按生成计费,每首最长 5 分钟的音乐约 $0.15,歌词生成/编辑服务约 $0.01/首。 - 本地部署:通过 ComfyUI 等工具本地运行开放权重模型,适合需要完全控制生成流程的技术用户。
- 订阅计划:提供 Plus($20/月)、Max($50/月)、Ultra($120/月)等 Token Plan,共享模型资源配额。
注意:生成的音频 URL 链接会在 24 小时后过期,需及时下载保存。商业使用需仔细阅读 MiniMax 音乐服务条款,确保对输入素材拥有合法权利,并按要求标注 AI 生成内容。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



