Luna-TTS 是由 VuiLabs AI 推出的扩散语言模型(Diffusion-Language-Model)文本转语音系统家族。它包含两个核心变体:
Luna-TTS:全并行生成版本,一次性生成完整音频波形
Luna-TTS Realtime:流式生成版本,分块增量输出音频
整个家族基于一个共享的 0.6B 参数骨干网络,在中文、英文、日文、韩文四种语言的 100 万小时 语音数据上预训练而成。在 Seed-TTS-Eval 基准测试中,Luna-TTS 在全部四项指标上均排名第一,而参数量仅为对比系统的三分之一到二分之一。

Luna-TTS核心特点
表格
| 特点 | 说明 |
|---|---|
| 全并行生成 | 不采用自回归的逐 token 解码,而是在固定步数内并行细化整个 RVQ token 网格,彻底消除随序列长度增长的延迟 |
| 零样本语音克隆 | 仅需 3-10 秒未见说话人的参考音频,即可克隆音色,无需针对目标说话人微调 |
| 语音编辑即填充 | 任意位置的文本修改对应音频片段的重新生成,前后音频自然衔接,无需专用编辑模型 |
| 流式实时输出 | Realtime 版本首音频延迟仅 41.6 毫秒,说话过程中即可开始播放 |
| 多语言覆盖 | 原生支持中、英、日、韩四种语言,跨语言音色迁移自然 |
| 轻量高效 | 0.6B 参数即可超越 1.5B-2B 参数的竞争系统,推理吞吐量高 |
| 非语言发声 | 支持笑声、叹息、吸气、清嗓等 inline 非语言发声标签,与语音自然融合 |
Luna-TTS技术原理
1. 渐进式骨干网络适配
Luna-TTS 并非从零训练,而是基于一个预训练的自回归文本大语言模型,通过三阶段渐进式改造:
- 因果(Causal) → 双向(Bidirectional) → 块因果(Block-Causal)
这种渐进策略让模型保留了文本 LLM 强大的语言理解能力,同时逐步获得语音生成所需的非因果上下文建模能力。
2. 扩散语言模型架构
传统自回归编解码器语言模型从左到右逐 token 解码,存在三个固有问题:延迟随 utterance 长度线性增长、已生成长度上的错误累积、以及生成顺序与 RVQ token 网格本身无方向性的矛盾。
Luna-TTS 采用扩散语言模型替代自回归:
- 整个 token 网格在固定步数内并行去噪细化
- 生成顺序不再受限于从左到右,而是全局并行优化
3. 流式块自回归 + 块内并行(Realtime 版本)
Luna-TTS Realtime 采用块因果策略:
- 在 1.28 秒 的音频块级别上自回归(块与块之间顺序生成)
- 每个块内部并行去噪
- 第一个块生成完成后即可开始播放,后续块边生成边输出
4. 退火微调与强化学习
- 退火微调阶段:增加情感标签和非语言发声控制能力
- 强化学习阶段:在实现的去噪轨迹上应用 GRPO(Group Relative Policy Optimization),直接优化生成质量
5. Token 级时长预测器
针对长文本、不规则文本(绕口令、密集数字、复杂标点),模型内置 token 级时长预测器,自动校准目标长度,避免传统启发式长度估计导致的截断或冗余。
Luna-TTS项目地址
- 项目官网:https://vuilabs-ai.github.io/luna-tts/
Luna-TTS核心功能
表格
| 功能 | 描述 |
|---|---|
| 零样本语音克隆 | 上传 3-10 秒参考音频,即可用该音色生成任意文本的语音,支持跨语言克隆 |
| 情感控制 | 通过 utterance 级情感标签(快乐、悲伤、愤怒、惊讶、恐惧等)精确控制语音情感色彩 |
| 非语言发声 | 在文本中插入 [laughs]、[sighs]、[gasps]、[clears throat] 等标签,在指定位置自然发出对应声音 |
| 语速控制 | 通过缩放预测时长实现连续语速调节(如 0.75×、1.0×、1.25×),同一音色无需重新训练 |
| 语音编辑 | 修改文本中的任意片段,仅重新生成对应音频跨度,前后上下文保持连贯 |
| 硬文本与野外音频 | 支持绕口令、密集数字、复杂标点等困难文本,以及带噪声、非 studio 条件的野外参考音频 |
| 流式实时合成 | Realtime 版本支持边说边播,首音频 41.6ms,10.6 秒 utterance 总耗时 254ms |
Luna-TTS应用场景
表格
| 场景 | 说明 |
|---|---|
| 实时语音助手 | 首音频 41.6ms 的流式输出,适合智能客服、AI 陪伴、语音交互等对延迟敏感的场景 |
| 有声内容生产 | 零样本克隆专业播音员音色,批量生成有声书、播客、新闻播报 |
| 游戏与动漫配音 | 情感控制和角色音色克隆,为游戏 NPC、虚拟偶像提供动态语音 |
| 多语言本地化 | 同一角色音色跨中、英、日、韩四种语言自然迁移,降低本地化配音成本 |
| 语音内容编辑 | 播客/视频后期中直接修改台词文本,AI 自动重录对应片段,无需重新录制整段 |
| 辅助阅读与无障碍 | 为视障用户、阅读障碍者提供高质量、多情感的自然语音朗读 |
| 虚拟主播与直播 | 实时生成带情感、带非语言反馈的自然语音,增强虚拟主播的表现力 |
Luna-TTS一句话总结
Luna-TTS 是一族基于扩散语言模型的轻量 TTS 系统,以 0.6B 参数实现全并行或流式语音生成,在零样本克隆、情感控制、非语言发声和语音编辑等维度上达到行业顶尖水平,首音频延迟低至 41.6 毫秒。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



