Luna-TTS – Vui Labs AI推出的扩散语言模型文本转语音系统家族

Luna-TTS 是由 VuiLabs AI 推出的扩散语言模型(Diffusion-Language-Model)文本转语音系统家族。它包含两个核心变体:

  • Luna-TTS:全并行生成版本,一次性生成完整音频波形

  • Luna-TTS Realtime:流式生成版本,分块增量输出音频

整个家族基于一个共享的 0.6B 参数骨干网络,在中文、英文、日文、韩文四种语言的 100 万小时 语音数据上预训练而成。在 Seed-TTS-Eval 基准测试中,Luna-TTS 在全部四项指标上均排名第一,而参数量仅为对比系统的三分之一到二分之一。

Luna-TTS - VuiLabs AI 推出的扩散语言模型文本转语音系统家族


Luna-TTS核心特点

表格

特点说明
全并行生成不采用自回归的逐 token 解码,而是在固定步数内并行细化整个 RVQ token 网格,彻底消除随序列长度增长的延迟
零样本语音克隆仅需 3-10 秒未见说话人的参考音频,即可克隆音色,无需针对目标说话人微调
语音编辑即填充任意位置的文本修改对应音频片段的重新生成,前后音频自然衔接,无需专用编辑模型
流式实时输出Realtime 版本首音频延迟仅 41.6 毫秒,说话过程中即可开始播放
多语言覆盖原生支持中、英、日、韩四种语言,跨语言音色迁移自然
轻量高效0.6B 参数即可超越 1.5B-2B 参数的竞争系统,推理吞吐量高
非语言发声支持笑声、叹息、吸气、清嗓等 inline 非语言发声标签,与语音自然融合

Luna-TTS技术原理

1. 渐进式骨干网络适配

Luna-TTS 并非从零训练,而是基于一个预训练的自回归文本大语言模型,通过三阶段渐进式改造:

  • 因果(Causal) → 双向(Bidirectional) → 块因果(Block-Causal)

这种渐进策略让模型保留了文本 LLM 强大的语言理解能力,同时逐步获得语音生成所需的非因果上下文建模能力。

2. 扩散语言模型架构

传统自回归编解码器语言模型从左到右逐 token 解码,存在三个固有问题:延迟随 utterance 长度线性增长、已生成长度上的错误累积、以及生成顺序与 RVQ token 网格本身无方向性的矛盾。

Luna-TTS 采用扩散语言模型替代自回归:

  • 整个 token 网格在固定步数内并行去噪细化
  • 生成顺序不再受限于从左到右,而是全局并行优化

3. 流式块自回归 + 块内并行(Realtime 版本)

Luna-TTS Realtime 采用块因果策略:
  • 1.28 秒 的音频块级别上自回归(块与块之间顺序生成)
  • 每个块内部并行去噪
  • 第一个块生成完成后即可开始播放,后续块边生成边输出

4. 退火微调与强化学习

  • 退火微调阶段:增加情感标签和非语言发声控制能力
  • 强化学习阶段:在实现的去噪轨迹上应用 GRPO(Group Relative Policy Optimization),直接优化生成质量

5. Token 级时长预测器

针对长文本、不规则文本(绕口令、密集数字、复杂标点),模型内置 token 级时长预测器,自动校准目标长度,避免传统启发式长度估计导致的截断或冗余。

Luna-TTS项目地址

  • 项目官网:https://vuilabs-ai.github.io/luna-tts/

Luna-TTS核心功能

表格

功能描述
零样本语音克隆上传 3-10 秒参考音频,即可用该音色生成任意文本的语音,支持跨语言克隆
情感控制通过 utterance 级情感标签(快乐、悲伤、愤怒、惊讶、恐惧等)精确控制语音情感色彩
非语言发声在文本中插入 [laughs][sighs][gasps][clears throat] 等标签,在指定位置自然发出对应声音
语速控制通过缩放预测时长实现连续语速调节(如 0.75×、1.0×、1.25×),同一音色无需重新训练
语音编辑修改文本中的任意片段,仅重新生成对应音频跨度,前后上下文保持连贯
硬文本与野外音频支持绕口令、密集数字、复杂标点等困难文本,以及带噪声、非 studio 条件的野外参考音频
流式实时合成Realtime 版本支持边说边播,首音频 41.6ms,10.6 秒 utterance 总耗时 254ms

Luna-TTS应用场景

表格

场景说明
实时语音助手首音频 41.6ms 的流式输出,适合智能客服、AI 陪伴、语音交互等对延迟敏感的场景
有声内容生产零样本克隆专业播音员音色,批量生成有声书、播客、新闻播报
游戏与动漫配音情感控制和角色音色克隆,为游戏 NPC、虚拟偶像提供动态语音
多语言本地化同一角色音色跨中、英、日、韩四种语言自然迁移,降低本地化配音成本
语音内容编辑播客/视频后期中直接修改台词文本,AI 自动重录对应片段,无需重新录制整段
辅助阅读与无障碍为视障用户、阅读障碍者提供高质量、多情感的自然语音朗读
虚拟主播与直播实时生成带情感、带非语言反馈的自然语音,增强虚拟主播的表现力

Luna-TTS一句话总结

Luna-TTS 是一族基于扩散语言模型的轻量 TTS 系统,以 0.6B 参数实现全并行或流式语音生成,在零样本克隆、情感控制、非语言发声和语音编辑等维度上达到行业顶尖水平,首音频延迟低至 41.6 毫秒。

© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...