dots.tts – 小红书开发并开源的新一代文本转语音基座模型

dots.tts 是由小红书(RedNote)AI实验室 rednote-hilab 团队开发并开源的新一代文本转语音(TTS)基座模型,总参数量约20亿(2B),采用全连续端到端自回归架构,摒弃了传统TTS中广泛使用的离散声学Token,直接在连续隐空间中进行自回归语音生成。模型基于Qwen2.5-1.5B-Base大语言模型构建语义理解骨干,配合48kHz AudioVAE声学头,在Seed-TTS-Eval等权威基准上取得开源模型最优表现,支持24种语言的零样本语音克隆,重建说话人相似度高达0.969。项目基于Apache 2.0协议完全开源,开放预训练、对齐(SOAR)、蒸馏等多版本权重,配套完整的推理与微调代码。

dots.tts - 小红书开发并开源的新一代文本转语音基座模型

dots.tts核心特点

  • 全连续隐空间建模:彻底摒弃离散声学Token,全程在连续潜在空间中自回归生成音频,保留频谱质感与气声等丰富音色细节,避免了离散量化带来的信息损失和”机器味”。
  • 业界领先的合成质量:在Seed-TTS-Eval基准上同时取得内容准确度(WER/CER 2.95%)和音色相似度(SIM 79.2)的SOTA,在MiniMax 24语种评测中平均SIM达83.9,19个语种排名第一。
  • 零样本高保真语音克隆:仅需3至15秒参考音频即可克隆目标说话人的音色、语调和情感特征,支持延续克隆(带文本参考)和纯音色克隆(x-vector)两种模式。
  • 48kHz高保真输出:采样率达48kHz,音频质量远超传统16kHz或24kHz TTS系统,适合专业配音和音乐级应用场景。
  • 原生流式低延迟:1T1A双流模式下音频首包延迟低至54.4毫秒,配合SGLang Omni部署,单卡H100并发16路吞吐达4.76 req/s,满足实时语音Agent需求。
  • 统一编辑能力:通过dots.tts.edit入口,支持基于XML结构化指令对已有音频进行文本替换、情绪修改、韵律调整等精确编辑,在doteBench评测中领先其他开源系统。
  • 低显存友好:经过量化与显存优化,低至6GB显存即可流畅运行,适配消费级GPU。
  • 多语言多方言支持:覆盖普通话、粤语、北京话、东北话、四川话、闽南话、吴语等方言,以及英语、日语、韩语、西班牙语等24种语言。

dots.tts技术原理

  • AudioVAE编码器:以48kHz单声道波形为输入,将音频编码为128维连续潜在表示,采用BigVGAN风格的因果解码器进行高质量重建,避免传统离散编解码器的量化信息损失。
  • 自回归主干网络
    • 语义编码器:基于Qwen2.5-1.5B-Base,直接处理BPE文本(无需音素转换),28层Transformer,1536隐藏维度,负责文本语义理解。
    • PatchEncoder:24层、16头、1024隐藏大小,将每个新生成的VAE补丁重新编码为紧凑嵌入,供LLM处理。
    • AR流匹配头(DiT):18层、16头、1024隐藏大小的扩散Transformer,基于LLM隐藏状态和AR前缀,通过流匹配(Flow Matching)技术去噪生成下一个VAE补丁。
  • 说话人编码器:采用CAM++ x-vector提取512维说话人嵌入,支持纯音色克隆模式。
  • 流匹配采样:支持10至32步流匹配采样,步数越高音质越好但速度越慢,默认10步即可达到高质量输出。
  • SOAR自校正对齐后训练:dots.tts-soar版本通过纯粹的流匹配原生后训练阶段实现自校正对齐,无需额外奖励模型训练,零推理成本增加即可显著提升语音克隆保真度。
  • 蒸馏加速:通过MeanFlow蒸馏,以SOAR检查点为教师模型,可获得4步、2步或1步的高质量学生模型,适配不同延迟与并发需求。
  • 双流对话架构:1T1A(1个文本流+1个音频流)模式下,文本侧逐Token推送,音频侧即刻开始生成,实现边输入边合成的极低延迟体验。

dots.tts项目地址

  • GitHub仓库:https://github.com/studio-dots-ai/dots.tts

dots.tts主要功能

  • 零样本语音克隆:上传5至15秒参考音频(可选填转写文本),即可克隆目标说话人的音色、语调和情感特征,生成任意文本的语音。
  • 多模式语音合成
    • 普通配音模式:常规TTS,适合旁白、解说、朗读等场景。
    • 指令式配音模式:通过自然语言指令控制语气、情绪、语速和角色感,如”请用温柔慢速的语气说……”。
    • 声音描述生成模式:通过描述声音风格(如”室内安静女声、语速适中、情绪稳定”)生成对应风格的语音。
  • 语音编辑(dots.tts.edit):基于XML结构化指令对已有录音进行精确编辑,支持文本替换、情绪修改、韵律调整、停顿插入等操作。
  • 流式输出:支持generate_stream()逐块获取音频张量,实时推送到播放器或WebSocket,实现边生成边播放。
  • 双流实时对话:通过DotsTtsRuntimeDoubleStreaming启动会话,逐Token推送文本即刻触发语音生成,首包延迟低至54.4毫秒。
  • 超长文本处理:内置动态文本切分与相位平滑拼接算法,支持万字长文一次性输入,不爆显存,合成语音无断层感。
  • 情绪迁移:通过参考音频自动捕获情感特征(哭腔、愤怒、喜悦等),并精确还原到合成语音中。
  • 微调与定制:支持在公开检查点基础上进行音色或领域适配微调,可通过accelerate launch运行训练脚本。
  • WebUI交互界面:提供Gradio可视化合成界面和Edit Playground编辑界面,支持浏览器内上传音频、标注编辑区间并实时预览结果。

dots.tts应用场景

  • 有声书与播客制作:利用零样本克隆能力复刻特定主播音色,批量生成长篇有声内容,多语言支持可快速制作多语种版本。
  • 短视频与自媒体配音:为视频旁白、产品解说、教程配音等场景快速生成高质量语音,指令式配音模式可精确控制语气风格。
  • 智能客服与语音助手:流式输出和双流对话能力支撑实时人机交互,首包延迟54.4毫秒满足对话系统的低延迟要求。
  • 虚拟主播与游戏角色配音:克隆特定声线后批量生成角色台词,情绪迁移能力可精准还原角色的喜怒哀乐。
  • 多语言内容本地化:24种语言支持覆盖全球主要语种,跨语言语音克隆可保持品牌声音一致性。
  • 无障碍辅助:为视障用户提供高质量的文本朗读服务,方言支持可适配不同地区用户习惯。
  • 影视与动画后期配音:48kHz高保真输出满足专业级音频制作需求,语音编辑功能可对已有录音进行精确修改。
  • 语音研究与教学:开源权重和完整训练代码为TTS研究者提供基座模型,支持在此基础上进行学术创新和领域适配。
  • 本地化隐私部署:6GB显存即可运行,适合企业和个人在本地完成语音生成,敏感数据无需上传云端。

部署与接入方式

表格

方式适用场景说明
pip install dots.tts快速集成一行命令安装,支持CLI和Python API
WebUI(Gradio)交互式体验python apps/gradio/app.py,浏览器操作
CLI命令行批量处理dots.tts --text "..." --output out.wav
Python API开发集成DotsTtsRuntime.from_pretrained()
流式API实时对话generate_stream() 或 DotsTtsRuntimeDoubleStreaming
SGLang Omni高并发部署CUDA Graph加速+连续批处理,单卡H100并发16路
蒸馏模型极致低延迟4步/2步/1步学生模型,适配不同延迟需求
© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...