dots.tts 是由小红书(RedNote)AI实验室 rednote-hilab 团队开发并开源的新一代文本转语音(TTS)基座模型,总参数量约20亿(2B),采用全连续端到端自回归架构,摒弃了传统TTS中广泛使用的离散声学Token,直接在连续隐空间中进行自回归语音生成。模型基于Qwen2.5-1.5B-Base大语言模型构建语义理解骨干,配合48kHz AudioVAE声学头,在Seed-TTS-Eval等权威基准上取得开源模型最优表现,支持24种语言的零样本语音克隆,重建说话人相似度高达0.969。项目基于Apache 2.0协议完全开源,开放预训练、对齐(SOAR)、蒸馏等多版本权重,配套完整的推理与微调代码。

dots.tts核心特点
- 全连续隐空间建模:彻底摒弃离散声学Token,全程在连续潜在空间中自回归生成音频,保留频谱质感与气声等丰富音色细节,避免了离散量化带来的信息损失和”机器味”。
- 业界领先的合成质量:在Seed-TTS-Eval基准上同时取得内容准确度(WER/CER 2.95%)和音色相似度(SIM 79.2)的SOTA,在MiniMax 24语种评测中平均SIM达83.9,19个语种排名第一。
- 零样本高保真语音克隆:仅需3至15秒参考音频即可克隆目标说话人的音色、语调和情感特征,支持延续克隆(带文本参考)和纯音色克隆(x-vector)两种模式。
- 48kHz高保真输出:采样率达48kHz,音频质量远超传统16kHz或24kHz TTS系统,适合专业配音和音乐级应用场景。
- 原生流式低延迟:1T1A双流模式下音频首包延迟低至54.4毫秒,配合SGLang Omni部署,单卡H100并发16路吞吐达4.76 req/s,满足实时语音Agent需求。
- 统一编辑能力:通过dots.tts.edit入口,支持基于XML结构化指令对已有音频进行文本替换、情绪修改、韵律调整等精确编辑,在doteBench评测中领先其他开源系统。
- 低显存友好:经过量化与显存优化,低至6GB显存即可流畅运行,适配消费级GPU。
- 多语言多方言支持:覆盖普通话、粤语、北京话、东北话、四川话、闽南话、吴语等方言,以及英语、日语、韩语、西班牙语等24种语言。
dots.tts技术原理
- AudioVAE编码器:以48kHz单声道波形为输入,将音频编码为128维连续潜在表示,采用BigVGAN风格的因果解码器进行高质量重建,避免传统离散编解码器的量化信息损失。
- 自回归主干网络:
- 语义编码器:基于Qwen2.5-1.5B-Base,直接处理BPE文本(无需音素转换),28层Transformer,1536隐藏维度,负责文本语义理解。
- PatchEncoder:24层、16头、1024隐藏大小,将每个新生成的VAE补丁重新编码为紧凑嵌入,供LLM处理。
- AR流匹配头(DiT):18层、16头、1024隐藏大小的扩散Transformer,基于LLM隐藏状态和AR前缀,通过流匹配(Flow Matching)技术去噪生成下一个VAE补丁。
- 说话人编码器:采用CAM++ x-vector提取512维说话人嵌入,支持纯音色克隆模式。
- 流匹配采样:支持10至32步流匹配采样,步数越高音质越好但速度越慢,默认10步即可达到高质量输出。
- SOAR自校正对齐后训练:dots.tts-soar版本通过纯粹的流匹配原生后训练阶段实现自校正对齐,无需额外奖励模型训练,零推理成本增加即可显著提升语音克隆保真度。
- 蒸馏加速:通过MeanFlow蒸馏,以SOAR检查点为教师模型,可获得4步、2步或1步的高质量学生模型,适配不同延迟与并发需求。
- 双流对话架构:1T1A(1个文本流+1个音频流)模式下,文本侧逐Token推送,音频侧即刻开始生成,实现边输入边合成的极低延迟体验。
dots.tts项目地址
- GitHub仓库:https://github.com/studio-dots-ai/dots.tts
dots.tts主要功能
- 零样本语音克隆:上传5至15秒参考音频(可选填转写文本),即可克隆目标说话人的音色、语调和情感特征,生成任意文本的语音。
- 多模式语音合成:
- 普通配音模式:常规TTS,适合旁白、解说、朗读等场景。
- 指令式配音模式:通过自然语言指令控制语气、情绪、语速和角色感,如”请用温柔慢速的语气说……”。
- 声音描述生成模式:通过描述声音风格(如”室内安静女声、语速适中、情绪稳定”)生成对应风格的语音。
- 语音编辑(dots.tts.edit):基于XML结构化指令对已有录音进行精确编辑,支持文本替换、情绪修改、韵律调整、停顿插入等操作。
- 流式输出:支持generate_stream()逐块获取音频张量,实时推送到播放器或WebSocket,实现边生成边播放。
- 双流实时对话:通过DotsTtsRuntimeDoubleStreaming启动会话,逐Token推送文本即刻触发语音生成,首包延迟低至54.4毫秒。
- 超长文本处理:内置动态文本切分与相位平滑拼接算法,支持万字长文一次性输入,不爆显存,合成语音无断层感。
- 情绪迁移:通过参考音频自动捕获情感特征(哭腔、愤怒、喜悦等),并精确还原到合成语音中。
- 微调与定制:支持在公开检查点基础上进行音色或领域适配微调,可通过accelerate launch运行训练脚本。
- WebUI交互界面:提供Gradio可视化合成界面和Edit Playground编辑界面,支持浏览器内上传音频、标注编辑区间并实时预览结果。
dots.tts应用场景
- 有声书与播客制作:利用零样本克隆能力复刻特定主播音色,批量生成长篇有声内容,多语言支持可快速制作多语种版本。
- 短视频与自媒体配音:为视频旁白、产品解说、教程配音等场景快速生成高质量语音,指令式配音模式可精确控制语气风格。
- 智能客服与语音助手:流式输出和双流对话能力支撑实时人机交互,首包延迟54.4毫秒满足对话系统的低延迟要求。
- 虚拟主播与游戏角色配音:克隆特定声线后批量生成角色台词,情绪迁移能力可精准还原角色的喜怒哀乐。
- 多语言内容本地化:24种语言支持覆盖全球主要语种,跨语言语音克隆可保持品牌声音一致性。
- 无障碍辅助:为视障用户提供高质量的文本朗读服务,方言支持可适配不同地区用户习惯。
- 影视与动画后期配音:48kHz高保真输出满足专业级音频制作需求,语音编辑功能可对已有录音进行精确修改。
- 语音研究与教学:开源权重和完整训练代码为TTS研究者提供基座模型,支持在此基础上进行学术创新和领域适配。
- 本地化隐私部署:6GB显存即可运行,适合企业和个人在本地完成语音生成,敏感数据无需上传云端。
部署与接入方式
表格
| 方式 | 适用场景 | 说明 |
|---|---|---|
| pip install dots.tts | 快速集成 | 一行命令安装,支持CLI和Python API |
| WebUI(Gradio) | 交互式体验 | python apps/gradio/app.py,浏览器操作 |
| CLI命令行 | 批量处理 | dots.tts --text "..." --output out.wav |
| Python API | 开发集成 | DotsTtsRuntime.from_pretrained() |
| 流式API | 实时对话 | generate_stream() 或 DotsTtsRuntimeDoubleStreaming |
| SGLang Omni | 高并发部署 | CUDA Graph加速+连续批处理,单卡H100并发16路 |
| 蒸馏模型 | 极致低延迟 | 4步/2步/1步学生模型,适配不同延迟需求 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
为这篇文章评分
10.0/ 10
2 人评价
100%
0%
0%
0%
0%
点击⭐️进行评分
相关文章
暂无评论...



