AuK 是腾讯混元推出的开源语音基础模型,参数规模 1.5B,包含基础版本 AuK 与快速蒸馏版本 AuK‑Flash 两套权重。整套模型把语音生成、内容改写、音频修复分离、副语言调整、底层声学修改收拢至同一套调用接口,输入自然语言指令,按需搭配参考音频即可输出目标音频。训练使用 30.3 亿条指令‑音频配对样本,有效监督数据规模达到 195 万小时,覆盖中文、英文多类语音场景,项目完整开放代码、模型权重,支持研究与二次开发,权重可在 Hugging Face、ModelScope 平台获取。

AuK特点
统一指令式交互,全部语音任务不需要切换不同模型,以文本指令描述目标效果,配合可选参考音频完成处理。
双版本权重配置,AuK 侧重输出音质细节,AuK‑Flash 经过蒸馏,仅 4 步采样完成推理,推理速度提升 4.5 倍,不使用分类器自由引导,兼顾速度与输出质量。
编辑约束能力强,执行内容改写时保留原始说话人音色、韵律;做情绪、音色调整时不改动原始文本内容。
跨任务泛化表现,零样本语音合成、指令式音色生成、录音修复、声源分离多类任务下均可拿到可用结果。
开源 MIT 协议,训练脚本、推理代码、模型权重全部对外释放,降低语音方向二次开发门槛。
AuK技术原理
整体架构由多模态编码器、音频 VAE、混合整流流 Transformer 三部分组成。多模态编码器读取自然语言指令与输入参考音频,输出语义条件表征;音频 VAE 在语音、普通音频、音乐混合数据集完成联合训练,输出 50Hz 的声学隐变量,完成音频波形与隐空间之间的编解码。
生成主干采用混合 Transformer 结构,前期双流式 MMDiT 模块分开处理文本条件与音频隐变量,后续单流 DiT 模块完成特征融合,基于 flow‑matching 目标开展训练。训练流程分为生成预热、生成编辑联合预训练两个阶段,之后叠加人类反馈偏好优化、奖励强化学习两类后处理策略,适配开放式编辑与语音生成任务。
AuK‑Flash 采用两阶段蒸馏方案,轨迹一致性初始化之后接入任务路由解耦 DMD 目标,搭配干净预测回归监督,得到少步数推理的学生模型,压缩推理耗时。
AuK项目地址
- 项目官网:https://auk-project.github.io/
- GitHub仓库:https://github.com/Tencent-Hunyuan/AuK
AuK功能
指令语音合成,依靠文字描述音色、情绪完成语音生成;也可上传短参考音频,完成零样本声音克隆生成语音。
语音内容编辑,针对已有录音完成词语插入、删除、替换;支持演唱音频歌词改写,保留原始旋律与人声特质。
副语言编辑,修改录音情绪、音色,完成口音矫正;增删叹气、笑声、呼吸等非语言事件;正常语音与耳语状态互相转换。
底层声学调整,对已有音频做语速、音量、音调参数调整,文字指令直接指定调整幅度。
音频增强与声源分离,去除录音噪声、混响;依据文本线索分离目标说话人;从伴奏当中提取演唱人声。
AuK应用场景
语音技术研发人员,基于开源权重开展语音生成、音频编辑方向实验,对比不同指令式语音方案效果。
播客与音频内容团队,对录制素材做局部文字修正、情绪重调,修复带噪录音,拆分多说话人片段。
有声内容制作,生成定制音色旁白,对已有有声片段做局部修改,无需重新完整录制。
音频工具开发者,把 AuK 接入自有产品,实现 TTS、音频编辑、降噪分离等多项能力,缩减多套模型对接的工作量。
影视与配音后期,做配音小样快速生成,对现有配音片段做局部词句修改,快速迭代备选音频素材。
AuK使用教程
环境与权重准备:拉取项目开源代码,部署对应版本深度学习依赖库。分别下载 AuK 或者 AuK‑Flash 模型权重、配套多模态编码器权重、音频 VAE 权重,放置至项目指定目录。
任务参数输入:准备自然语言指令,按需上传原始录音、参考音色音频。明确任务类型,填写采样步数,AuK‑Flash 固定使用 4 步采样。
发起推理:运行项目推理脚本,传入指令文本与音频文件路径,启动任务。基础版本可配置更多采样步数,优先保障音频细节。
结果核验:导出生成的音频文件,核对语音内容、说话人音色、情绪与指令描述匹配度。出现编辑偏差,改写指令描述重新提交任务。
二次实验与部署:研发场景可以导出中间隐变量,开展消融对照实验。业务侧部署时,AuK‑Flash 用于高吞吐场景,基础版本用于追求音质的生产任务。
AuK同类产品对比
表格
| 对比维度 | AuK | F5-TTS |
|---|---|---|
| 研发主体 | 腾讯混元 + 上海交大 | 原 F5-TTS 团队 |
| 产品定位 | 统一指令式语音基础模型,语音生成 + 语音编辑一体化开源模型 | 专注高质量零样本 TTS 语音生成模型 |
| 核心特色 | 单模型覆盖 TTS、语音内容修改、音色情绪调整、降噪、声源分离;MIT 开源,含 AuK-Flash 高速版本,4 步推理,速度提升 4.5 倍 | 推理链路简洁,零样本音色克隆自然,长句生成稳定性强,社区生态成熟,侧重语音合成任务 |
| 适用场景 | 音频剪辑、配音修改、录音修复、声源分离、一站式语音工程开发 | AI 配音、有声书、短视频旁白、音色克隆类 TTS 业务 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



