Speech – AI音乐平台Suno推出一体化语音音频生成模型

AI 音乐制作平台 Suno 正式上线 Speech,采用端到端音频生成架构,同步生成人声旁白与配套背景音乐,输出完整连贯的单条音轨。传统语音音频制作,需要分开生成语音和配乐,后期再做对齐混音,繁琐操作容易出现节奏错位。Speech 将人声朗读和背景音乐融合在同一轮生成流程,用户仅输入文本脚本与风格描述,就能直接得到带配乐的旁白音频,最长可生成 8 分钟音频内容,目前开放公开测试版本,网页端与移动端均可直接使用。

Speech - AI音乐平台Suno推出一体化语音音频生成模型

Speech特点

语音和背景音乐作为统一音轨生成,不用后期手动对齐剪辑。

内置大量音色预设,可调整说话风格、性别特征。

提供两种创作模式,简易模式依靠描述词生成,高级模式支持粘贴完整脚本。

支持关闭背景音乐,只输出纯人声旁白。生成速度快,输入指令后短时间返回成品音频。

测试阶段存在口音漂移、情感停顿不稳定的现象。

Speech技术原理

基于音频大模型的序列生成架构,把文本提示词映射成全频段音频 token。

模型同时学习人声韵律、咬字发音和乐器旋律节奏,在同一个生成空间内协同渲染两种音频信号。

不拆分语音生成与音乐生成两个独立模块,在解码阶段同步输出人声波形与伴奏波形,自动完成音量平衡与节奏匹配,最后合并为单一音频文件输出。

Speech功能

文本转旁白,输入脚本生成具备情绪起伏的人声朗读。

配套背景音乐同步生成,音乐风格跟随旁白主题匹配。

纯语音模式,关闭伴奏只保留人声。自定义音色参数,调整说话语气、语速。

批量生成多版本音频,挑选效果最优的片段。

导出成品音频文件,直接用于内容剪辑。

Speech应用场景

短视频旁白与背景音乐一体化制作,播客节目片段快速创作

有声故事与诗歌朗读音频产出,品牌宣传口播音频制作

课程讲解配音素材生成,游戏剧情旁白音频制作。

Speech如何使用

打开 Suno 网页端或者移动端应用,找到 Speech 功能入口。

选择简易模式或者高级模式,在输入框粘贴脚本或者填写创作描述。

填写音色、语言、音乐风格相关描述,按需开启或关闭背景音乐。

提交任务等待模型运算,生成多组音频结果。

在线试听各个版本,挑选符合预期的音频。

完成音频下载,保存文件用于后续内容制作。

Speech同类产品对比

表格

项目Suno SpeechElevenLabs TTS
研发主体Suno AIElevenLabs
产品定位AI 音乐平台新增语音生成模块,兼顾自然语音与人声演唱专业 TTS 语音生成平台,主打高保真自然语音、语音克隆
核心特色语音可无缝转为歌曲演唱,语音和音乐能力一体化,文本一键生成带音乐的人声作品音色丰富,多语种强,语音情感细腻,支持 API 调用,语音克隆成熟
适用场景短视频歌曲、Demo 创作、歌词演唱生成播客、有声书、旁白、虚拟人语音等纯语音内容制作
© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...