AI 音乐制作平台 Suno 正式上线 Speech,采用端到端音频生成架构,同步生成人声旁白与配套背景音乐,输出完整连贯的单条音轨。传统语音音频制作,需要分开生成语音和配乐,后期再做对齐混音,繁琐操作容易出现节奏错位。Speech 将人声朗读和背景音乐融合在同一轮生成流程,用户仅输入文本脚本与风格描述,就能直接得到带配乐的旁白音频,最长可生成 8 分钟音频内容,目前开放公开测试版本,网页端与移动端均可直接使用。

Speech特点
语音和背景音乐作为统一音轨生成,不用后期手动对齐剪辑。
内置大量音色预设,可调整说话风格、性别特征。
提供两种创作模式,简易模式依靠描述词生成,高级模式支持粘贴完整脚本。
支持关闭背景音乐,只输出纯人声旁白。生成速度快,输入指令后短时间返回成品音频。
测试阶段存在口音漂移、情感停顿不稳定的现象。
Speech技术原理
基于音频大模型的序列生成架构,把文本提示词映射成全频段音频 token。
模型同时学习人声韵律、咬字发音和乐器旋律节奏,在同一个生成空间内协同渲染两种音频信号。
不拆分语音生成与音乐生成两个独立模块,在解码阶段同步输出人声波形与伴奏波形,自动完成音量平衡与节奏匹配,最后合并为单一音频文件输出。
Speech功能
文本转旁白,输入脚本生成具备情绪起伏的人声朗读。
配套背景音乐同步生成,音乐风格跟随旁白主题匹配。
纯语音模式,关闭伴奏只保留人声。自定义音色参数,调整说话语气、语速。
批量生成多版本音频,挑选效果最优的片段。
导出成品音频文件,直接用于内容剪辑。
Speech应用场景
短视频旁白与背景音乐一体化制作,播客节目片段快速创作
有声故事与诗歌朗读音频产出,品牌宣传口播音频制作
课程讲解配音素材生成,游戏剧情旁白音频制作。
Speech如何使用
打开 Suno 网页端或者移动端应用,找到 Speech 功能入口。
选择简易模式或者高级模式,在输入框粘贴脚本或者填写创作描述。
填写音色、语言、音乐风格相关描述,按需开启或关闭背景音乐。
提交任务等待模型运算,生成多组音频结果。
在线试听各个版本,挑选符合预期的音频。
完成音频下载,保存文件用于后续内容制作。
Speech同类产品对比
表格
| 项目 | Suno Speech | ElevenLabs TTS |
|---|---|---|
| 研发主体 | Suno AI | ElevenLabs |
| 产品定位 | AI 音乐平台新增语音生成模块,兼顾自然语音与人声演唱 | 专业 TTS 语音生成平台,主打高保真自然语音、语音克隆 |
| 核心特色 | 语音可无缝转为歌曲演唱,语音和音乐能力一体化,文本一键生成带音乐的人声作品 | 音色丰富,多语种强,语音情感细腻,支持 API 调用,语音克隆成熟 |
| 适用场景 | 短视频歌曲、Demo 创作、歌词演唱生成 | 播客、有声书、旁白、虚拟人语音等纯语音内容制作 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



