StepAudio 3 – 阶跃星辰新一代音频基座

StepAudio 3 是阶跃星辰推出的新一代全栈音频基础模型,整套系列拆分为 Realtime、ASR、TTS、Gen、Music 五个子模型,覆盖语音识别、语音合成、全双工实时对话、综合音频生成、音乐创作。模型打通音频的理解、推理、生成完整链路,不局限于单一语音任务,同时解析语义、情绪、副语言信号与环境声。支持流式 API 调用,适配云端服务接入,面向语音智能体、音频内容生产、音乐制作等业务,多项评测指标站上全球第一梯队。

StepAudio 3 - 阶跃星辰新一代音频基座

StepAudio 3特点

系列五个子模型统一共享音频底层基座,分别面向不同业务场景做专项优化。Realtime 子模型实现原生全双工语音对话,可处理打断、附和、话权切换,思考与语音输出并行执行。

ASR 融合大模型上下文推理,对低声、快语速、背景噪声、中英混杂输入具备较强抗性。TTS 还原真人口语细节,可生成笑声、迟疑、改口这类副语言信号,输出采用流式低延迟架构。

Gen 子模型不再分开生成人声、音效、环境音、背景音乐,单轮指令完成多类声音时序编排。Music 子模型覆盖写词编曲、清唱配乐、翻唱改写,支持多轮迭代创作。

整套系列适配 WebSocket 流式接口,满足实时业务低时延需求,对外提供标准化 API,第三方应用可以直接完成接入。多项公开基准评测拿到头部分数,对话动态、语音推理、非流式识别榜单取得亮眼成绩。

StepAudio 3技术原理

StepAudio 3 基于残差向量量化 RVQ 离散音频分词架构,搭建统一音频表征空间。音频输入经过 Tokenizer 转为多层码本 token,把波形声学信息、语义信息做联合编码,文本、音频在相同表征空间完成对齐。

Realtime 模块搭建听‑说‑思考‑执行循环,无缝双工流处理模块维护双向音频流,Think‑While‑Speaking 机制把内部推理计算和语音生成并行运行,异步工具调用不会打断对话输出。

ASR、TTS 子模型在统一音频基座之上执行专项微调,结合语言模型上下文能力,修正单纯声学识别带来的错误。Gen 采用离散自回归生成逻辑,通过渐进式预训练保留原有文本能力,适配多声源混合生成。

Music 子模型接入旋律、节拍、记谱格式表征,接收歌词、哼唱片段、参考音频多类输入,完成旋律与歌词的匹配生成。整套推理链路做流式切片优化,降低实时场景端到端时延。

Step Audio 3项目地址

  • 项目官网:https://static.stepfun.com/blog/stepaudio3/

StepAudio 3功能

Realtime 全双工实时语音交互

接收持续音频流,处理自然打断、附和回应,边推理边输出语音,内置语音智能体,可调用外部工具完成任务。

ASR 高精度语音识别

处理长音频、方言、中英混说,在背景音乐、低音量嘈杂环境输出文本转录结果。

TTS 真人级语音合成

输入文本生成流式语音,控制音色、情绪、停顿,模拟笑声、迟疑等口语细节,适配实时播报与配音。

Gen 综合音频全要素生成

通过自然语言指令,一次性产出多角色人声、音效、环境音、背景音乐,控制各类声音出现的时间顺序。

Music 音乐创作

接收歌词、哼唱片段、参考曲目,完成编曲、配唱、翻唱改写,支持基于记谱格式开展多轮调整。

API 业务接入

通过 HTTP、WebSocket 接口对外输出能力,第三方产品完成集成,实现语音相关业务快速落地。

StepAudio 3应用场景

实时语音智能体项目

智能硬件、电话客服、语音助手,搭建可以自然插话、被打断的真人感语音交互系统。

音频转写业务

会议记录、访谈录音、播客素材,完成嘈杂环境下的音频文字转录。

有声内容制作

有声书、广播剧、短视频配音,产出多角色对白,配套音效与背景音乐。

音乐创作工作流

词曲创作者、短视频配乐,基于文字或者哼唱快速产出音乐片段,迭代调整编曲风格。

游戏与动画音频生产

生成角色对白、场景环境音、特效声,减少音频素材剪辑混音的工作量。

科研与算法评测

用于音频大模型相关实验,作为基线模型开展语音推理、全双工对话、多声源生成的对照测试。

StepAudio 3同类产品对比

表格

对比项StepAudio 3Qwen Audio 3.0 Realtime Plus
研发主体阶跃星辰(StepFun)阿里通义千问
产品定位全栈音频基座大模型,一套体系覆盖实时语音交互、ASR、TTS、音频生成、音乐创作实时多模态语音大模型,聚焦全双工语音对话与音频理解
核心特色统一 RVQ 离散音频 token,原生全双工,支持边思考边说话,可同时生成人声、音效、背景音乐强多语言音频理解,低延迟流式交互,支持语音工具调用,中文口语表现优秀
适用场景智能座舱、语音 Agent、音频内容创作、会议转录、数字人实时对话智能终端、语音助手、实时客服、多语种语音交互
© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...