DeepSeek 正式上线原生语音交互能力,模型体系新增语音输入与语音输出链路。用户可以直接用语音发起对话,模型返回内容同步生成自然人声,不再依赖第三方语音组件拼接。这套能力直接内置在大模型推理链路,文本理解、逻辑推理、语音生成在同一模型体系完成,交互延迟得到压缩。

语音交互支持连续对话,对话过程中可随时打断模型输出。系统能识别停顿、语气变化,捕捉口语里的模糊表述,自动完成语义补全。多轮对话上下文完整保留,语音和文本会话记录互通,语音对话产生的内容,切换到文字界面依旧可以继续编辑。
开发者可调用配套语音 API,将这套实时语音能力接入自有应用。接口开放音色选择参数,可调整语速、语调。API 同时返回文本转写结果,用于会话存储与内容检索。
适用场景
智能硬件产品接入语音交互,使用者直接口头提问,获取模型回复。
线上客服系统搭建语音对话入口,接收用户口头咨询,完成信息查询。
语言学习场景,用户开口练习表达,模型实时给出反馈。
移动端应用增加免手动输入交互方式,在不便打字的场景使用语音完成任务。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



