OpenAI 正式将 GPT-Live-1 接入开发者 API,这套全双工实时语音模型开放给外部开发者集成,语音交互不再局限于 ChatGPT 客户端内使用。模型原生整合语音接收与语音输出链路,脱离传统 ASR、大模型、TTS 三段式串行结构,压缩交互延迟,对话过程中识别停顿、背景噪声,同时支持随时打断,对话节奏贴近真人通话。

GPT-Live-1 API 支持工具调用链路,语音会话里触发查询、计算、表单操作等任务,可对接外部系统接口,复杂推理任务自动转交后端大模型处理,工具运算期间维持语音会话不中断。电话场景作为重点支持方向,开发者可依托 API 搭建语音智能体,处理来电对话,完成预约、信息查询、客户咨询等业务交互,业务流程出现无法处理的问题时,可设置转接人工坐席。
开发者可以通过系统指令调整语音音色、语速、对话风格,配套 9 种预制人声,同时开放轮次检测、关键词偏置、字母数字识别等底层能力。模型自带转写输出,每一轮语音交互同步生成文本记录,方便业务侧存储会话内容、做后续数据分析。
API 层面开放完整配置项,可选择推理档位,平衡响应速度与推理深度。企业接入时能够绑定自有业务系统,设置权限范围,限定语音智能体可执行的操作集合,管控业务数据访问边界。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



