Gemini 3.8 Live 是 Google DeepMind 推出的原生音频到音频实时大模型,包含基础版与 Extended Thinking 增强版本,依托 WebSocket 流式接口交付服务。模型接收音频、图像、视频多类输入,直接输出语音回复,无需中间文本转写环节。对话过程支持随时打断,后台可并行执行工具调用,内置 97 种语言自动识别切换能力,生成音频自带 SynthID 水印。基础版面向大规模业务部署,增强版本适配多步骤复杂任务,在语音智能体基准评测拿到高分,适配企业语音交互、实时多模态助手开发。

Gemini 3.8 Live特点
原生音入音出架构,剥离传统语音识别、文本大模型、语音合成串联链路,减少多模块转接带来的延迟与错误。
对话原生支持插话与话权切换,用户中途打断时模型立刻停止输出,还原自然对话节奏,无需额外部署语音活动检测组件。
异步工具调用机制,执行检索、API 请求等操作时对话不会中断,模型同步输出提示语句,消除交互空白停顿。
多模态流融合,音频之外同步读取实时画面、屏幕视频,结合视觉信息生成语音应答。
对话内自动语种识别,在 97 种语言之间动态切换,混合语种对话场景稳定输出。
生成音频嵌入 SynthID 隐形水印,标记 AI 生成内容。
两套版本区分业务负载,基础版本控制算力开销,满足高并发场景;Extended Thinking 承载深度多步推理任务。
Gemini 3.8 Live技术原理
Gemini 3.8 Live 基于 Gemini 主干多模态基座改造,构建流式音频表征编码器,将原始音频波形映射至统一多模态向量空间,图像、视频、音频信号在同一表征体系完成融合。
整套模型采用长上下文流式推理,通过持久 WebSocket 连接持续收发音视频流,时序模块维护对话上下文状态。
并行推理调度机制用于 Extended Thinking 版本,推理计算、工具请求、语音生成三条链路异步运行,模型在运算的同时持续输出语音,同步告知任务进展。
语种识别模块嵌入编码器内部,实时提取语音声学特征判断语种,动态调整生成策略。
音频生成分支直接输出语音波形,跳过文本中转步骤,压缩端到端时延。训练阶段纳入大量真实对话样本,学习人类对话的话轮切换、打断、附和等交互习惯。
Gemini 3.8 Live功能
实时双向语音对话
持续接收流式音频,产出自然语音回复,支持随时打断,适配连续长会话。
多模态语音交互
同步接收摄像头画面、屏幕共享视频,结合视觉信息完成语音问答与问题排查。
对话内工具调用
对话过程触发外部查询、预约、数据读取等操作,后台执行任务,对话保持连续。
跨语种自动对话
自动识别对话语种,在 97 种语言之间切换,处理中英混杂、多语言交替的语音交流。
AI 语音水印标记
所有模型生成音频添加 SynthID 水印,完成 AI 生成音频溯源。
API 开发集成
通过 Gemini API、Google AI Studio 接入,企业可搭建私有化预览服务,对接自有业务系统。
Gemini 3.8 Live应用场景
企业语音智能体
客服热线、电话咨询系统,搭建可查询后台数据的实时语音助手。
智能硬件语音交互
车载设备、智能家居终端,实现带画面感知的连续语音对话。
远程技术支持
远程设备故障排查,用户同步上传画面,模型语音指导操作步骤。
多语言跨境服务
面向海外客户的实时语音翻译、咨询接待,应对多语种交替沟通。
教育实时辅导
语音化教学答疑,结合手写板书画面,口头讲解题目思路。
AI 算法评测研究
用于语音智能体、音对音生成、多模态实时交互方向的模型对照实验。
Gemini 3.8 Live同类产品对比
表格
| 对比项 | Gemini 3.8 Live | GPT-Live-1 Astra |
|---|---|---|
| 研发主体 | Google DeepMind | OpenAI |
| 产品定位 | 实时音视频多模态语音 Agent 模型,面向低延迟双向语音交互 | 实时语音对话模型,主打端侧 + 云端流式语音交互 |
| 核心特色 | 支持 97 种语言实时切换,可接入摄像头视觉信息,后台并行执行工具调用,边思考边对话 | 低延迟音流输入输出,支持视觉画面理解,原生函数调用,人声自然度高 |
| 适用场景 | 实时语音助手、智能座舱、远程可视化语音 Agent、企业实时语音客服 | 数字人实时对话、智能硬件语音交互、带画面的语音问答场景 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



