Gemini 3.8 Live Extended Thinking 是 Google DeepMind 推出的实时语音模型增强版本,在 Gemini 3.8 Live 基础上叠加深度推理链路,保留原生音频到音频的交互形态。模型支持音频、图像、视频多模态流式输入,处理需要多步推演的复杂任务,对话过程依旧支持随时打断。后台推理计算与语音输出并行执行,搭配工具调用能力,可在会话内完成多层逻辑推导。适配长链条复杂咨询、多步骤问题求解场景,音频输出内置 SynthID 水印,可通过 Google AI Studio 与 API 接入使用。

Gemini 3.8 Live Extended Thinking特点
在原生音入音出架构之上增设独立深度推理分支,复杂问题会启动更长的思考链路,简单对话维持低延迟响应。
维持实时对话交互特性,用户可随时打断模型输出,中断后快速切换新的会话指令。
推理过程和语音生成异步运行,模型在后台完成多步骤计算的同时,输出语音提示当前任务进度,消除交互空白。
多模态流融合能力完整保留,同步接收摄像头画面、屏幕视频流,视觉信息参与逻辑推导。
内置 97 种语言识别,混合语种对话场景稳定完成理解与语音回复。
生成音频嵌入 SynthID 隐形水印,标记 AI 生成内容,方便溯源。
算力资源向推理环节倾斜,更适合高复杂度任务,不优先追求超高并发吞吐。
Gemini 3.8 Live Extended Thinking技术原理
模型基于 Gemini 多模态基座,复用音频、图像、视频统一编码器,将各类输入转为共享表征向量。
Extended Thinking 模块新增独立推理缓存空间,接收多模态特征后,执行多轮内部推演,拆解复杂问题形成分步执行计划。
整套流式架构依托 WebSocket 长连接持续传输音视频流,时序模块持续维护完整对话上下文。
异步调度单元管理推理、工具请求、语音生成三条链路,后台执行检索、数据读取等外部操作,不会中断语音交互。
音频生成分支直接输出语音波形,跳过文本中转环节,减少链路带来的时延与信息损耗。训练阶段引入大量多步骤复杂任务样本,学习长链条逻辑推导的行为模式。
Gemini 3.8 Live Extended Thinking功能
带深度推理的实时语音对话
接收语音指令,处理多步骤复杂问题,思考阶段同步语音反馈,支持中途打断。
多模态深度问题解析
同步读取画面、视频内容,结合视觉信息开展复杂逻辑推演,语音输出完整推导过程。
会话内链式工具调用
复杂任务自动触发多次外部工具请求,分步收集信息,整合全部结果给出最终答复。
多语言复杂场景语音交互
自动识别语种,跨语言处理逻辑类、计算类复杂问题。
AI 音频溯源标记
所有生成语音添加 SynthID 水印,实现 AI 音频内容识别追踪。
API 集成开发
通过 Google AI Studio、Gemini API 接入,搭建面向复杂任务的语音智能体。
Gemini 3.8 Live Extended Thinking应用场景
专业领域语音咨询
技术方案答疑、金融测算、法律条文解读,处理多层条件的复杂咨询需求。
远程复杂故障诊断
用户同步上传设备实拍画面,模型分步排查故障,语音给出多套排查方案。
高阶学科语音辅导
数理推导、工程问题解析,结合手写板书画面,口头分步拆解复杂难题。
企业复杂业务智能体
订单多层核验、多条件业务查询,会话中联动多套后台系统获取数据。
AI 算法研究实验
用于实时语音智能体、长链条推理、多模态交互方向的模型评测与对照实验。
Gemini 3.8 Live Extended Thinking同类产品对比
表格
| 对比项 | Gemini 3.8 Live Extended Thinking | GPT-Live-1 Astra |
|---|---|---|
| 研发主体 | Google DeepMind | OpenAI |
| 产品定位 | 支持深度长思考的实时音视频多模态语音 Agent 模型 | 全双工实时音视频交互语音大模型 |
| 核心特色 | 支持边思考边语音输出,多步骤复杂任务推理,97 种语言,实时视觉 + 工具调用,语音转语音基准得分领先 | 原生全双工流式对话,视觉感知 + 函数调用,人声自然流畅,对话打断响应优秀 |
| 适用场景 | 复杂多步骤语音 Agent、带画面的语音深度咨询、企业复杂语音自动化、远程实时语音分析 | 数字人实时对话、智能硬件语音交互、实时语音助手、日常多模态语音问答 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



