Gemini 3.5 Transcribe 是谷歌推出的语音转文本模型,面向语音交互场景开发。传统语音识别模型在嘈杂环境、专业术语、口语冗余内容处理上存在短板,这套模型直接把原始音频素材输出为准确、经过润色、排版规整的文本内容。
该模型已经落地谷歌自有产品,安卓端 Rambler 功能、macOS 平台的 Gemini 客户端内部都在使用这套模型处理语音输入。外部开发者可以通过 Google AI Studio 以及 Gemini 企业代理平台的 API 接入,搭建属于自己的语音相关产品。模型对外提供两套独立接口,分别适配实时交互和历史录音处理。
实时流式接口使用gemini‑3.5‑transcribe‑live,依靠 Live API 完成双向持续数据流传输,端到端延迟控制在一秒以内,面向交互式语音应用开发。预录音频接口使用gemini‑3.5‑transcribe,依托 Interactions API 处理会议、通话录音文件,输出结果包含说话人归属信息以及逐词时间戳。

Gemini 3.5 Transcribe技术原理
整套模型依托 Gemini 3.5 基座做音频链路定制改造。音频信号送入模型后,先完成信号特征提取,转化为模型可解析的表征向量,再送入主干网络完成解码输出。
传统语音识别采用声学模型与独立语言模型拼接的两段式架构。Gemini 3.5 Transcribe 把声学解析、口语修正、语义理解、文本格式化全部收拢在同一个模型内部完成运算。音频特征和文本语义信息做深度融合,模型读取完整口语上下文,识别说话过程中的改口、自我修正、语气填充词。
两套推理逻辑对应两种接口形态。流式模式对音频做分片处理,片段持续送入模型,转写结果分段刷新输出,维持低延迟表现。文件处理模式读取全部音频特征,基于完整全局信息运算,拿到更高识别准确度。
模型开放提示词配置通道,外部调用时传入参数,调整口语清理力度、输出格式,导入自定义专有名词列表。对比前代 Chirp 3,转写完成耗时缩短 70%,多语言基准测试 FLEURS 数据集上,流式模式词错率 5.50%,非流式模式词错率 5.04%。
Gemini 3.5 Transcribe核心特点
流式场景实测词错率 4.0%,预录音频场景词错率 2.6%。现实环境的噪音干扰下,邮政编码、订单编号这类字母数字混合内容依旧可以稳定识别。
识别过程可以捕捉人说话时的自我修正行为,处理口语里的改口内容,过滤嗯、啊这类填充词,自动给文本添加标点、划分段落。这套文本整理逻辑支持开关切换,需要原始逐字记录的场景可以直接关闭。
支持函数调用机制,转写流程当中把任务分发至其他 Gemini 模型,完成图片生成、本地文件解析这类工作。该能力在 macOS 版 Gemini 客户端已经上线可用。
提供自定义词汇录入能力,录入行业术语、特殊人名、专属拼写,识别阶段优先匹配自定义词条,适配垂直领域业务。
覆盖超过 85 种语言,自动识别音频语种,单段音频内部出现多种语言交替,也可以正常完成转写,兼容各地口音与方言。
预录音频模式下,最多区分 3 位说话人,输出附带逐词时间戳。超过 3 人的说话人区分还处在实验阶段。
Gemini 3.5 Transcribe主要功能
实时流式转写。对接麦克风持续推送的音频流,分片返回文本片段,满足交互类产品对低延迟的硬性要求。
录音文件批量转写。上传已经保存的音频文件,输出完整转写结果,附带时间戳标记、说话人身份标记。
口语内容整理。过滤语气填充词,识别口头改口,输出排版整洁的可读文稿,原始录音留存需求下关闭整理开关,拿到一字不差的口述记录。
自定义词条适配。导入业务专属词汇清单,降低专业内容识别出错概率。
多语种混合音频处理。自动判别音频语种,不需要提前手动指定音频语言。
跨模型任务分发。转写环节触发函数调用,把后续工作交给其他模型,执行文件摘要、内容解析等操作。
Gemini 3.5 Transcribe项目地址
- 项目官网:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
Gemini 3.5 Transcribe应用场景
手机端语音输入。安卓 Gboard 的 Rambler 功能依托这套模型,口述内容直接生成排版完成的文字,语音指令还能完成改错、改写文本风格。
会议录音处理。导入会议录音,生成带说话人标记的文稿,减少人工整理录音的工作量。
实时字幕输出。直播、线上课堂、远程会议场景生成字幕,应对现场环境噪音和口音混杂的音频素材。
通话后内容分析。读取客服通话存档音频,产出结构化文本用于业务归档。
桌面端语音工作流。macOS Gemini 客户端依靠语音指令联动屏幕上下文,语音即可触发本地文件总结、跨应用文本复用、光标位置生成图片。Chrome 浏览器后续版本会接入模型,网页输入框支持直接口述输入内容。
开发者搭建语音代理。借助第三方开发平台,不用维护底层流媒体基础设施,专注做产品交互层开发。医疗、跨境语言服务类企业已经开展实际业务落地。
法律取证、档案留存场景,不要直接使用经过润色整理后的文稿。关闭全部口语整理逻辑,获取逐字转录版本保留全部口述细节。
开发者接入说明
开发者身份用户,在公开预览阶段,通过 Google AI Studio、Google Antigravity 调用模型 API。企业用户走 Gemini 企业代理平台接入,面向客户体验的企业版能力会后续上线。普通使用者可以直接体验 macOS Gemini 客户端,安卓 Rambler 功能在部分国家地区开放,Chrome 浏览器的语音输入能力等待版本更新。
两套接口分开使用,实时语音交互选择 live 版本接口,处理本地音频文件选择标准 Transcribe 接口。上线正式业务之前,需要拿真实业务音频样本做效果验证。
Gemini 3.5 Transcribe同类产品对比
| 对比项 | Gemini 3.5 Transcribe | Qwen‑Audio‑3.0‑ASR‑Flash |
|---|---|---|
| 研发主体 | Google DeepMind | 阿里通义千问 |
| 产品定位 | 企业级智能语音转写模型,兼顾实时流与离线文件转写 | 高性能多语种 ASR 模型,面向开发者与企业批量语音识别业务 |
| 核心特色 | 支持 85 + 语种,智能转写可自动过滤口头禅、修正口误,区分逐字 / 智能输出模式,支持自定义专业词表、说话人区分、词级时间戳,支持会话内多语言切换The Keywor…。 | 中文及方言识别能力突出,支持热词、上下文提示偏置,标点与数字归一化完善,支持流式与长音频文件转写,可输出时间戳、说话人分离结果阿里云帮助…。 |
| 部署方式 | Gemini API,公有云调用 | 阿里云百炼 API,支持私有化部署 |
| 适用场景 | 跨国会议记录、多语种访谈、口述文稿整理、海外业务语音转写 | 中文会议录音、短视频字幕、方言素材处理、国内业务大批量音频识别 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



