Gemini 3.5 Transcribe – Google推出的最新语音转文本模型

Gemini 3.5 Transcribe 是谷歌推出的语音转文本模型,面向语音交互场景开发。传统语音识别模型在嘈杂环境、专业术语、口语冗余内容处理上存在短板,这套模型直接把原始音频素材输出为准确、经过润色、排版规整的文本内容。

该模型已经落地谷歌自有产品,安卓端 Rambler 功能、macOS 平台的 Gemini 客户端内部都在使用这套模型处理语音输入。外部开发者可以通过 Google AI Studio 以及 Gemini 企业代理平台的 API 接入,搭建属于自己的语音相关产品。模型对外提供两套独立接口,分别适配实时交互和历史录音处理。

实时流式接口使用gemini‑3.5‑transcribe‑live,依靠 Live API 完成双向持续数据流传输,端到端延迟控制在一秒以内,面向交互式语音应用开发。预录音频接口使用gemini‑3.5‑transcribe,依托 Interactions API 处理会议、通话录音文件,输出结果包含说话人归属信息以及逐词时间戳。

Gemini 3.5 Transcribe - Google推出的最新语音转文本模型

Gemini 3.5 Transcribe技术原理

整套模型依托 Gemini 3.5 基座做音频链路定制改造。音频信号送入模型后,先完成信号特征提取,转化为模型可解析的表征向量,再送入主干网络完成解码输出。

传统语音识别采用声学模型与独立语言模型拼接的两段式架构。Gemini 3.5 Transcribe 把声学解析、口语修正、语义理解、文本格式化全部收拢在同一个模型内部完成运算。音频特征和文本语义信息做深度融合,模型读取完整口语上下文,识别说话过程中的改口、自我修正、语气填充词。

两套推理逻辑对应两种接口形态。流式模式对音频做分片处理,片段持续送入模型,转写结果分段刷新输出,维持低延迟表现。文件处理模式读取全部音频特征,基于完整全局信息运算,拿到更高识别准确度。

模型开放提示词配置通道,外部调用时传入参数,调整口语清理力度、输出格式,导入自定义专有名词列表。对比前代 Chirp 3,转写完成耗时缩短 70%,多语言基准测试 FLEURS 数据集上,流式模式词错率 5.50%,非流式模式词错率 5.04%。

Gemini 3.5 Transcribe核心特点

流式场景实测词错率 4.0%,预录音频场景词错率 2.6%。现实环境的噪音干扰下,邮政编码、订单编号这类字母数字混合内容依旧可以稳定识别。

识别过程可以捕捉人说话时的自我修正行为,处理口语里的改口内容,过滤嗯、啊这类填充词,自动给文本添加标点、划分段落。这套文本整理逻辑支持开关切换,需要原始逐字记录的场景可以直接关闭。

支持函数调用机制,转写流程当中把任务分发至其他 Gemini 模型,完成图片生成、本地文件解析这类工作。该能力在 macOS 版 Gemini 客户端已经上线可用。

提供自定义词汇录入能力,录入行业术语、特殊人名、专属拼写,识别阶段优先匹配自定义词条,适配垂直领域业务。

覆盖超过 85 种语言,自动识别音频语种,单段音频内部出现多种语言交替,也可以正常完成转写,兼容各地口音与方言。

预录音频模式下,最多区分 3 位说话人,输出附带逐词时间戳。超过 3 人的说话人区分还处在实验阶段。

Gemini 3.5 Transcribe主要功能

实时流式转写。对接麦克风持续推送的音频流,分片返回文本片段,满足交互类产品对低延迟的硬性要求。

录音文件批量转写。上传已经保存的音频文件,输出完整转写结果,附带时间戳标记、说话人身份标记。

口语内容整理。过滤语气填充词,识别口头改口,输出排版整洁的可读文稿,原始录音留存需求下关闭整理开关,拿到一字不差的口述记录。

自定义词条适配。导入业务专属词汇清单,降低专业内容识别出错概率。

多语种混合音频处理。自动判别音频语种,不需要提前手动指定音频语言。

跨模型任务分发。转写环节触发函数调用,把后续工作交给其他模型,执行文件摘要、内容解析等操作。

Gemini 3.5 Transcribe项目地址

  • 项目官网:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

Gemini 3.5 Transcribe应用场景

手机端语音输入。安卓 Gboard 的 Rambler 功能依托这套模型,口述内容直接生成排版完成的文字,语音指令还能完成改错、改写文本风格。

会议录音处理。导入会议录音,生成带说话人标记的文稿,减少人工整理录音的工作量。

实时字幕输出。直播、线上课堂、远程会议场景生成字幕,应对现场环境噪音和口音混杂的音频素材。

通话后内容分析。读取客服通话存档音频,产出结构化文本用于业务归档。

桌面端语音工作流。macOS Gemini 客户端依靠语音指令联动屏幕上下文,语音即可触发本地文件总结、跨应用文本复用、光标位置生成图片。Chrome 浏览器后续版本会接入模型,网页输入框支持直接口述输入内容。

开发者搭建语音代理。借助第三方开发平台,不用维护底层流媒体基础设施,专注做产品交互层开发。医疗、跨境语言服务类企业已经开展实际业务落地。

法律取证、档案留存场景,不要直接使用经过润色整理后的文稿。关闭全部口语整理逻辑,获取逐字转录版本保留全部口述细节。

开发者接入说明

开发者身份用户,在公开预览阶段,通过 Google AI Studio、Google Antigravity 调用模型 API。企业用户走 Gemini 企业代理平台接入,面向客户体验的企业版能力会后续上线。普通使用者可以直接体验 macOS Gemini 客户端,安卓 Rambler 功能在部分国家地区开放,Chrome 浏览器的语音输入能力等待版本更新。

两套接口分开使用,实时语音交互选择 live 版本接口,处理本地音频文件选择标准 Transcribe 接口。上线正式业务之前,需要拿真实业务音频样本做效果验证。

Gemini 3.5 Transcribe同类产品对比

对比项Gemini 3.5 TranscribeQwen‑Audio‑3.0‑ASR‑Flash
研发主体Google DeepMind阿里通义千问
产品定位企业级智能语音转写模型,兼顾实时流与离线文件转写高性能多语种 ASR 模型,面向开发者与企业批量语音识别业务
核心特色支持 85 + 语种,智能转写可自动过滤口头禅、修正口误,区分逐字 / 智能输出模式,支持自定义专业词表、说话人区分、词级时间戳,支持会话内多语言切换The Keywor…。中文及方言识别能力突出,支持热词、上下文提示偏置,标点与数字归一化完善,支持流式与长音频文件转写,可输出时间戳、说话人分离结果阿里云帮助…。
部署方式Gemini API,公有云调用阿里云百炼 API,支持私有化部署
适用场景跨国会议记录、多语种访谈、口述文稿整理、海外业务语音转写中文会议录音、短视频字幕、方言素材处理、国内业务大批量音频识别
© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...