作者|冬梅
谷歌发布号称“迄今最强”语音转文本模型
8 月 26 日,谷歌发布新一代语音转文本模型 Gemini 3.5 Transcribe,可以在转录过程中自动处理“嗯”“啊”等语气词、口误和重复表达,并补充标点、大小写及文本格式。
谷歌将其称为“迄今最精确的语音转文本模型”,谷歌 CEO Pichai 在 x 上宣布了该模型。
与只追求逐字记录的传统语音识别模型不同,Gemini 3.5 Transcribe 希望直接将原始语音转换为更接近成稿的文本,减少用户后续整理会议记录、采访速记和通话内容的工作量。
例如,当用户说“我们周二开会——不,改成周三”时,模型能够理解后半句是对前面内容的修正,并在最终文本中保留正确结果,而不是机械记录整段口误。
Gemini 3.5 Transcribe 支持 85 种以上语言和地区变体,并能够自动判断当前使用的语言。用户不需要提前设置语种,即使在一句话或者同一段对话中切换语言,模型也可以继续转录。
这项能力主要面向跨国会议、多语言访谈、客服通话以及同时夹杂中英文专业术语的场景。
在真实录音中,影响转录准确率的往往不只是口音,还包括背景噪声、多人同时发言和专业词汇。谷歌称,Gemini 3.5 Transcribe 针对嘈杂环境、不同口音和多语言对话进行了优化,并增强了对电话号码、邮政编码、订单号等字母与数字混合信息的识别能力。
Gemini 3.5 Transcribe 可处理实时语言切换和无缝流式转录
模型还支持自定义词表。开发者最多可以提供 1000 个专业词汇、缩写、人名或产品名称,引导模型优先识别这些内容。谷歌表示,在实际使用中,自定义词表控制在 100 个词以内通常效果更好。
使用 Gemini 3.5 转录功能,通过智能转录功能清除语音不流畅之处。
这对于技术采访可能更实用。例如,用户可以提前加入 Kubernetes、BigQuery 以及公司和产品名称,减少模型将专业名词识别成发音相近词语的情况。
Gemini 3.5 Transcribe 还提供“说话人分离”能力,可以识别最多 8 名说话人,并把不同语音片段分配给相应的说话人标签。不过,谷歌同时提醒,三名以上说话人的识别目前仍属于实验性能力。
对于预先录制的音频,模型还能输出逐词时间戳,标明每个词在录音中的起止时间,方便用户制作字幕、检索原始录音或者定位采访原话。启用说话人分离或逐词时间戳后,单次录音长度上限为 30 分钟;普通音频转录则支持单次最长 1 小时。
3.5 转录功能提供多说话人归属和单词级时间戳的转录。
流式转录词错误率 4.0%
根据谷歌引用的 Artificial Analysis 测评数据,Gemini 3.5 Transcribe 在实时流式场景中的平均词错误率为 4.0%,非流式录音处理的平均词错误率为 2.6%。
词错误率通常用于衡量语音识别结果中替换、删除和新增词语所占的比例,数值越低,意味着转录结果越接近原始语音。不过,不同测试集的语言、噪声和口音分布会影响最终成绩,这组数据不能直接代表模型在所有录音条件下的准确率。
与谷歌上一代语音转录模型 Chirp 3 相比,Gemini 3.5 Transcribe 的最终转录延迟缩短了 70%。实时版本可以通过 WebSocket 持续接收语音,并以低于一秒的延迟返回阶段性转录结果。
谷歌此次提供两个版本:`gemini-3.5-transcribe-live`面向实时字幕、语音输入和 Voice Agent;`gemini-3.5-transcribe`则用于处理采访录音、会议、通话记录等预录制音频,支持说话人分离和逐词时间戳。
开发者目前可以通过 Google AI Studio 中的 Gemini API,以及 Gemini Enterprise Agent Platform 调用该模型。实时转录的综合价格约为每分钟 0.009 美元,非实时转录约为每分钟 0.005 美元,同时提供免费测试额度。
语音转录开始从“听写”走向“整理”
Gemini 3.5 Transcribe 最值得关注的地方,并不只是词错误率进一步下降,而是语音转录工具正在改变输出目标。
过去的自动语音识别主要追求忠实记录:说话人讲了什么,系统就尽量逐字写下什么。但真实口语中充满语气词、重复、停顿、临时改口和不完整句子,即使识别完全准确,输出结果往往仍然无法直接阅读。
Gemini 3.5 Transcribe 加入的 Smart Transcription,会主动清理语气词和重复内容,根据上下文处理自我修正,并把口语转成带有标点和结构的文本。它还支持“逆文本规范化”,例如将英文口述的“twenty six million dollars”直接转换为“$26M”。
这意味着,模型给出的不再只是原始速记,而是一份经过初步整理的文本。
不过,这种“智能整理”也带来了新的风险。对会议纪要和日常语音输入而言,删除语气词通常不会影响信息;但在新闻采访、法律取证和需要逐字核对的场景中,自动删除重复表达或改写数字,可能改变说话人的原始措辞。
为此,Gemini 3.5 Transcribe 同时提供 Verbatim 模式,允许开发者获得更接近逐字记录的文本。实际使用时,是否启用语气词清理和智能格式化,应当根据场景决定,而不能简单地把“更整洁”视为“更准确”。
目前,这项技术也开始进入谷歌自己的产品。Android 版 Gboard 的 Rambler 功能可以将口述内容转换为格式化文本,并允许用户通过语音继续修改措辞和风格;在 macOS 版 Gemini 应用中,模型还可以结合屏幕上下文识别文件名和当前文档,并通过语音指令调用其他 Gemini 模型完成文件总结、文本改写和图片生成。
从这个角度看,Gemini 3.5 Transcribe 并不只是一款新的听写模型。谷歌正在把语音转录变成 AI 操作系统的入口:用户不必先把语言整理成标准指令,而是可以直接带着停顿、口误和临时修改说出需求,再由模型理解真正意图并继续执行任务。
谷歌看不清形势?
在行业狂卷多模态、Coding Agent 的大环境中,表面上看,谷歌此时单独发布一款语音转文本模型,很容易给人一种“还在解决上一代问题”的感觉,所以在 x 上,有也用户评价谷歌“看不透形势”。
可以说,网络上不看好的声音巨多。
更尖锐的批评来自一名 Gemini Ultra 用户。
他表示,自己已经后悔升级,因为所谓的额外功能,只有在模型能力和产品迭代真正跟上行业进度时才有意义。他曾经希望谷歌能够赢下这场竞争,这份信心很大程度上来自 Demis Hassabis 及其领导下的 DeepMind。但随着 Demis 不再负责 DeepMind 的日常运营,他感觉“DeepMind 的灵魂已经离开了”。在他看来,失去鲜明的研究方向和领导者之后,谷歌面对的就只剩下一场赤裸的模型能力较量,而它目前正在这场竞争中落后。
Gemini 3.5 Transcribe 的发布进一步强化了这种失望:当同行都在强调更强的 Agent、端到端语音交互和复杂任务执行时,谷歌却把一款语音转文本模型推到台前,容易让付费用户产生一种产品节奏与行业焦点错位的感觉。需要指出的是,这更多反映了用户对谷歌整体 AI 进展和产品体验的不满,并不能单凭一款转录模型判断其技术路线已经落后。
那么,谷歌真如上述网友所言,已经到了很糟糕的境况了吗?
事实上, Gemini 3.5 Transcribe 的目标并不是重新发明听写工具,而是补齐语音 Agent 进入生产环境前最基础、也最容易被忽视的一层:让机器先稳定听懂人类。
在客服、会议、采访、医疗记录等场景中,背景噪声、多人说话、临时改口、中途切换语言以及订单号等复杂信息,仍会直接影响后续 Agent 执行。
自动去除“嗯、啊”、理解自我修正,并输出带格式的文本,实际上是在把语音从原始输入整理成更适合模型继续处理的结构化上下文。
因此,这款产品在叙事上不如端到端语音模型性感,笔者认为它未必落伍。
真正的问题在于,谷歌如果只把它作为一项孤立的转录服务,价值确实有限,只有将其嵌入 Gboard、Gemini、Chrome 和企业 Agent 工作流,让语音成为调用工具和执行任务的入口,它才可能体现战略意义。
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
https://ai.google.dev/gemini-api/docs/pricing?hl=zh-cn
声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。
会议推荐
QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。
今日荐文
你也「在看」吗?
热门跟贴