IT时代网8月27日消息,在外界仍在等待 Gemini 3.5 Pro 亮相之际,谷歌先行推出 3.5 系列里的一款新模型。这家公司今天发布了 Gemini 3.5 Transcribe,一款面向语音输入场景的转写模型,能够自动剔除"嗯""呃"这类口头禅,也能识别说错后立刻纠错的内容,最终给出更通顺的文本。

记者注意到,该模型目前已经为 Pixel 11 上 Gboard 键盘的语音功能提供支持,后续还会进入谷歌更多产品。谷歌称,和上一代名为 Chirp 3 的转写引擎相比,Gemini 3.5 Transcribe 在速度与准确度上都有提升:从用户开口到生成文本,整体耗时预计缩短约 70%;实时场景下错误率已降到 5.5%,而 Chirp 3 为 7.32%。

这款模型不只是"听清"内容,还试图理解说话人本意。它能在对话过程中删掉影响流畅度的填充词,用户说错立即修正时也会实时调整已生成的文字,并支持自定义词汇表以识别专业术语。目前它支持 85 种语言,可处理最多 3 人的预录音频。

不过这种"智能润色"也带来一个隐忧:在需要严格保留原话的场景里,AI 对措辞的改动未必合适。短文本下体验尚可,但会议记录、医疗口述等场合,仍要谨慎选用。

打开网易新闻 查看精彩图片

注:本文综合自IT之家等,文中包含AI辅助创作的内容。