Google发布了一款新的语音识别模型Gemini 3.5 Transcribe。它能够从原始语音数据中生成准确、格式规整的文本。

实时转写与自动清理

打开网易新闻 查看精彩图片

该模型在实时文字转写过程中,可以自动删除“あー”“えー”这类语气词。面对噪声、复杂专业术语和口语表达,它也能保持较好的识别效果。

打开网易新闻 查看精彩图片

输出格式化的文本

打开网易新闻 查看精彩图片

根据Google的介绍,Gemini 3.5 Transcribe不只是简单记录语音内容,而是直接产出经过格式处理的文本,省去后续整理步骤。