Google发布了一款新的语音识别模型Gemini 3.5 Transcribe。它能够从原始语音数据中生成准确、格式规整的文本。
实时转写与自动清理
打开网易新闻 查看精彩图片
该模型在实时文字转写过程中,可以自动删除“あー”“えー”这类语气词。面对噪声、复杂专业术语和口语表达,它也能保持较好的识别效果。
打开网易新闻 查看精彩图片
输出格式化的文本
打开网易新闻 查看精彩图片
根据Google的介绍,Gemini 3.5 Transcribe不只是简单记录语音内容,而是直接产出经过格式处理的文本,省去后续整理步骤。
热门跟贴