来源:市场资讯
(来源:智通财经)
智通财经APP获悉,谷歌(GOOGL.US)公布了Gemini 3.5 Transcribe,并称这是该公司迄今为止精确度最高的语音转文本模型。谷歌表示:“与传统语音识别模型在处理背景噪音、复杂专业术语以及口语停顿和不流畅表达清理等问题时表现不佳不同,Gemini 3.5 Transcribe能够将原始音频直接转换为准确、经过润色且格式规范的文本。”
据悉,该模型旨在轻松接入开发者的工作流程,从而支持构建语音代理、实时字幕或通话后分析处理流程。开发者可以通过Live API实现实时流式处理,也可以通过Interactions API处理预先录制的音频。其部分功能包括智能转录,可自动清理文本,例如删除口头停顿;识别自定义词汇;支持超过85种语言;并能够识别最多3名说话者。
该模型在流式处理场景下的错误率为4%,非流式处理场景下的错误率为2.6%。在涵盖多种语言的FLEURS基准测试中,其表现也更好。例如,Gemini Transcribe 3.5 Live的词错误率为5.5%,相比之下,OpenAI的GPT Live Transcribe词错误率为8.9%。
新模型从今天起面向开发者和企业用户开放公开预览。对于其他所有用户,该模型目前可在macOS版Gemini应用中以英语使用,并可在部分国家的Android版Rambler中使用。该模型很快还将登陆Chrome。
本月早些时候,谷歌发布了Gemini 3.7 Flash,Gemini应用的用户数量也突破10亿。不过,谷歌尚未发布下一代旗舰模型Gemini 3.5 Pro。在今年5月举办的2026年I/O开发者大会上,皮查伊曾表示会在6月推出Gemini 3.5 Pro模型,但该模型至今仍未上线。按照原本规划,Gemini 3.5 Pro模型应该承担谷歌重新冲击AI前沿竞争的任务。毕竟,在OpenAI、Anthropic不断刷新模型能力的背景下,Gemini Pro系列一直是外界衡量谷歌AI实力的重要标尺。但下一款旗舰模型的发布时间迟迟无法确定,也进一步加剧了外界对这家科技巨头能否超越竞争对手、并成功将巨额AI投资转化为市场领先的工具和服务的广泛疑问。
热门跟贴