长期以来,智能手机支持语音转文字,但手语转文字却一直是个空白。如今,随着Pixel 11系列的发布,这一局面开始改变。

谷歌旗下DeepMind推出了全新的手语转文字模型(SL2T),并将其直接嵌入Gboard和Live Transcribe应用,让聋哑及听力障碍用户可以在原本需要打字的场景中,通过手语与手机交互,例如搜索网页、发送消息、与Gemini聊天机器人对话等。

打开网易新闻 查看精彩图片

DeepMind表示,聋人群体的手语、口语、阅读和书写熟练度差异很大,因此支持多种交互方式非常重要。“聋人可以像听力正常人受益于语音处理一样,受益于手语处理,这项技术还为弥合聋人与听力社区之间的沟通鸿沟开辟了新可能。”

据介绍,SL2T模型基于超过10万小时的多语言手语视频数据训练,其中约四分之一为美国手语(ASL)数据,因此目前仅支持将ASL转录为英文。谷歌计划未来支持更多语言和设备。

为了保障用户隐私,SL2T并不直接分析原始视频,而是由设备端模型先将画面转换为由几何坐标构成的“线框”,再发送至谷歌服务器进行翻译。DeepMind还强调,与以往的手语转文字系统不同,SL2T能够直接根据线框生成文本,无需经过中间步骤“注释”(gloss),因为注释难以捕捉手语中丰富、非线性的表达特征。

随着Pixel 11的上市,这项技术将率先在特定设备上落地,未来将逐步扩展到更多安卓设备。