智东西编译 杨京丽编辑 李水青
打开网易新闻 查看精彩图片
智东西编译 杨京丽编辑 李水青

智东西8月13日消息,昨日,谷歌DeepMind推出大规模多语言手语转文本(sign-language-to-text,SL2T)翻译模型。

SL2T已率先接入Pixel 11上的谷歌输入法Gboard和实时转写应用Live Transcribe,首批支持将美国手语翻译成英文。用户可以直接对手机打手语,用于搜索网页、撰写消息或文档,以及向Gemini提问和交代任务。

打开网易新闻 查看精彩图片

▲谷歌DeepMind发布手语翻译模型SL2T(图源:X)

该模型的训练过程使用超过10万小时数据,覆盖50多种手语。谷歌称,SL2T在美国手语到英文翻译测试中的零样本BLEURT得分达到70,是目前最强的美国手语翻译模型

这是谷歌首次将手语AI从实验室引入消费产品。SL2T会先将用户的身体动作转换为关键点坐标,再直接生成文字,在保护原始视频隐私的同时,避免传统手语标注方式带来的信息和词汇限制。

一、用户可用手语搜索、写消息和向Gemini提问

全球共有超过200种手语,约7000万聋人及听障人士使用这些语言。借助SL2T,用户可以像使用语音输入一样,直接对手机打手语,输入文字。

例如,用户可以用手语搜索网页、撰写消息或文档,也可以向Gemini提问或要求其执行任务。在Live Transcribe中,用户可以直接用手语回复对话,无需双方反复打字。谷歌称,测试用户认为使用美国手语输入比输入英文更快、更自然。

与语音转写相比,手语翻译面临两项核心挑战。

首先,语音转写是在同一种语言中,将声音按照顺序映射为文字;手语则是拥有独立语法和词汇的自然语言。因此,手语需要真正的机器翻译,而不是按照顺序将手势逐一转换成单词。

其次,模型需要学会“看见”并理解身体动作。手语通过手、手臂、躯干、头部和面部同时发生的动作传递含义。在高帧率下,准确追踪这些动作,是一项难度和计算量都很高的计算机视觉任务。

打开网易新闻 查看精彩图片

▲模型根据肢体动作和表情翻译手语(图源:谷歌DeepMind)

手语手套等早期手语技术存在根本性局限,因为手语并非简单的“用手表达英语”。它既需要对细微的全身动作进行复杂的视觉感知,也需要完整的语言翻译能力。SL2T旨在同时解决这两项问题。

二、超10万小时数据训练,覆盖50多种手语

SL2T使用超过10万小时数据训练,覆盖50多种手语,其中约四分之一为美国手语数据。谷歌称,将不同手语、方言及不同熟练程度的使用者放在一起训练,有助于模型学习共享的底层结构,实验效果优于单语模型。

为了保护隐私,SL2T不会将原始摄像头画面直接发送到服务器。手机端的MediaPipe Holistic模型会先追踪用户身体上的关键点,仅将相应的几何坐标发送至服务器进行翻译,原始视频可以立即丢弃。

SL2T会把这些坐标序列直接转换成文字,不需要经过手语翻译研究中常用的中间标注。谷歌认为,直接翻译可以更好地处理面部动作和空间结构等信息,同时摆脱人工标注的词汇范围限制。

谷歌称,在评估美国手语到英文翻译质量的FLEURS-ASL测试中,SL2T是迄今为止最强大的手语翻译模型,其零样本BLEURT得分达到70,明显高于此前公开结果。谷歌还针对流式翻译延迟、非手语输入引发的幻觉、左撇子及单手打手语等真实场景进行了优化。

谷歌列出了下面5组案例,左侧为英文原文,右侧为SL2T根据手语翻译出的英文。

打开网易新闻 查看精彩图片

▲SL2T翻译案例(图源:谷歌DeepMind)

可以看出SL2T能够较为准确地传达原文意思。不过,模型仍可能在罕见手势、快速手指拼写、被动语态、空间描述和缺乏上下文的时态判断中出错。

谷歌称,聋人社区参与了SL2T从构想、数据收集到用户测试和影响评估的整个过程。公司还成立了AI手语顾问委员会(AISLAC),邀请全球聋人组织和相关专家参与制定产品开发重点,并共同发布SL2T 1.0影响报告。

结语:手语翻译模型走进消费产品

SL2T的进展不仅体现在训练数据规模和基准测试成绩上,更重要的是,它已经进入输入法和实时转写等实际使用场景,让手语像语音一样成为手机输入方式。

不过,SL2T首批仅支持美国手语到英文的翻译,在罕见手势、快速手指拼写、空间描述和时态判断等方面仍会出错。后续,期待谷歌能够将其扩展至更多手语,持续优化训练,在真实场景中保持翻译质量。

来源:谷歌DeepMind

打开网易新闻 查看精彩图片