手语AI落地:SL2T模型如何让聋人用户用母语与手机对话?
手语AI的突破:从实验室到用户指尖
长期以来,人工智能在语音处理领域取得了显著进展,自动翻译、听写和对话界面让听力正常用户享受到了前所未有的便利。然而,这一技术革命并未惠及全球200多种手语及其使用者——约7000万聋人和听力障碍人士。如今,Google DeepMind推出了大规模多语种手语转文本(SL2T)翻译模型,标志着在手语翻译质量和通用性上的重大突破。该模型首次将手语AI从实验室带入消费产品,支持Gboard和Live Transcribe中的手语转文本听写功能,首先支持美国手语(ASL)到英语的翻译,未来将扩展到更多设备和语言。
手语的重要性与独特挑战
手语是聋人社区的主要语言,也是聋人文化认同的基石。聋人在手语、口语、阅读和写作方面的熟练程度存在巨大差异,因此支持多种模态的访问至关重要。手语处理技术能让聋人像听力正常的人受益于语音处理一样受益,同时为弥合聋人与听力社区之间的沟通鸿沟开辟新可能。然而,手语AI的发展一直缓慢,原因在于构建手语AI面临复杂挑战,且对手语本身存在广泛误解。
与口语转录相比,手语翻译面临两大核心挑战。首先,语音转录是从声音到文本的同一语言顺序映射,而手语是独立的自然语言,拥有独特的语法和词汇,因此需要真正的机器翻译,而非简单的符号到单词的转换。其次,模型必须学会“看见”并理解物理运动。手语通过手、手臂、躯干、头部和脸部的同步运动传达意义,在高帧率下准确追踪这些运动是一项困难且计算密集的计算机视觉任务。
早期的手语技术尝试,如手语手套,之所以根本受限,正是因为手语并非“手上的英语”,它需要复杂的全身精细动作视觉感知和完整的语言翻译。SL2T正是为同时满足这两点而设计的。
SL2T的工作原理
SL2T的构建结合了以用户为中心、文化知情的方法与大规模数据扩展。模型在超过10万小时、涵盖50多种手语的数据上训练,其中约四分之一为ASL数据。通过在不同语言、方言和熟练水平上联合训练,模型学习了共享的底层结构,在实验中优于单语言模型。
为保护用户隐私,SL2T将手语视为一系列姿态关键点位置,而非原始摄像头画面。设备端模型(MediaPipe Holistic)追踪手语者的关键点位置,仅将这些几何坐标发送到服务器进行翻译,原始视频立即丢弃。
SL2T直接将坐标序列翻译为文本,绕过了先前工作中广泛使用的中间注释(称为“glosses”)。Glosses无法捕捉手语的丰富非线性方面,如非手动标记和空间构型。直接从关键点翻译消除了人为词汇限制,使翻译质量能随数据规模直接提升。
根据FLEURS-ASL等关键基准测试,SL2T是迄今为止最强大的手语翻译模型。在ASL到英语翻译质量评估中,SL2T取得了70 BLEURT的零样本分数,显著高于此前任何报告的结果。但优化学术基准并不能保证实际应用中的可用性,因此团队在最小化流式延迟、防止非手语输入时的幻觉、确保对10%左撇子手语者的公平性,以及改善单手手语(如手持智能手机时)的性能等实际问题上投入了大量精力。
与社区共建
团队坚信与聋人社区共建,而非仅仅为其建设。聋人的观点贯穿项目始终,从聋人谷歌员工Sam Sepah的构想,到与聋人伙伴的数据收集、聋人用户研究中的评估,以及与聋人专家的影响评估。为引导负责任的现实部署,团队成立了AI手语咨询委员会(AISLAC),汇集了众多全球聋人组织和领域专家。通过这种参与式治理模式,受技术影响最大的社区直接影响开发优先级。团队联合发布了SL2T 1.0在Gboard和Live Transcribe中发布的联合影响报告,透明地详述了技术能力和当前局限,这一合作方式计划在所有主要手语发布中延续。
未来展望
SL2T建立在学术界和工业界数十年的基础研究之上,但将ASL输入带到用户手机只是开始。谷歌的使命是组织世界信息并使其普遍可访问和有用。实现普遍可访问意味着与口语和书面语完全对等。团队正致力于将这项技术扩展到更多手语、手语生成以及前沿AI能力。团队期待负责任地分享进展,使手语访问成为数字领域的标准。
用户可在Pixel 11上的Gboard和Live Transcribe中体验SL2T,更多设备即将推出,且无需额外费用。
致谢
这项工作由Google DeepMind和Android团队联合完成。SL2T模型核心开发团队包括Garrett Tanzer、Benoit Brard、Elizabeth Clark、Tim Dozat、Sebastian Ebert、Dan Garrette、Manfred Georg、Vicky Holgate、Shankar Kumar、Mohammad Saboorian、Miloš Stanojević、Megh Umekar、John Wieting、Andy Zhang和Chris Dyer。Android团队将模型集成到Gboard和Live Transcribe的成员包括Ausmus Chang、Sai Aditya Chitturu、Dayle Chiu、Anna Chou、Ajay Dudani、Angana Ghosh、Alex Huang、Joanne Kim、Ed Lee、Thomas Lin、James Su、Yanchao Su和Sharlene Yuan。此外,感谢Anelia Angelova、Abhishek Bapna、Sara Basson、Glenn Cameron、Scott Crowell、Trevor Cohn、Noah Fiedel、Zoubin Ghahramani、Raia Hadsell、Tom Hudson、Alexander Hauerslev Jensen、Kazuya Kawakami、Peike Li、Liam McCafferty、Caroline Pantofaru、Abhinav Parashar、Christopher Patnoe、Laura Rimell、Sagar Savla、Sam Sepah、Thad Starner、Dave Uthus和Biao Zhang的额外支持。同时感谢所有参与早期测试的人员。