Google DeepMind发布手语转文本模型SL2T并接入Pixel 11听写
Putting sign language AI into users’ hands
Google DeepMind发布大规模多语言手语转文本模型SL2T,先在Pixel 11的Gboard和Live Transcribe中把美国手语译成英语听写。
SL2T把超过五十种手语的身体关键点直接译成流式文本,并开始用于Pixel 11听写,读者可以据此了解手语输入如何接进日常打字。
2026年8月12日 模型
Google DeepMind 手语团队
推出手语转文本(SL2T),这是我们的突破性模型,为聋人和听障用户的全新手语功能提供支持。
近几十年来,AI 处理口语的能力迅速提升,使自动翻译、听写和对话界面对于健听用户而言变得毫不费力。然而,这场技术革命尚未惠及全球 200 多种手语,以及使用这些手语的约 7000 万聋人和听障人士。
今天,我们推出大规模多语言手语转文本(SL2T)翻译模型,标志着在质量和通用性上的突破。借助它,我们首次将手语 AI 从实验室带入消费产品:SL2T 为 Pixel 11 上 Gboard 和 Live Transcribe 中的手语转文本听写提供支持,首先从美国手语(ASL)转英语开始。更多设备即将推出,更多语言也将随后跟进。
正如健听用户可以使用听写来说话而不必打字一样,这项功能使聋人用户能够在通常需要打字的任何地方,对着手机打手语。你可以打手语来搜索网页、起草消息或文档,并让 Gemini 解答查询或执行任务。在 Live Transcribe 中,你可以在对话中用手语回应,而不必来回打字。据我们的测试者称,用 ASL 打手语比用英语打字更快、更自然,也更令人愉悦。
由 SL2T 驱动的手语转文本,使用户能够在通常需要打字的任何地方对着手机打手语。
为什么手语很重要
手语是世界各地聋人社群的主要语言,也是聋人文化认同的基石。聋人在手语、口语、阅读和书写方面的熟练程度差异很大,因此在所有模态上支持访问非常重要。聋人可以从手语处理中受益,正如健听者从口语处理中受益一样;此外,这项技术为弥合聋人社群与健听社群之间的沟通鸿沟开辟了新的可能。尽管存在这种产生积极社会影响的机遇,手语 AI 的进展却一直缓慢——既因为为手语构建 AI 面临复杂挑战,也因为关于这些语言本身如何运作存在广泛误解。
与口语转写相比,手语翻译面临两项核心挑战。第一,语音转写是在同一语言内将声音顺序映射为文本,而手语是独立的自然语言,拥有各自独特的语法和词汇。因此,它们需要真正的机器翻译,而不是手语到词语的顺序转换过程。第二,模型必须学会“看见”并理解身体动作。手语通过手、手臂、躯干、头部和面部的同时运动来传达意义。以高帧率准确追踪这些动作,是一项困难且计算要求很高的计算机视觉任务。
鉴于这一背景,不难理解为何一些早期的手语技术尝试(如手语手套)从根本上受到限制:手语并非简单地“手上的英语”。它们需要对精细的全身动作进行复杂的视觉感知,以及完整的语言翻译。SL2T 旨在同时实现这两者。
SL2T 将手语输入视为手语者身体上的点,并将其翻译为流式文本输出。示例来自 FLEURS-ASL 基准。
SL2T 的工作原理
我们通过将以用户为中心、具有文化意识的方法与大规模数据扩展相结合,构建了 SL2T。该模型在超过 50 种手语、逾 100,000 小时的数据上进行训练——其中约四分之一的数据为 ASL。在多种语言、方言和熟练程度上联合训练,使模型学习共享的底层结构,并在我们的实验中优于单语言模型。
为保护用户隐私,SL2T 将手语视为一系列姿态关键点位置,而非原始摄像头画面。设备端模型(MediaPipe Holistic)追踪手语者身上各点的位置,仅将这些几何坐标发送到服务器进行翻译,从而使原始视频可以立即丢弃。
SL2T 将这一坐标序列直接翻译成文本,绕过了先前手语翻译工作中广泛使用的、被称为“glosses”的中间标注。Glosses 无法捕捉手语丰富的非线性特征,例如非手控标记和空间构式。直接从关键点进行翻译消除了人为的词汇限制,使翻译质量能够直接随数据扩展。
根据 FLEURS-ASL(sd-test)等关键基准,SL2T 是迄今为止能力最强的手语翻译模型;该基准评估 ASL 到英语的翻译质量。SL2T 取得了出色的零样本得分 70 BLEURT,显著高于此前报告的任何分数。但仅优化学术基准并不能保证在实际应用中的可用性,因此我们在实际问题上投入了大量努力,例如尽量降低流式延迟、防止对非手语输入产生幻觉、确保对占手语者 10% 的左撇子公平,以及提升单手手语的表现——单手手语用于另一只手握持智能手机的情况。
| 原始英语 | SL2T 的 ASL → 英语输出 |
|---|---|
| 库克群岛没有任何城市,而是由 15 个不同的岛屿组成。主要岛屿是 Rarotonga 和 Aitutaki。 | 库克群岛没有城市,由 15 个岛屿组成。两个主要岛屿是 Rarotonga 和 Aitutaki。 |
| 比赛于上午 10:00 在很好的天气中开赛,除了午前有一阵很快放晴的毛毛雨外,这是进行 7 人制橄榄球的完美一天。 | 比赛于上午 10 点在很好的天气中开始。早晨有一阵小雨,随后放晴。这是进行 7v7 橄榄球的完美一天。 |
| 在一些联邦制国家,例如美国和加拿大,所得税在联邦层面和地方层面都会征收,因此税率和税级可能因地区而异。 | 在一些联邦制国家,如美国和加拿大,所得税在联邦和地方两级征收。这意味着税率和税级会因你所在的地区而异。 |
| 这种全身覆有羽毛、温血的猛禽据信曾以双腿直立行走,其爪子类似于 Velociraptor。 | 这种生物是温血的,吃灰色的东西,全身覆盖着羽毛。据信它像迅猛龙一样用两条腿行走。 |
| 也许有一天,你的曾孙们会站在一个外星世界之巅,思索他们远古的祖先? | 也许有一天,你的曾孙辈会站在一个外星世界上,反思他们的祖先。 |
来自 FLEURS-ASL 基准的示例。SL2T 能将复杂的 ASL 准确翻译成流畅的英语。偶尔的错误仍存在于罕见手语、快速手指拼写("prey" → "grey")、被动结构、分类器描绘(遗漏 "claws")以及缺乏上下文的时态("kicked off" → "start")中。
与社区共同构建
我们相信要与聋人社区共同构建,而不仅仅是为其构建。聋人的视角塑造了这个项目的每一个阶段——从聋人 Googler Sam Sepah 的概念构思,到与聋人合作伙伴的数据收集、聋人用户研究中的评估,以及与聋人专家共同进行的技术影响评估。
为指导负责任的现实部署,我们成立了 AI 手语咨询委员会(AISLAC),汇聚了众多全球聋人组织与领域专家。通过这一参与式治理模式,受我们技术影响最大的社区能够直接影响我们的开发优先事项。我们共同撰写了一份联合影响报告,用于 SL2T 1.0 在 Gboard 和 Live Transcribe 中的发布,透明地详述该技术的能力与当前局限——这是一种我们计划在所有主要手语发布中持续采用的协作方式。
展望未来
SL2T 建立在学术界与产业界数十年的基础研究之上,但将 ASL 输入带到用户手机上只是开始。Google 的使命是整合全球信息,使其普遍可访问且有用。实现普遍无障碍意味着与口语和书面语言达到完全对等。我们的团队正致力于将这项技术扩展到更多手语、手语生成以及前沿 AI 能力。我们期待负责任地分享我们的进展,以使通过手语进行访问成为整个数字领域的标准。
你可以首先在 Pixel 11 上的 Gboard 和 Live Transcribe 中体验 SL2T,更多设备即将推出——全部无需额外费用。
致谢
这项工作由 Google DeepMind 和 Android 的团队共同完成。开发 SL2T 模型的核心团队是:Garrett Tanzer、Benoit Brard、Elizabeth Clark、Tim Dozat、Sebastian Ebert、Dan Garrette、Manfred Georg、Vicky Holgate、Shankar Kumar、Mohammad Saboorian、Miloš Stanojević、Megh Umekar、John Wieting、Andy Zhang 和 Chris Dyer。
将模型集成到 Gboard 和 Live Transcribe 中的 Android 团队是:Ausmus Chang、Sai Aditya Chitturu、Dayle Chiu、Anna Chou、Ajay Dudani、Angana Ghosh、Alex Huang、Joanne Kim、Ed Lee、Thomas Lin、James Su、Yanchao Su 和 Sharlene Yuan。
我们感谢 Anelia Angelova、Abhishek Bapna、Sara Basson、Glenn Cameron、Scott Crowell、Trevor Cohn、Noah Fiedel、Zoubin Ghahramani、Raia Hadsell、Tom Hudson、Alexander Hauerslev Jensen、Kazuya Kawakami、Phoebe Kirk、Peike Li、Liam McCafferty、Caroline Pantofaru、Abhinav Parashar、Christopher Patnoe、Laura Rimell、Sagar Savla、Sam Sepah、Thad Starner、Dave Uthus 和 Biao Zhang 提供的额外支持。
我们也要感谢 MediaPipe Holistic(Google AI Edge)团队:Ivan Grishchenko、Artsiom Ablavatski、Valentin Bazarevsky、Esha Uboweja、George Sung、Jonathan Baccash、Gregory Karpiak、Sebastian Schmidt、Suril Shah、Raman Sarokin 和 Juhyun Lee。
同样非常感谢参与我们模型早期测试的各位。
来源:Google DeepMind · deepmind.google