Featured image of post Google DeepMind把手语AI带到Pixel:从实验室走向输入法

Google DeepMind把手语AI带到Pixel:从实验室走向输入法

SL2T率先支持ASL转英文输入。

核心事件

核心事件

Google DeepMind在8月12日发布多语种手语转文本模型SL2T,并宣布它将首先为Pixel 11上的Gboard与Live Transcribe提供美国手语(ASL)到英文的输入能力。

这意味着聋人和听障用户可以像听人使用语音听写一样,在手机上通过手语搜索网页、起草消息或文档,也可以向Gemini发出查询和任务请求;在Live Transcribe中,用户还可用手语回应对话,而不必反复打字。DeepMind称,测试者认为用ASL表达比用英文键入更快、更自然。

为什么手语AI更难

为什么手语AI更难

手语不是“把英语放到手上”。全球有超过200种手语,约7000万聋人和听障人士使用它们。手语拥有独立语法和词汇,因此从手语到文字不是简单逐词转写,而是机器翻译:模型需要理解一种自然语言,再生成另一种语言的文本。

难点还在视觉层面。手语同时依赖手、臂、躯干、头部和面部表情传递含义,系统必须在较高帧率下识别细微动作。这也是早期“手语手套”等方案受限的原因:它们难以捕捉全身动作、面部非手部标记和空间结构。

SL2T如何工作

SL2T如何工作

DeepMind称,SL2T使用超过10万小时、覆盖50多种手语的数据训练,其中约四分之一为ASL数据。多语言、方言和不同熟练度数据联合训练,使模型学习到跨手语的共同结构;在其实验中,这优于单一语言模型。

关键设计包括:

  • 隐私处理:手机端MediaPipe Holistic先提取身体关键点,服务器接收的是几何坐标序列,而非原始摄像头视频,原视频可立即丢弃。
  • 直接翻译:SL2T绕过传统“gloss”标注。gloss可理解为用书面词汇给手语动作做中间标签,但它难以表示非手部表情、空间指代等复杂语法。
  • 流式输出:模型把关键点序列直接转为持续生成的文本,以适配输入法和实时转写场景。

在FLEURS-ASL基准的sd-test评测中,SL2T取得70 BLEURT的零样本成绩。BLEURT是一种衡量机器生成文本与参考译文语义接近程度的指标。DeepMind表示,该成绩显著高于此前公开结果。

从基准到真实可用

从基准到真实可用

研究团队也承认,学术分数不能直接等同于产品体验。因此,SL2T针对真实使用做了优化,包括降低流式延迟、避免在非手语输入上“幻觉”生成文本、照顾约10%的左撇子手语者,并改进单手打手语场景——这对一手拿手机、一手表达的用户尤其重要。

官方示例显示,SL2T能把较复杂ASL内容翻成流畅英文,例如有关库克群岛、税制和体育比赛的句子;但错误仍存在,包括罕见手势、快速手指拼写、被动结构、分类器描绘以及缺少上下文时的时态判断。比如示例中“prey”被识别为“grey”,说明细粒度视觉识别仍是挑战。

行业点评

SL2T的意义不只是一项无障碍功能升级,而是把手语处理从研究演示推向消费级入口。输入法和实时转写是高频场景,一旦体验可靠,手语用户与搜索、消息、文档和AI助手之间的距离会明显缩短。

不过,手语AI的扩展不会像语音识别那样简单复制。不同国家和社群的手语差异很大,数据采集、社区参与、公平评测和隐私保护都将决定落地速度。DeepMind强调与聋人社区共同建设,并提到项目从概念、数据收集、用户研究到影响评估都引入聋人视角。接下来,SL2T能否从ASL到英文拓展到更多设备和语言,将成为衡量这类技术社会价值的关键。