AI 快讯Google手语模型落地Pixel 11
模型上新

Google手语模型落地Pixel 11

2026-08-12T16:03:50.625Z
Google手语模型落地Pixel 11

Google DeepMind 发布实时手语转文字模型 SL2T,并将其率先接入 Pixel 11 的 Gboard 与 Live Transcribe。首发仅支持美国手语转英语,真正的进步不是模型跑分,而是手语第一次成为手机系统级输入方式。

手语第一次成为手机的系统级输入方式

Google DeepMind 近日发布手语转文字模型 SL2T,并把它直接接入 Pixel 11 的 Gboard 和 Live Transcribe。首发版本支持美国手语(ASL)转英语,用户面对手机摄像头打手语,系统即可实时生成英文文本,不必先用键盘输入,也不需要由另一名用户复述。

SL2T 是一个把连续手语视频直接转换为书面文本的视觉语言模型。与识别单个手势的旧式方案不同,它处理的是一段具有时间顺序、语法结构和非手部信息的完整表达,目标更接近语音识别,而不是给若干手势贴标签。

这次发布最重要的变化不是 DeepMind 又训练了一个模型,而是手语 AI 正式进入高频消费级产品。过去几年,手语识别成果大多停留在论文、数据集、演示视频或开发者模型阶段;SL2T 则从 Pixel 11 首发,直接进入 Gboard 和 Live Transcribe 两个系统级入口。

Pixel 11 用户面对前置摄像头使用美国手语,Gboard 与 Live Transcribe 实时生成英文文本的产品示意图

截至 2026 年 8 月 12 日,Google 尚未公布 SL2T 的参数规模、标准测试集成绩、端到端延迟以及完整部署方式。因此,现阶段无法用 BLEU、WER 或 Sign Language Translation Benchmark 等指标,判断它是否是绝对意义上的「最强手语模型」;能够确认的是,它已经完成了从研究模型到实际无障碍功能的关键跨越。

Gboard 与 Live Transcribe 分别解决什么问题

Gboard 是 Google 面向 Android 等平台推出的输入法产品,而 SL2T 让手语第一次成为它的直接输入形式。用户可以对着摄像头完成表达,模型将手语转换成英文,再把文本填入聊天、搜索、邮件或表单等输入框。

Gboard 的价值在于让手语用户进入现有的软件交互流程。过去,一名以手语为主要语言的用户要发送文字消息,通常仍需切换到书面英语键盘;SL2T 相当于为 Gboard 增加了一种视觉输入法,使手语可以像语音输入一样进入任何文本框。

Live Transcribe 是 Google 的实时转录无障碍应用,原本主要把环境中的语音转换为屏幕文字。接入 SL2T 后,它开始覆盖相反方向的沟通:手语用户可以打手语,手机则为不懂手语的人显示英文文本。

Live Transcribe 的使用场景更接近面对面交流。医院问诊、酒店前台、商店结账、课堂讨论和临时求助等场景,并不总能及时找到手语翻译员;如果 SL2T 的延迟和稳定性足够好,一部 Pixel 11 就能承担基础沟通工具的角色。

这两个入口形成了互补关系:Gboard 面向「人与应用」,Live Transcribe 面向「人与人」。Google 没有单独发布一个需要用户主动寻找的新应用,而是把模型放进已有的输入与无障碍产品,这种集成路线比展示一段效果不错的演示视频更有现实意义。

SL2T 难在哪里:手语不是把动作逐字翻译

美国手语是一门拥有独立语法、词汇和表达规则的自然语言,并不是把英语单词换成手部动作。ASL 的语序、空间指代和话题结构都可能与英语不同,因此 SL2T 面对的是跨语言翻译,而不是简单的动作识别。

手语理解至少需要同时处理五类视觉信号:手形、手掌朝向、运动轨迹、动作位置和非手部标记。眉毛变化、嘴形、头部倾斜和身体姿态,都可能改变一句话的语气或语法功能;如果模型只裁剪双手区域,往往会丢掉重要信息。

连续手语识别还必须解决动作边界问题。自然交流不会在每个词之间停顿,过渡动作也不等于实际词汇,模型需要在连续视频中判断一个表达何时开始、何时结束,以及哪些运动只是从前一个手势移动到后一个手势。

空间语法进一步提高了建模难度。手语者可以在身体周围建立人物或物体的位置,之后通过指向、方向性动词和动作路径继续引用这些对象;这要求模型保留较长时间范围内的视觉上下文,而不是逐帧分类。

SL2T 因此更像是「视觉版的语音翻译系统」。一个可用的系统需要把摄像头画面中的时序特征压缩成语言表示,再生成符合书面英语习惯的文本,同时还要应对遮挡、光线变化、摄像头角度、动作速度和个体表达差异。

Google 尚未公开 SL2T 的具体网络结构,因此不能确认它采用了纯视觉 Transformer、视觉编码器与语言模型组合,还是其他端到端架构。官方将它描述为实时手语转文字模型,但没有披露帧率、上下文窗口、量化方式和推理芯片占用,现阶段不应把合理推测写成已经确认的技术事实。

SL2T 与 SignGemma 不是同一个发布

SignGemma 是 Google 此前公布的开放权重手语理解模型方向,重点是让研究者和开发者能够围绕手语翻译继续开发。它曾以美国手语转英语为主要能力展示,同时面向更广泛的多语言手语研究目标。

SL2T 则是进入 Google 消费级产品的手语转文字模型。现有公开信息没有表明 SL2T 就是 SignGemma 的简单改名版,也没有证据证明二者使用完全相同的参数、训练数据或推理架构,因此不能把 SignGemma 的开放属性直接套用到 SL2T 上。

两者的差异可以概括如下:

| 项目 | SL2T | SignGemma | 传统 Live Transcribe | |---|---|---|---| | 核心定义 | 连续手语视频转书面文本模型 | 面向手语理解与翻译的 Gemma 系列模型方向 | 语音与环境声音实时转文字产品 | | 当前主要任务 | ASL 转英语文本 | 主要聚焦 ASL 与英语翻译,并面向多语言研究 | 口语转文字、声音事件提示 | | 产品状态 | 已进入 Pixel 11 的 Gboard 与 Live Transcribe | 侧重开发者和研究生态 | 已长期用于 Android 无障碍场景 | | 输入方式 | 摄像头中的连续手语 | 手语视频或相关视觉数据 | 麦克风音频 | | 输出方式 | 英文文本 | 文本或模型表示,取决于具体实现 | 实时字幕 | | 开放情况 | Google 未宣布开放权重 | 采用 Gemma 生态路线,具体许可需以模型页面为准 | 产品功能,不是开放模型 | | 官方公开跑分 | 截至 8 月 12 日未披露 | 需以具体模型卡为准 | 不适用 | | 首发设备 | Pixel 11 | 不绑定单一消费设备 | 多款 Android 设备 |

SL2T 的产品化价值目前高于它的研究可复现性。SignGemma 更适合高校、无障碍组织和开发团队做二次研究,SL2T 则优先解决普通用户能否马上使用的问题;前者强调生态扩散,后者强调端侧体验与系统整合。

「实时」仍缺少关键数字

实时手语转文字的核心指标不是单一翻译分数,而是准确率、延迟、稳定性和功耗的组合。即使离线测试成绩很高,只要一句话结束后需要等待数秒,面对面交流就会频繁出现打断和抢话,实际体验仍然不合格。

Google 此次没有给出足以交叉验证的量化结果。官方没有公布从摄像头采集到首个文本字符出现的延迟,也没有给出完整句子的平均处理时间,更没有说明 Pixel 11 上的持续功耗与发热表现。

目前已公开和未公开的信息可以明确区分:

| 指标 | 截至 2026 年 8 月 12 日的公开情况 | 为什么重要 | |---|---|---| | 首发语言方向 | 美国手语转英语 | 决定当前可服务的人群范围 | | 首发产品 | Pixel 11、Gboard、Live Transcribe | 说明模型已进入系统级应用 | | 模型参数量 | 未披露 | 影响部署成本与设备要求 | | 端到端延迟 | 未披露具体毫秒数 | 决定是否能自然对话 | | 翻译准确率 | 未披露统一测试集成绩 | 决定复杂表达是否可靠 | | 端侧运行比例 | 未明确说明 | 关系到隐私、离线可用性和成本 | | 支持的其他手语 | 尚未公布上线时间表 | 决定多语言扩展速度 | | 单独订阅价格 | 未宣布 | 当前更像 Pixel 功能,而非独立收费服务 |

缺少数字意味着现在不适合用「最强」评价 SL2T。对于无障碍产品来说,公开整体平均准确率也不够,Google 后续还应提供不同肤色、服饰、背景、拍摄角度、动作速度和签署者熟练程度下的分组结果,否则一个漂亮的平均分可能掩盖少数用户持续识别失败的问题。

Pixel 11 首发既是优势,也是限制

Pixel 11 为 SL2T 提供了可控的摄像头、芯片和系统软件环境。Google 可以针对固定硬件做模型量化、内存管理和相机管线优化,也可以把识别结果直接送入输入法与无障碍服务,减少第三方应用之间的数据传递和延迟。

Pixel 11 独占或优先首发也限制了功能的短期覆盖面。无障碍技术真正需要服务的是尽可能多的用户,而不是只服务购买最新旗舰手机的人;如果 SL2T 长期绑定单一代 Pixel,其社会价值会明显低于技术潜力。

端侧处理比例将决定 SL2T 能否进入更多敏感场景。手语视频可能包含面部、家庭环境、医疗交流和身份信息,如果全部上传云端处理,用户会面临持续的视频数据暴露风险;如果主要在设备本地推理,则能同时改善隐私、弱网可用性和响应速度。

Google 目前没有完整说明 SL2T 的视频是否默认离开设备、哪些步骤在本地执行,以及数据会保留多久。对于面向 Deaf 与听障群体的产品,这些信息不应只藏在冗长的隐私政策中,而应在功能首次启用时清楚展示。

真正难扩展的是语言和数据,而不只是算力

多语言手语模型是能够理解或翻译多种手语的模型,但「多语言」不代表不同国家的手语可以直接互通。美国手语、英国手语、中国手语以及其他地区手语拥有不同词汇和语法,ASL 与英国手语甚至不是同一种语言的地区口音关系。

SL2T 首发只提供 ASL 转英语是务实选择,也暴露了扩展难度。高质量手语数据比语音和文本更稀缺,采集视频需要更高存储成本,标注者还必须同时理解手语和目标书面语言;涉及医疗、教育和私人交流的数据,又很难通过大规模网络抓取获得。

领域偏移是训练环境与真实使用环境不一致导致性能下降的现象。实验室数据通常构图稳定、光线充足、签署者位于画面中央,而真实用户可能单手持机、在车站逆光拍摄,或者只让上半身的一部分进入画面,这些变化都会影响模型表现。

与 Deaf 社区共同开发是 SL2T 能否成功的关键条件。Google DeepMind 强调该模型与 Deaf 社区合作构建,这比单纯扩大训练数据更重要,因为社区成员能够指出研究团队容易忽视的问题,例如表达习惯差异、界面是否强迫用户维持不自然姿势,以及错误文本会不会让用户在医疗或法律场景承担风险。

这是一项有用的产品,但还不是通用手语翻译器

SL2T 当前最值得肯定的地方,是它没有要求用户迁就键盘和语音界面。过去的计算设备默认人类通过手指敲击、触摸或说话完成输入,而 SL2T 开始让设备主动理解手语,这是一种交互权力关系的变化。

SL2T 当前最明显的短板,是语言覆盖和设备覆盖都很窄。美国手语转英语无法直接服务使用其他手语的人群,Pixel 11 首发也意味着大量 Android 和 iPhone 用户暂时无法获得同等能力。

SL2T 也不能取代专业手语翻译员。模型适合日常聊天、短消息和低风险事务,但在医疗诊断、法律陈述、教育评估和紧急事件中,一个翻译错误可能改变关键含义;在 Google 公布详细评测与风险边界之前,它更适合被视为辅助沟通工具。

这次发布仍然可能成为无障碍 AI 的一个分水岭。语音识别用了多年时间才从实验功能变成手机标配,手语识别现在也开始走同一条路:先在硬件和场景可控的设备上落地,再扩大语言、终端与应用覆盖。

接下来最值得关注的不是 SL2T 会不会出现在一段更炫的演示里,而是三个具体问题:Google 何时公布可验证的准确率与延迟,何时扩展到 Pixel 11 之外的设备,以及何时支持 ASL 之外的更多手语。只有这三个问题得到回答,SL2T 才能从一项优秀的 Pixel 功能,变成真正普惠的手语基础设施。

参考来源

相关推荐

查看全部