Google DeepMind 发布手语转文本模型 SL2T
Google DeepMind 推出了一款名为 SL2T 的手语转文本模型,该模型将首先在 Gboard 和 Live Transcribe 中集成,并搭载于新款 Pixel 11 手机。公司表示,这是首款真正落地于消费产品的手语人工智能。
用手语代替打字,与设备交互
多年来,能听能说的人一直可以通过语音输入与设备对话。如今,那些无法使用语音输入但使用手语的人,也能借助 SL2T 在 Pixel 11 上浏览网页、编写消息或编辑文档。手语使用者还可以将任务直接交给 Gemini 助手。在 Live Transcribe 中,用户可以在面对面交谈时,用手语回复,而不必逐字打字。
目前,该模型仅支持美国手语(ASL)到英语的转换。Google 表示,未来将逐步推广到更多设备,并支持更多语言。据模型测试者反馈,使用美国手语签名比打字更快捷、更自然。
为什么手语对人工智能来说比语音更难?
DeepMind 将手语视为完整的自然语言,而非“手部表达的英语”。然而,与口语人工智能相比,手语的发展一直滞后,主要面临两大挑战。首先,手语有其独特的语法和词汇,系统需要翻译而非简单转录。其次,手语通过手、手臂、躯干、头部和面部同时传递信息,这对计算机视觉的精准追踪提出了极高要求。
此前已有多次尝试开发类似解决方案,但大多失败。例如,手语手套的失败部分原因在于它只读取手部形状,忽略了身体其他部位。而 SL2T 被设计为同时处理视觉感知和翻译任务。
模型如何处理视频与隐私?
SL2T 不会将原始视频上传到云端。设备端的计算机视觉组件 MediaPipe Holistic 会将手语者的面部、手部、手臂和躯干映射为几何坐标,仅将这些坐标发送到 Google 服务器。DeepMind 表示,这既能将实际视频保留在手机本地,又能加快处理速度。模型直接将这些坐标序列转换为文本,跳过了中间标签(即“注释”)。据 DeepMind 介绍,注释会限制词汇量,并遗漏美国手语依赖的非手动标记和空间语法。
Google 使用超过 10 万小时的数据训练 SL2T,涵盖 50 多种手语,其中约四分之一为美国手语。在 FLEURS-ASL 基准测试中,该模型获得了 70 分的 BLEURT 评分。模型还支持单手和左手签名,包含延迟优化,并设有机制防止摄像头捕捉到非手语动作时产生幻觉文本。
Google 围绕此次发布有何布局?
Google 已与聋人组织和手语专家共同成立了一个“人工智能手语咨询委员会”,以指导该技术的部署方式。该委员会将联合撰写一份报告,说明模型目前能做什么、不能做什么。下一步计划是增加更多手语,以及开发不仅能读取手语、还能生成手语的模型。
消费级产品的发布已酝酿多时。2026年7月17日,Gboard 测试版中出现了手语转文本选项,此前 DeepMind 曾预告过一款名为 SignGemma 的手语模型。此次发布也正值该实验室的动荡时期:2026年8月初,Demis Hassabis 从 DeepMind CEO 转任董事长,Koray Kavukcuoglu 接任日常运营,而 Gemini 应用的月活跃用户已超过 9.5 亿。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注