• 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

谷歌DeepMind推出手语转文本功能,拓展AI与搜索服务

2026-08-13 04:01:55
收藏

Google DeepMind 发布手语转文本模型 SL2T

Google DeepMind 推出了一款名为 SL2T 的手语转文本模型,该模型将首先在 Gboard 和 Live Transcribe 中集成,并搭载于新款 Pixel 11 手机。公司表示,这是首款真正落地于消费产品的手语人工智能。

用手语代替打字,与设备交互

多年来,能听能说的人一直可以通过语音输入与设备对话。如今,那些无法使用语音输入但使用手语的人,也能借助 SL2T 在 Pixel 11 上浏览网页、编写消息或编辑文档。手语使用者还可以将任务直接交给 Gemini 助手。在 Live Transcribe 中,用户可以在面对面交谈时,用手语回复,而不必逐字打字。

目前,该模型仅支持美国手语(ASL)到英语的转换。Google 表示,未来将逐步推广到更多设备,并支持更多语言。据模型测试者反馈,使用美国手语签名比打字更快捷、更自然。

为什么手语对人工智能来说比语音更难?

DeepMind 将手语视为完整的自然语言,而非“手部表达的英语”。然而,与口语人工智能相比,手语的发展一直滞后,主要面临两大挑战。首先,手语有其独特的语法和词汇,系统需要翻译而非简单转录。其次,手语通过手、手臂、躯干、头部和面部同时传递信息,这对计算机视觉的精准追踪提出了极高要求。

此前已有多次尝试开发类似解决方案,但大多失败。例如,手语手套的失败部分原因在于它只读取手部形状,忽略了身体其他部位。而 SL2T 被设计为同时处理视觉感知和翻译任务。

模型如何处理视频与隐私?

SL2T 不会将原始视频上传到云端。设备端的计算机视觉组件 MediaPipe Holistic 会将手语者的面部、手部、手臂和躯干映射为几何坐标,仅将这些坐标发送到 Google 服务器。DeepMind 表示,这既能将实际视频保留在手机本地,又能加快处理速度。模型直接将这些坐标序列转换为文本,跳过了中间标签(即“注释”)。据 DeepMind 介绍,注释会限制词汇量,并遗漏美国手语依赖的非手动标记和空间语法。

Google 使用超过 10 万小时的数据训练 SL2T,涵盖 50 多种手语,其中约四分之一为美国手语。在 FLEURS-ASL 基准测试中,该模型获得了 70 分的 BLEURT 评分。模型还支持单手和左手签名,包含延迟优化,并设有机制防止摄像头捕捉到非手语动作时产生幻觉文本。

Google 围绕此次发布有何布局?

Google 已与聋人组织和手语专家共同成立了一个“人工智能手语咨询委员会”,以指导该技术的部署方式。该委员会将联合撰写一份报告,说明模型目前能做什么、不能做什么。下一步计划是增加更多手语,以及开发不仅能读取手语、还能生成手语的模型。

消费级产品的发布已酝酿多时。2026年7月17日,Gboard 测试版中出现了手语转文本选项,此前 DeepMind 曾预告过一款名为 SignGemma 的手语模型。此次发布也正值该实验室的动荡时期:2026年8月初,Demis Hassabis 从 DeepMind CEO 转任董事长,Koray Kavukcuoglu 接任日常运营,而 Gemini 应用的月活跃用户已超过 9.5 亿。

免责声明:

本网站、超链接、相关应用程序、论坛、博客等媒体账户以及其他平台和用户发布的所有内容均来源于第三方平台及平台用户。百亿财经对于网站及其内容不作任何类型的保证,网站所有区块链相关数据以及其他内容资料仅供用户学习及研究之用,不构成任何投资、法律等其他领域的建议和依据。百亿财经用户以及其他第三方平台在本网站发布的任何内容均由其个人负责,与百亿财经无关。百亿财经不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。强烈建议您独自对内容进行研究、审查、分析和验证。

展开阅读全文
更多新闻
自选
我的自选
查看全部
市值 价格 24h%