DeepMind 最新模型使 Pixel 11 设备能够将手语转录为文本
该工具未来将推出给其他设备。谷歌智能手机长期以来提供语音转文本转录,但手语转文本的情况则不同。随着 Pixel 11 系列的发布,这一情况正在改变,这标志着 DeepMind 新的手语转文本 (SL2T) 模型的首次亮相。谷歌已将该模型嵌入到 Gboard 和实时转录中,使聋人和听力受损的用户能够在过去通常打字的任何地方对着手机手势。实际上,这将为这些用户提供一种更快速、更自然的方式来搜索网络、撰写信息以及与谷歌的 Gemini 聊天机器人对话。DeepMind 表示:“聋人在手语、口语、阅读和写作的水平上存在很大的多样性,因此支持各类沟通方式的访问至关重要。” “聋人可以像听力正常的人享受口语处理一样受益于手语处理,而且这项技术为弥合聋人和听人社区之间的沟通鸿沟打开了新的可能性。” DeepMind 在超过 100,000 小时的多语言手语数据上训练了 SL2T,其中大约四分之一的数据集表示美国手语 (ASL) 信息。出于这个原因,该模型在启动时只支持 ASL 到英语的转录。谷歌计划在未来支持更多的语言和设备。SL2T 并不解释原始视频。相反,一个单独的设备内模型将视频片段转换为一组几何坐标的线框,并将其发送到谷歌的服务器。该公司表示,该模型的设计旨在保护用户隐私。SL2T 还与过去的手语转文本系统不同,因为它将接收到的线框直接转换为文本,而不是产生称为注释的中间过程。DeepMind 解释道:“注释无法捕捉手语的丰富非线性方面,例如非手动标记和空间构造。直接从标志翻译消除了人为词汇限制,允许翻译质量直接与数据规模相结合。” 尽管对 ASL 的支持是一个良好的开端,DeepMind 承认还有更多工作要做。全球有超过 7000 万聋人和听力受损人群使用大约 200 种手语进行交流。好消息是,该公司在这一点上有个艰难的开始,因为 SL2T 同时在多种语言上进行训练,以便学习它们之间共享的基础结构。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡