首页
资讯
深度
投融资
政策
活动
视频
当前模式 菜单关闭
我们能帮忙找点什么吗?

Google DeepMind可为Pixel 11提供AI驱动的手语翻译功能,利用智能手机摄像头识别手语

发布日期:2026-08-14 00:34:49
字号:A+A-

Google旗下的AI研究机构DeepMind于8月12日正式发布了一款名为“SL2T”的手语翻译AI模型。该模型将被集成至Gboard输入法和Live Transcribe实时转录应用中,率先支持美国手语(ASL)到英语文本的转换。搭载该功能的Pixel 11智能手机用户无需支付额外费用即可使用。

 

SL2T的背后是庞大的数据训练基础——涵盖50余种手语、总计超过10万小时的视频数据,其中ASL数据约占四分之一。研究团队通过联合训练多种手语、方言及不同熟练程度的数据,在实验中取得了优于单一语言模型的翻译性能。

 

 

不同于简单将手语词汇按顺序替换,SL2T采用真正的机器翻译方式,将手语整体转换为符合目标语言语法和语义的文本,因为手语作为一种自然语言,拥有与英语等口语截然不同的文法结构和词汇体系。

 

在隐私保护方面,SL2T不会直接处理或上传摄像头拍摄的原始影像,而是利用设备端的“MediaPipe Holistic”技术追踪用户身体的几何特征点,仅将身体各部位的坐标数据发送至服务器,原始视频帧在捕捉完成后立即被销毁。

 

在FLEURS-ASL基准测试中,该模型在ASL到英语的零样本翻译任务上取得了70 BLEURT的评分。不过,目前模型在处理罕见手语表达和高速指拼时仍存在识别误差。DeepMind表示,已针对实际应用场景优化了流式传输延迟,并改进了对单手手语和左撇子使用者的适配。

 

为确保技术符合社群需求,DeepMind高度重视与听障人士群体的协作,邀请聋人当事者和领域专家参与数据采集、评估及影响分析,并成立了由多个聋人组织和专家构成的AI手语咨询委员会,将社群反馈纳入开发优先级。SL2T将率先登陆Pixel 11,未来该公司计划进一步扩展支持的手语种类,并探索手语生成等反向翻译功能。(新闻来源:moguravr、VRAR星球编译)


商务合作:13146398132undefined

媒体合作:13341147250

爆料投稿:editor@vrarworld.cn

版权声明:本文为VRAR星球原创,任何单位及个人未经授权不得转载,否则将依法追究侵权责任。

如需转载请联系13341147250 / editor@vrarworld.cn 申请授权,转载时请注明来源并保留VRAR星球原文链接。

本文部分图片及视频来源于互联网,如涉及侵权请联系我们删除。

发表评论(0
热门资讯