☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

谷歌DeepMind正式推出多语言手语到文本转换模型SL2T,并已集成至Pixel 11智能手机操作系统中,标志着手语识别AI技术首次迈入大众消费电子设备行列。该模型深度整合Gboard输入法与Live Transcribe实时字幕功能,用户只需启用前置摄像头捕捉手语动作,即可实现消息撰写、网页搜索以及与Gemini智能助手自然交互,无需依赖传统键盘操作。
SL2T模型训练数据覆盖全球逾50种手语体系,总时长超10万小时,其中约25%为美国手语(ASL)语料。通过跨语言联合建模策略,模型有效挖掘不同手语体系间共享的动作表征规律,在权威评测集FLEURS-ASL上创下当前最优手语转写性能纪录。区别于以往依赖预定义词汇标签的识别方式,SL2T具备端到端动作理解能力,可直接从连续肢体运动中生成对应文本,同步解析面部微表情、身体空间朝向及唇部动态等关键非手部语义线索。
用于在用户想通过浏览器自动化与 Google Gemini 或 ChatGPT 交互时。触发短语包括“ask Gemini”“ask ChatGPT”“ask GPT”“让...”。
在隐私保护设计上,系统采用手机本地运行的MediaPipe Holistic框架,实时追踪手部、面部与躯干共计130个关键骨骼点位,仅上传经脱敏处理的动作坐标数据,原始视频流在设备端即时销毁,全程不上传至云端服务器。现阶段该功能支持美国手语至英文的实时转换,后续谷歌将逐步拓展至更多手语种类及安卓终端机型。
值得一提的是,DeepMind早在2025年5月即开源了轻量级手语翻译模型SignGemma,为SL2T的工程化落地奠定了核心算法基础。此外,其长期深耕的WaveNet语音合成、Euphonia个性化语音辅助以及Live Transcribe实时转录等无障碍技术,持续夯实了多模态感知与理解能力。随着谷歌、科大讯飞、华为、苹果等科技巨头加速推进AI无障碍交互研发,相关技术正快速由实验室验证阶段迈向规模化商用落地。


















