论文导读
清华大学、南洋理工大学、鹏城实验室与腾讯AI Lab提出SignGPT,用共享语言模型同时完成无gloss手语转文字和文字转手语。系统串起一轮手语对话,并邀请12名聋人美国手语使用者参与探索性评估,分别观察语义和动作体验。
双向手语交互过去常由两套系统拼接
手语翻译把视频动作变成文本,手语生成则把文本变成身体、手部与面部动作。两项任务的数据表示和评价方式不同,过去往往单独训练;放进对话产品时,中间转换会积累误差,也难共享上下文。
SignGPT尝试用一个共享语言模型连接两端。它不依赖人工gloss作为必经中间层,而是把视觉手语表示映射到语言空间,再从语言表示生成手语动作。这样,用户的手语问题可以被理解、回答并以手语形式返回。
图:论文总览展示手语输入、语言模型回答与手语输出构成的一轮交互。
共享语言模型连接理解和生成
在手语转文字方向,视觉编码器提取手部、身体和面部的时序特征,再与语言模型对齐;在文字转手语方向,模型输出被转换为动作表示,并由生成模块还原连续手语。共享核心让两种任务能够利用同一对话语境。
无gloss设计减少了对昂贵人工标注的依赖,也避免把手语强行压成口语词序。但它并不意味着中间表示完全可解释:模型可能漏掉空间指代、非手部表情或地区变体,这些信息对自然手语同样关键。
图:论文方法图展示视觉编码、共享语言模型与动作生成模块的连接。
12人研究提供真实反馈,也限定了结论范围
论文先用定性案例比较MotionGPT与SignGPT面对同一手语问题时生成的文字和动作回复,展示双向流水线是否接住了提问语义。随后,团队邀请12名聋人美国手语使用者参加探索性研究,分别评价回复的适当性与动作流畅度。
但12人的样本规模较小,且聚焦美国手语,不能外推到所有年龄、熟练度和其他手语语言。一次交互也不足以证明系统能维持长对话、正确处理指代或在医疗、法律等高风险场景中可靠使用。
图:论文定性案例对比MotionGPT与SignGPT对同一手语问题生成的文本和手语动作回复。
未来方向:让手语用户参与定义“好用”
后续研发应从项目开始就让聋人社区参与,而不是只在完成后测试。评价指标除翻译准确率外,还应覆盖可理解性、自然度、面部语法、身份与地区变体,并允许用户指出系统不确定或令人冒犯的表达。
产品部署需要清楚标注这是机器生成手语,在高风险信息上提供原文、回看和人工翻译入口。视频数据涉及生物特征与交流隐私,采集、保存和模型训练都应取得明确授权,并支持撤回。
SignGPT的意义在于把手语放到大模型交互的输入和输出两端,而不是只提供单向字幕工具。统一架构减少切换只是起点;真正的目标,是让不同手语用户能长期、自然地控制对话,并在模型出错时拥有清楚的纠正途径。
参考资料
https://arxiv.org/abs/2609.21709
https://signgpt-demo.github.io/sign-language-interaction-demo/