arXivDaily arXiv每日学术速递 周一至周五更新
arXiv 2609.21709cs.CV

SignGPT:通过无注释翻译与生成实现大语言模型介导的手语交互

SignGPT: Toward LLM-Mediated Sign Language Interaction through Gloss-Free Translation and Generation

  • Tsinghua University(清华大学)
  • Nanyang Technological University(南洋理工大学)
  • E Fund(易方达基金)
  • Peng Cheng Laboratory(鹏城实验室)
  • Tencent AI Lab(腾讯AI实验室)

机构由 AI 辅助整理,请以论文原文为准。

Ronghui Li, Jun Dong, Zhongyuan Hu, Zunnan Xu, Jun Zhou, Liyuan Chen, Shuoling Liu, Jiangpeng Yan, Jie Guo, Xiu Li, Linchao Bao

AI总结:

SignGPT提出统一的无注释手语翻译与生成框架,集成部件感知层次表示和非对称多令牌预测,在How2Sign和Phoenix-2014T上验证,并探索了LLM介导的手语对话潜力。

AI中文摘要:

大语言模型(LLM)在手语交互方面提供的支持有限。将手语翻译(SLT)和手语生成(SLG)统一起来,使手语既能作为输入也能作为输出,可以减少手语-文本交互过程中在独立模型之间的切换。我们提出了SignGPT,一个统一的、基于姿态的无注释SLT和SLG框架。SignGPT将身体、手部和面部动作的部件感知层次表示集成到一个共享的语言模型中,并采用非对称多令牌预测和渐进式训练来实现双向建模。我们在How2Sign(ASL)和Phoenix-2014T(DGS)上通过基准比较、定性分析和组件消融研究评估了SignGPT。一项包含12名聋人ASL手语者的探索性研究评估了LLM介导的手语到手语响应流程,突显了统一建模在支持手语对话(SLC)方面的潜力。

英文摘要:

Large language models (LLMs) provide limited support for sign language interaction. Unifying sign language translation (SLT) and generation (SLG) to enable sign language as both input and output can reduce switching between separate models during sign-text interaction. We present SignGPT, a unified, pose-based framework for gloss-free SLT and SLG. SignGPT integrates part-aware hierarchical representations of body, hand, and facial motion into a shared language model and employs asymmetric multi-token prediction and progressive training for bidirectional modeling. We evaluate SignGPT on How2Sign (ASL) and Phoenix-2014T (DGS) through benchmark comparisons, qualitative analyses, and component ablations. An exploratory study with 12 Deaf ASL signers assesses an LLM-mediated sign-to-sign response pipeline, highlighting the potential of unified modeling to support sign language conversation (SLC).

相关深度报道

↑