RVLF: A Reinforcing Vision-Language Framework for Gloss-Free Sign Language Translation
RVLF:一种无需 gloss 的视觉-语言框架用于手语翻译
机构 * Macau University of Science and Technology(澳门科学技术大学) ; SKL-IOTSC, CIS, University of Macau(澳门大学智能物联网与通信系统研究所) ; Beijing Institute of Technology, Zhuhai(珠海北京理工大学) ; University of Barcelona(巴塞罗那大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 RVLF提出了一种无需gloss的手语翻译框架,通过融合骨架运动与视觉特征并结合强化学习优化,提升了翻译质量与语义一致性。