LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
LaV-CoT:具有多方面奖励优化的语言感知视觉CoT
机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) ; CFAR, Agency for Science, Technology and Research(科技研究局CFAR)
AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。
Comments Accepted by WWW 2026 Industry Track - Oral