Lost in Translation: Do LVLM Judges Generalize Across Languages?
迷失在翻译中:大型视觉-语言模型(LVLM)的评判者是否能跨语言泛化?
机构 * York University(约克大学) ; University of Alberta(阿尔伯塔大学) ; Nanyang Technological University(南洋理工大学) ; Salesforce AI Research(Salesforce AI研究)
AI总结 本文提出MM-JudgeBench,首个多语言多模态评判模型评估基准,包含60000+跨25种语言的配对偏好实例,揭示了LVLM评判器在跨语言性能上的显著差异,指出模型大小和架构并非多语言鲁棒性的良好预测因素。
Comments Accepted at ACL 2026 Findings