The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning Mapping
视觉象征性挑战:在手语形式-意义映射上评估视觉-语言模型
机构 * Multimodal Language Department(多模态语言部门) ; Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) ; Department of Linguistics(语言学系) ; Boğaziçi University(博多伊奇大学) ; Donders Institute for Brain Cognition and Behaviour(多纳尔斯脑认知与行为研究所) ; Radboud University(拉德堡德大学) ; Department of Linguistics and Communication(语言学与沟通系) ; University of Birmingham(伯明翰大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出一个新颖的视频基准测试,用于评估视觉-语言模型在手语形式-意义映射上的表现,通过心理语言学测量来评估三种任务:语音学手语形式预测、透明度和渐进象征性评分,并发现模型在语音形式预测上表现较好但整体仍低于人类表现。