V-FAT: Benchmarking Visual Fidelity Against Text-bias
V-FAT:基于文本偏见的视觉真实性基准测试
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Meituan(美团) ; University of Oxford(牛津大学)
AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。
Comments 12 pages, 6 figures