VIABLE: A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
面向VLM-as-a-Judge评估的视障辅助基准
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中 幻觉与鲁棒性 :VLM(title,title_cn);分类 cs.CV
AI总结 针对视障辅助任务中VLM-as-a-Judge评估的可靠性问题,提出VIABLE基准(含30万+样本、有效性-公正性-稳定性框架及12种失败模式分类),发现现有模型不可靠,并开发VIA-Judge-Agent方法提升诊断准确性和用户偏好。
Comments Accepted to EMNLP 2026 (Main Conference)