VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs
VisualQuest: 一个用于多模态大语言模型(MLLMs)抽象视觉推理的基准数据集
Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin
机构
*
School of Computer Science and Technology, Dalian University of Technology, Dalian, China(大连理工大学计算机科学与技术学院)
;
School of Foreign Languages, Dalian University of Technology, Dalian, China(大连理工大学外语学院)
;
School of Computer Science and Technology, Xinjiang Normal University, Urumqi, China(新疆师范大学计算机科学与技术学院)
专题命中
视觉推理
:visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV
机构
*
Indian Institute of Technology, Ropar, India(印度理工学院罗帕尔分校)
;
Machine Intelligence Group, Birla Institute of Technology and Science, Pilani, Hyderabad Campus, India(比拉理工科学院帕利尼 Hyderabad 分校机器智能小组)
;
Monash University, Melbourne, Australia(墨尔本大学)
专题命中
视觉定位与Grounding
:vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
Comments21 pages, 6 figures, 8 tables. Includes ancillary files with full benchmark results and ablation studies. Code available at https://github.com/athrael-soju/Snappy
DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations
DA-DPO:面向减少多模态大语言模型幻觉的高效难度感知偏好优化
Longtian Qiu, Shan Ning, Chuyu Zhang, Jiaxuan Sun, Xuming He
机构
*
ShanghaiTech University(上海科技大学)
;
Lingang Laboratory(灵冈实验室)
;
Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心)
专题命中
幻觉与鲁棒性
:MLLM(title);multimodal large language model(abstract);分类 cs.AI
Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients
基准成功,临床失败:当强化学习优化于基准,而非患者
Armin Berger, Manuela Bergau, Helen Schneider, Saad Ahmad, Tom Anglim Lagones, Gianluca Brugnara, Martha Foltyn-Dumitru, Kai Schlamp, Philipp Vollmuth, Rafet Sifa
机构
*
Fraunhofer IAIS(弗劳恩霍夫人工智能研究所)
;
University of Bonn(波恩大学)
;
Lamarr Institute(拉马尔研究所)
;
Department of Health Queensland(昆士兰健康部)
;
Griffith University(格里菲斯大学)
;
University Hospital Bonn(波恩大学医院)