Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models
对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应
Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li
机构
*
New York University, New York, USA(纽约大学)
;
Tsinghua University, Beijing, China(清华大学)
;
Columbia University, New York, USA(哥伦比亚大学)
;
University of Michigan, Ann Arbor, USA(密歇根大学)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
MedLVR: 基于潜在视觉推理的可靠医学视觉问答
Suyang Xi, Songtao Hu, Yuxiang Lai, Wangyun Dan, Yaqi Liu, Shansong Wang, Xiaofeng Yang
机构
*
Department of Radiation Oncology and Winship Cancer Institute, Emory University School of Medicine(埃默里大学医学院放射肿瘤学系与温希普癌症研究所)
;
Department of Biostatistics and Bioinformatics, Emory University(埃默里大学生物统计学与生物信息学系)
VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
VisRAG2.0:通过视觉检索增强生成中的证据引导多图像推理减轻视觉幻觉
Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun
机构
*
School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院)
;
School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院)
;
Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系)
机构
*
Kyoto University(京都大学)
;
NII LLMC(国立信息学研究所LLMC)
;
Waseda University(早稻田大学)
;
Institute of Science Tokyo(东京科学大学)
;
NII(国立信息学研究所)
;
Aichi Institute of Technology(爱知工业大学)
;
Institute of Physical and Chemical Research(理化学研究所)
机构
*
School of iOPEN, Northwestern Polytechnical University(iOPEN学院,西北工业大学)
;
The First Affiliated Hospital of Sun Yat-Sen University(中山大学附属第一医院)
;
College of Mechanical Engineering, Tongji University(同济大学机械工程学院)
Comments8 pages, 4 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page: https://radar-iros.netlify.app/
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
;
Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系)
;
Department of Radiology, Renmin Hospital of Wuhan University(武汉大学仁民医院放射科)
;
Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University(上海交通大学附属第六人民医院)
When Discourse Pressures Conflict: Information Structure in Vision-Language Model Outputs
当话语压力冲突时:视觉-语言模型输出中的信息结构
Marcell Fekete, Johannes Bjerva, Tamás Káldi
机构
*
Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系)
;
Department of Psycholinguistics and Neurolinguistics, ELTE Research Centre for Linguistics(ELTE语言研究中心心理学语言学与神经语言学系)
;
ELTE Bárczi Gusztáv Faculty of Special Needs Education(ELTE巴尔茨吉斯塔夫特殊教育学院)
Deterministic Hallucination Detection in Medical VQA via Confidence-Evidence Bayesian Gain
医学VQA中通过置信度-证据贝叶斯增益实现确定性幻觉检测
Mohammad Asadi, Tahoura Nedaee, Jack W. O'Sullivan, Euan Ashley, Ehsan Adeli
机构
*
Department of Electrical Engineering, Stanford University, CA, USA(电气工程系,斯坦福大学)
;
Department of Biology, Stanford University, CA, USA(生物学系,斯坦福大学)
;
Division of Cardiology, Department of Medicine, Stanford University, CA, USA(心脏病学部,医学系,斯坦福大学)
;
Department of Biomedical Data Science, Stanford University, CA, USA(生物医学数据科学系,斯坦福大学)
;
Department of Computer Science, Stanford University, CA, USA(计算机科学系,斯坦福大学)
;
Department of Psychiatry and Behavioral Sciences, Stanford University, CA, USA(精神病学与行为科学系,斯坦福大学)
专题命中
视觉问答
:MLLM(summary_cn,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI
Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation
通过自我场景增强在多模态大语言模型中强化自我中心空间感知
Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心)
;
The Hong Kong University of Science and Technology(香港科技大学)
专题命中
视觉问答
:multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV
机构
*
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院)
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学)
;
University of Science and Technology Beijing(北京科技大学)
;
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中
视觉问答
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构
*
Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院)
;
Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所)
;
Beijing University of Technology, China(北京理工大学)
专题命中
视觉问答
:MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
面向通用视觉-语言-动作策略的通用姿态预训练
Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu
机构
*
Tencent Robotics X(腾讯机器人X)
;
Futian Laboratory(福田实验室)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Fudan University(复旦大学)
;
Shanghai Innovation Institute(上海创新研究院)
机构
*
GADE Union (Global AI Data Experts Union)(GADE联盟(全球人工智能数据专家联盟))
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
New York University(纽约大学)
;
Cambridge University(剑桥大学)
;
The University of Hong Kong(香港大学)