Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment
回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉
Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang
机构
*
Xidian University(西安电子科技大学)
;
Tsinghua University(清华大学)
;
Shanghai Road Transport Development Center(上海市道路运输发展中心)
;
Hunan Institute of Advanced Technology(湖南先进技术研究院)
VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding
VideoGAIA:面向通用人工智能助手的智能体视频理解基准
Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Ant Group(蚂蚁集团)
;
Tsinghua University(清华大学)
;
Tongji University(同济大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.CV
机构
*
Guangdong Provincial Key Laboratory of Malignant Tumor Epigenetics and Gene Regulation, Guangdong-Hong Kong Joint Laboratory for RNA Medicine, Department of Medical Oncology, Breast Tumor Centre, Phase I Clinical Trial Centre(广东省恶性肿瘤表观遗传与基因调控重点实验室,粤港澳RNA医学联合实验室,医学肿瘤科,乳腺肿瘤中心,I期临床试验中心)
;
Guangdong Provincial Key Laboratory of Cancer Pathogenesis and Precision Diagnosis and Treatment, AI Big Data Laboratory, Department of Medical Oncology(广东省肿瘤发生与精准诊断与治疗重点实验室,人工智能大数据实验室,医学肿瘤科)
;
Chongqing Key Laboratory of Bio-perception(重庆生物感知重点实验室)
Improving Generalization Robustness of Multimodal RLVR
提升多模态RLVR的泛化鲁棒性
Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You
机构
*
National University of Singapore(新加坡国立大学)
;
DAMO Academy Alibaba Group(阿里巴巴达摩院)
;
Hupan Lab(湖畔实验室)
;
Zhejiang University(浙江大学)
;
University of California Berkeley(加州大学伯克利分校)
;
Rochester Institute of Technology(罗切斯特理工学院)
;
Georgia Institute of Technology(佐治亚理工学院)
;
Renmin University of China(中国人民大学)
;
Hong Kong University of Science and Technology(香港科技大学)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.AI
机构
*
National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学国家防伪工程技术研究中心)
;
School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)
;
Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心)
Med-CRAFT: An Information System for Explainable and Configurable Construction of Multimodal Medical QA Datasets
Med-CRAFT:通过知识图谱遍历自动构建可解释的多跳视频工作负载
Shenxi Liu, Kan Li, Mingyang Zhao, Yuhang Tian, Bin Li
机构
*
Beijing Institute of Technology(北京理工大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
Pathologist Attention-Aligned Report Generation for Prostate Histopathology
用于前列腺组织病理学的病理学家注意力对齐报告生成
Ruoyu Xue, Suryakant Singh, Souradeep Chakraborty, Pierre Marza, Oksana Yaskiv, Constantin Friedman, Natallia Sheuka, Paul Friedman, Bharat Ramlal, Beatrice Knudsen, Rajarsi Gupta, Joel Saltz, Prateek Prasanna, Gregory Zelinsky, Dimitris Samaras
机构
*
Department of Computer Science, Stony Brook University(纽约州立大学石溪分校计算机科学系)
;
Department of Biomedical Informatics, Stony Brook University(纽约州立大学石溪分校生物医学信息学系)
;
Université Paris-Saclay, CentraleSupélec, Gustave Roussy, INSERM, IHU PRISM, Cancer Data Science Unit(巴黎萨克雷大学、中央理工高等电力学院、古斯塔夫·鲁西研究所、法国国家健康与医学研究院、PRISM综合大学医院、癌症数据科学单元)
;
Université Paris-Saclay, CentraleSupélec, MICS Laboratory(巴黎萨克雷大学、中央理工高等电力学院、MICS实验室)
;
Department of Pathology and Laboratory Medicine, Northwell Health Laboratories(诺斯韦尔健康实验室病理与检验医学部)
;
Department of Pathology, University of Utah School of Medicine(犹他大学医学院病理系)
;
Department of Psychology, Stony Brook University(纽约州立大学石溪分校心理学系)
Comments11 pages, 4 figures, accepted for publication at the 29th International Conference on Medical Image Computing and Computer-Assisted Intervention (MICCAI 2026)
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Phoenix TV(凤凰电视台)
;
Stanford University(斯坦福大学)
;
University of Liverpool(利物浦大学)
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning
Switch-Reasoner:通过强化学习在多任务混合中学习何时思考
Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye
机构
*
Wuhan University(武汉大学)
;
Xiaomi Inc(小米公司)
;
Wuhan University of Technology(武汉理工大学)
;
Nanyang Technological University(南洋理工大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.CV