Detecting and Preventing Hallucinations in Large Vision Language Models
专题命中 视觉问答 :vision language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments AAAI 2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments AAAI 2024
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 4 figures
专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments Accepted to ICCV 2021. PaperId : ICCV2021-10857 Copyright transferred to IEEE ICCV. DOI will be updated later
基于提示的VLM图像压缩预过滤
机构 * School of Engineering Science, Simon Fraser University(西蒙菲莎大学工程科学学院)
专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.AI
AI总结 本文提出一种轻量级、即插即用的提示引导预过滤模块,用于识别图像中与文本提示最相关的区域,从而提升VLM图像压缩效率,实验显示在保持任务准确性的同时实现25-50%的平均比特率降低。
Comments 7 pages, 5 figures. Accepted to IEEE ICME 2026. Code: https://github.com/bardia-az/pgp-vlm-compression
PhysMRV:用于物理合理性推理的物理内存检索与验证
专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对视频语言模型物理合理性推理不可靠的问题,提出免训练的PhysMRV框架,通过将训练视频转化为分层内存库,利用结构化物理证据指导VLM验证物理合理性,在多基准测试中取得一致改进,有效增强该推理能力。
SonarLLM:一种用于水下感知的原生声呐-光学多模态大语言模型
机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) ; Yunnan Key Laboratory of Artificial Intelligence(云南省人工智能重点实验室)
专题命中 视觉问答 :multimodal large language model(title);MLLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.AI
AI总结 针对现有多模态大语言模型不适用于水下声呐-光学感知的问题,提出SonarLLM模型,结合专用编码器与分层融合机制,在SonarBench基准上实现了优异的水下感知性能,凸显了声呐的互补价值。
ATP-Bench: 向多模态大语言模型交错生成的代理工具规划迈进
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) ; Huazhong University of Science and Technology(华中科技大学) ; Zhejiang University(浙江大学)
专题命中 视觉问答 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 针对多模态大语言模型交错生成中事实性与创造性难以统一的问题,提出ATP-Bench基准,包含7702个问题-答案对,评估代理工具规划能力,揭示模型在交错规划中的不足。
Comments Accepted at the European Conference on Computer Vision (ECCV) 2026
Qwen-3D:用于空间理解的通用三维视觉语言模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :vision-language model(title);visual reasoning(abstract);visual question answering(abstract);grounding(abstract)
AI总结 本研究提出 Qwen-3D 三维视觉语言模型,通过多视角几何线索与三维旋转位置嵌入提升空间推理,在三维任务上超越现有 3D LMM,还保持二维任务性能。
Comments Project Page: https://qwen-3d.github.io/
是看不见还是不知道?归因视觉语言模型中的错误
机构 * MBZUAI The University of Melbourne(MBZUAI墨尔本大学)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract_cn);visual question answering(abstract);分类 cs.CV
AI总结 研究视觉语言模型在回答需额外知识问题时的错误,提出统一框架分离失败模式,探讨预生成信号能否预测错误源,发现可在解码前预测,能据此进行针对性干预。
PathView-Bench:多模态大语言模型能否实现病理图像的细粒度多尺度理解?
机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康与医学数据科学国家研究院)
专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究针对现有病理多模态基准的不足,推出PathVU基准,评估发现主流MLLMs在多尺度病理图像细粒度视觉任务上存在显著局限,为相关模型的开发评估提供了可复现基础。
EchoVLM:面向通用超声智能的动态专家混合视觉语言模型
机构 * School of iOPEN, Northwestern Polytechnical University(iOPEN学院,西北工业大学) ; The First Affiliated Hospital of Sun Yat-Sen University(中山大学附属第一医院) ; College of Mechanical Engineering, Tongji University(同济大学机械工程学院)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
AI总结 本文提出EchoVLM,通过动态混合专家架构提升超声图像的多任务诊断效率,实验表明其在报告生成任务中BLEU-1和ROUGE-1得分显著提升。
用于遥感图像理解的多模态大语言模型:领域特定还是通用?
机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) ; Yuelushan Center for Industrial Innovation(岳麓山工业创新中心)
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
AI总结 本文针对遥感图像理解的多模态大语言模型展开研究,通过系统调查和评估,比较其与通用模型在不同任务上的表现,发现当前模型存在局限,进而给出未来方向,为开发相关模型提供系统参考。
Comments 27 pages, 11 figures
多语言血液学视觉问答数据集
机构 * Information Technology University, Lahore(拉合尔信息技术大学) ; King Edward Medical University, Lahore(拉合尔爱德华国王医科大学)
专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 针对医疗领域多语言视觉问答资源匮乏的问题,构建了双语(英语-乌尔都语)血液学VQA基准WBCMor VQA,包含11万问答对和2万细胞图像,并评估了多个开源视觉语言模型。
Comments Under Review
高效遥感视觉问答的统一框架:适配双编码器、混合架构和编码器-解码器架构
机构 * Computational Data Science and Engineering(计算数据科学与工程) ; College of Science and Technology(科学与技术学院)
专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV
AI总结 提出RS Adapter参数高效微调策略,在三种视觉语言模型架构上注入轻量瓶颈适配器,仅用不到5%可训练参数实现遥感VQA,混合架构FLAVA在多模态推理与检索间取得最佳平衡。
Comments 4 pages, 2 figures, accepted and to be presented at 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2026), scheduled for 9 to 14 August 2026 in Washington D.C
自动化报告驱动的肿瘤学VQA基准:用于评估3D医学影像上的视觉-语言模型
机构 * UCSF–UC Berkeley Joint Graduate Program in Bioengineering(UCSF-伯克利生物工程联合研究生项目) ; Department of Radiology, UCSF(UCSF放射科) ; Department of Radiation Oncology, UCSF(UCSF放射肿瘤科)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出一个自动化管道,从私有放射学报告和3D肿瘤影像生成多选VQA数据集,构建无污染基准,评估六种视觉-语言模型,发现视觉依赖因数据集而异。
Embodied3DBench: 视觉语言模型低级具身空间智能的基准测试
机构 * CFCS, School of CS, PKU(计算机学院CFCS,北京大学) ; Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)
专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV
AI总结 提出Embodied3DBench基准,通过6类任务(空间结构理解与交互导向感知)系统评估视觉语言模型在3D环境中的低级空间智能,并合成130万QA对训练数据以弥补能力差距。
面向自动驾驶的空间感知视觉语言模型
机构 * Motional ; University of Amsterdam(阿姆斯特丹大学)
专题命中 视觉问答 :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出LVLDrive框架,通过融合LiDAR点云与视觉语言模型,利用渐进融合Q-Former和空间感知问答数据集,解决3D度量空间推理瓶颈,提升自动驾驶场景理解与决策可靠性。
Comments Accepted to CVPR AutoPilot Workshop 2026
CaMo:基于摄像机运动的视觉-语言模型评估与训练
机构 * Department of Electrical and Computer Engineering, University of Washington, Seattle, USA(华盛顿大学电气与计算机工程系)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出了一种基于摄像机运动的视觉-语言模型评估与训练方法CaMo,通过要求模型生成显式的空间叙述并进行推理,揭示了现有空间视觉-语言模型在空间认知方面的不足,并展示了CaMo在空间叙述评估和直接空间问题回答准确性上的一致表现。
Comments Code and model available at https://github.com/hsiangwei0903/CaMo
视频主动感知:基于视觉-语言模型的高效推理时长视频理解
机构 * Carnegie Mellon University(卡内基梅隆大学) ; MIT(麻省理工学院)
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。
Comments ICCV 2025 workshop
对视觉-语言模型所见所感知进行对齐与适应性信息流
机构 * KAIST(韩国科学技术院) ; POSTECH
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出通过调节信息流提升视觉-语言模型的感知能力,通过动态令牌方法确定视觉令牌的重要性,从而提高视觉问答、视觉定位等任务的性能。
Comments CVPR 2026. Project page: https://cxliu0.github.io/AIF/
FETAL-GAUGE:用于评估胎儿超声检查中视觉-语言模型的基准
机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)
专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出Fetal-Gauge基准,用于评估视觉-语言模型在胎儿超声检查中的性能,包含42000张图像和93000个问题-答案对,揭示当前模型在临床任务中的性能差距,强调需领域适应的架构和训练方法。
通过专家之眼:一个基于放射学家目光和推理训练的基础视觉语言模型
机构 * Bioengineering Department and Imperial-X(生物工程系和Imperial-X) ; Imperial College London(帝国理工学院伦敦分校) ; College of physics and information engineering, Fuzhou University(福州大学物理与信息工程学院) ; Department of Surgery and Cancer, Imperial College London(外科与癌症部门,帝国理工学院伦敦分校) ; National Heart and Lung Institute, Imperial College London(国家心脏和肺研究所,帝国理工学院伦敦分校) ; Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里顿医院) ; School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)
专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.AI
AI总结 本文提出GazeX模型,通过放射学家的眼动数据模拟专家推理过程,提升医学影像分析的准确性和可解释性。
让病理共驾民主化:一个开放的管道和数据集用于整张滑片视觉-语言建模
机构 * Computational Pathology Group, Radboud University Medical Center(计算病理组,拉德堡德大学医学中心)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出Polysome工具和HISTAI-Instruct数据集,训练出ANTONI-α模型,在整张滑片VQA任务中超越MedGemma,所有方法和数据公开。
Comments 12 pages, 4 figures
用可部署的多模态语义照明攻击挑战视觉-语言模型
专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV
AI总结 本文提出MSLA攻击框架,通过可控对抗性照明攻击视觉-语言模型的多模态语义理解,揭示其在现实世界中的安全风险。
动态思维:多模态大语言模型如何感知、跟踪和推理物理4D世界的动态
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出Dyn-Bench基准测试,评估多模态大语言模型在动态场景中的时空推理和动态物体感知能力,发现现有模型难以同时保持强性能,而结构化整合方法显著提升其动态感知能力。
MEGC2026:面向视觉问答的微表情大奖挑战
机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) ; State Key Laboratory of Cognitive Science and Mental Health, Institute of Psychology, CAS & Department of Psychology, University of the Chinese Academy of Sciences(中国科学院心理研究所认知科学与心理健康国家重点实验室及中国科学院大学心理学系) ; School of Mathematical and Computer Sciences, Heriot-Watt University Malaysia(赫瑞-沃森大学马来西亚分校数学与计算机科学学院)
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 MEGC2026通过视觉问答任务探索微表情识别,利用多模态大语言模型和大视觉-语言模型提升微表情分析能力。
Comments MEGC 2026 at IEEE FG 2026
在放射学视觉-语言模型中使用离散语义熵过滤幻觉
机构 * Lab for Artificial Intelligence in Medicine, Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(医学人工智能实验室,诊断与介入放射学部,RWTH亚琛大学医院) ; Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(诊断与介入放射学部,RWTH亚琛大学医院) ; Department of Diagnostic and Interventional Radiology, Technical University of Munich, School of Medicine and Health, Klinikum rechts der Isar, TUM University Hospital(诊断与介入放射学部,慕尼黑技术大学,医学院与健康学院,Klinikum rechts der Isar,TUM大学医院) ; Department of Cardiovascular Radiology and Nuclear Medicine, Technical University of Munich, School of Medicine and Health, German Heart Center, TUM University Hospital(心血管放射学与核医学部,慕尼黑技术大学,医学院与健康学院,德国心脏中心,TUM大学医院) ; Else Kroener Fresenius Center for Digital Health, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology(数字健康中心,医学院与卡尔·古斯塔夫·卡尔斯大学医院,德累斯顿技术大学) ; Department of Medicine I, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology(第一医学部,医学院与卡尔·古斯塔夫·卡尔斯大学医院,德累斯顿技术大学) ; Pathology & Data Analytics, Leeds Institute of Medical Research at St James’s, University of Leeds(病理学与数据分析,圣詹姆斯医院医学研究所,利兹大学) ; Medical Oncology, National Center for Tumor Diseases (NCT), University Hospital Heidelberg(医学肿瘤学,国家肿瘤疾病中心(NCT),海德堡大学医院)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
AI总结 本研究通过离散语义熵过滤高熵问题,显著提升放射学视觉-语言模型的诊断准确性。
Comments Code is available: https://github.com/TruhnLab/VisionSemanticEntropy
Journal ref Eur Radiol (2026)
BTCChat: 通过多模态大语言模型推进遥感双时相变化描述
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Aerospace Information Research Institute(航天信息研究所) ; Chinese Academy of Sciences(中国科学院) ; School of Geographical Sciences(地理科学学院) ; Hunan Normal University(湖南师范大学)
专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV
AI总结 BTCChat通过多模态大语言模型提升遥感双时相变化描述能力,引入变化提取模块和提示增强机制,实现更精确的视觉-语义对齐和更优的性能表现。
Comments 5 pages, 2 figures; Accepted by ICASSP 2026
面向自动驾驶的高效视觉问答流水线:场景区域压缩
机构 * University of Southern California(南加州大学) ; XPeng(小鹏)
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出SRC-Pipeline框架,通过场景区域压缩技术,在保持性能的同时显著降低计算成本,提升自动驾驶中的实时视觉问答效率。
Comments 7 pages
PENDULUM: 一个用于评估多模态大语言模型顺从性的基准
专题命中 视觉问答 :multimodal large language model(title,abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.AI
AI总结 PENDULUM基准通过2000个视觉问答对评估多模态大语言模型的顺从性,揭示模型在顺从性和幻觉行为上的显著差异,提出新度量标准以提升模型的事实一致性和可靠性。