Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);visual question answering(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(title);vision language model(abstract);grounding(abstract)
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments 20 pages
SLAPBench:用于四指SLAP指纹验证的多模态大语言模型基准测试
机构 * University of Wisconsin–Green Bay(威斯康星大学格林湾分校)
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI
AI总结 研究四指SLAP指纹验证,介绍SLAPBench基准,评估多个MLLM在不同提示下的表现,发现提示控制崩溃,模型能力控制歧视,建立了特定于SLAP的MLLM基线,揭示了模型在指纹验证中的能力差距和公平性问题。
Comments 19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench
直播中的动态内容审核:结合监督分类与MLLM增强的相似度匹配
机构 * TikTok Singapore Singapore(TikTok新加坡) ; TikTok San Jose United States(TikTok旧金山美国) ; TikTok Shanghai China(TikTok上海中国)
专题命中 视觉定位与Grounding :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出一种混合审核框架,结合监督分类和基于参考的相似度匹配,利用多模态大语言模型提升准确性,在保持轻量推理的同时实现大规模直播内容审核。
Comments To be published at KDD 2026 (ADS track)
去偏负挖掘提升基于预训练视觉语言模型的分布外检测
机构 * University of Technology Sydney(悉尼科技大学)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 针对分布外检测中负标签的假阴性问题,提出通过间接近似负标签分布来校正采样偏差的理论框架,并转化为基于ID标签和未标注语料数据的蒙特卡洛采样方法,在多种OOD检测设置中达到新最优。
Comments KDD 2026
MedVL-SAM2:一种统一的3D医学视觉-语言模型,用于多模态推理和基于提示的分割
机构 * Department of Biomedical Engineering, University of Florida(佛罗里达大学生物医学工程系) ; Department of Radiology, University of Florida(佛罗里达大学放射学系) ; Research Computing, University of Florida(佛罗里达大学研究计算中心) ; Department of Medicine, University of Florida(佛罗里达大学医学系) ; Department of Radiology, UC San Francisco(旧金山大学放射学系)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)
AI总结 MedVL-SAM2是一种统一的3D医学多模态模型,通过联合训练实现报告生成、VQA和多任务分割的高性能表现。
INFORM-CT:整合LLM和VLM用于腹部CT的偶发发现管理
机构 * GE Healthcare Technology and Innovation Center(GE医疗技术与创新中心) ; Boston Medical Center(波士顿医疗中心)
专题命中 视觉定位与Grounding :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出基于LLM和VLM的计划-执行框架,用于提高腹部CT偶发发现的检测、分类和报告效率与精度,通过自动化流程提升临床应用效果。
Comments Spotlight presentation at the 9th International Conference on Medical Imaging with Deep Learning (MIDL) 2026 Additional code and implementation details available at https://idan-tankel.github.io/InformCT_ProjectPage/
EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Stanford University(斯坦福大学) ; Meta Reality Labs(Meta现实实验室) ; The University of Tokyo(东京大学)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。
MERGE:面向人类机器人交互中多主体事件推理与 grounding 的引导视觉-语言模型
机构 * Honda Research Institute Europe(本田欧洲研究院) ; Honda Research Institute USA(本田美国研究院)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract)
AI总结 MERGE 通过引导视觉语言模型实现动态人类机器人交互中多主体事件的推理与 grounding,提升 situational awareness 与效率,基于 GROUND 数据集验证其性能提升。
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract)
Comments 16 pages, 12 figures
机构 * Adobe Research(Adobe研究院) ; University of Maryland(马里兰大学) ; University at Buffalo(布法罗大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICLR 2024 camera-ready (23 pages), Code: https://github.com/archiki/RepARe
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project website: https://contrastive-region-guidance.github.io/
基于视觉语言模型的X射线荧光(XRF)与光学显微镜视场(FOV)定位
机构 * Northwestern University(西北大学) ; University of Chicago(芝加哥大学) ; Oregon Health and Science University(俄勒冈健康与科学大学) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(title,abstract);分类 cs.CV
AI总结 本文针对跨模态显微图像的视场定位难题,提出结合视觉语言模型(VLM)的候选生成-验证工作流,在低对应度的相邻切片成像数据中实现了有效定位,为关联XRF与光学显微测量提供了支撑。
用于宫腔镜手术场景分割的自举式视觉-语言模型
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV
AI总结 本研究提出首个基于VLM的宫腔镜手术场景分割方法VLM-hyster,通过类别特定文本提示与掩码蒸馏分支提升性能,在自行构建的4020张图像数据集上表现优于现有模型,获多中心验证,具临床应用潜力。
Comments Accept by Biomedical Signal Processing and Control
扩散目标,保留其标签:通过VLM构建的3D植被场景从少量未标记照片中整理检测器训练数据
机构 * Royal Military Academy(皇家军事学院) ; KU Leuven(鲁汶大学) ; Flanders Make(佛兰德制造研究院)
专题命中 视觉定位与Grounding :VLM(title,title_cn);分类 cs.CV
AI总结 本研究针对植被中小物体标记图像稀缺导致检测器跨站点泛化差的问题,通过VLM构建3D植被场景合成标记训练图像,实现无监督站点适应,在排雷基准上性能优于传统跨站点标签复用。
Comments Accepted at the Curated Data for Efficient Learning (CDEL) Workshop @ ECCV 2026
多模态大语言模型生成图像检测的基准数据集:GPT Image2与Nano Banana2
机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) ; College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
专题命中 视觉定位与Grounding :MLLM(title,summary_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文构建了含三种生成协议的MLLM生成图像检测基准数据集,评估现有检测器性能并提出SAP-DSP基线框架,验证了其检测稳定性。
基于VLM的医学图像分布外检测的Wasserstein对齐定位
机构 * Department of Computing, Imperial College London, UK(伦敦帝国理工学院计算机系) ; Technical University Munich, DE(慕尼黑技术大学) ; Munich Center for Machine Learning (MCML), DE(慕尼黑机器学习中心(MCML))
专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV
AI总结 提出WALDO框架,利用最优传输理论通过熵加权切片Wasserstein距离、Goldilocks区域采样和自一致性聚合实现零样本异常定位,在NOVA脑MRI基准上mAP@30达43.5%,相对提升19%。
Comments submitted to MICCAI 2026
用于零样本交通事故理解的多阶段VLM流水线
机构 * GO Drive Inc(GO Drive公司)
专题命中 视觉定位与Grounding :VLM(title,title_cn);grounding(abstract);分类 cs.CV
AI总结 提出一个三阶段VLM流水线,在冻结的Qwen3-VL-32B-Instruct和235B MoE模型上实现零样本交通事故预测,通过9:1融合和车辆检测对齐赢得CVPR 2026 ACCIDENT挑战赛。
Comments Accepted at the AUTOPILOT Workshop, CVPR 2026 (non-archival). Workshop Paper ID 13. Code: https://github.com/fuumin621/cvpr2026-accident-1st-place-solution
CPPO: 面向VLM智能体的对比感知策略优化
机构 * Huawei Technologies Canada Co. Ltd.(华为技术加拿大有限公司) ; Huawei Cloud(华为云)
专题命中 视觉定位与Grounding :VLM(title,title_cn);grounding(abstract);分类 cs.CV
AI总结 提出一种自监督的对比感知策略优化方法CPPO,通过对比感知损失增强视觉语言模型的视觉基础能力,无需额外模型或标注,在感知关键任务中优于现有方法。
用于皮肤癌检测的CNN、Transformer、混合模型和视觉语言模型
机构 * Department of Computer Science and Software Engineering, Concordia University, Montreal, Canada(计算机科学与软件工程系,康科迪亚大学,加拿大蒙特利尔) ; Ebovir Biotechnologie Inc., Montreal, Canada(Ebovir生物技术公司,加拿大蒙特利尔)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(title,abstract);分类 cs.CV
AI总结 本文在PAD-UFES-20数据集上统一评估了12种深度学习模型(包括CNN、ViT、混合卷积Transformer和视觉语言模型),结果表明混合模型和基于SigLIP的VLM在排名性能和临床相关操作点之间取得了最佳平衡。
Comments 13 pages, 3 figures, accepted at ICPRAI 2026, The Fifth International Conference on Pattern Recognition and Artificial Intelligence. To appear in Lecture Notes in Computer Science
缓解大扩散视觉-语言模型中的遮蔽先验漂移和位置注意力崩溃
机构 * Department of Artificial Intelligence, Yonsei University, Seoul, Republic of Korea(首尔大学人工智能系)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV
AI总结 本文研究了大扩散视觉-语言模型在长形式生成中的重复生成和视觉 grounding 退化问题,提出了一种无需训练的解决方案来缓解遮蔽先验漂移和位置注意力崩溃。
从失败到反馈:群体修订解锁对象级 grounding 的难题
机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) ; Technical University of Munich(慕尼黑技术大学) ; University of Science and Technology of China(中国科学技术大学) ; Cornell University(康奈尔大学)
专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(abstract);分类 cs.CV
AI总结 本文提出群体修订优化方法,通过生成改进候选响应提升硬案例学习效果,改进奖励和优势函数以增强高质量修订影响,优于现有GRPO方法。
Comments 8 pages, 5 figures, IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
ViDR:基于源视觉证据的多模态深度研究报告 grounding
机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室) ; School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院) ; College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)
专题命中 视觉定位与Grounding :grounding(title,title_cn);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 ViDR通过源视觉证据构建多模态深度研究报告框架,提升报告质量与证据可验证性。
Topo-R1: 通过视觉-语言模型检测拓扑异常
机构 * Stony Brook University(石溪大学) ; Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) ; Stanford University(斯坦福大学) ; Penn State University(宾夕法尼亚州立大学)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);分类 cs.CV
AI总结 本文通过构建拓扑感知基准Topo-R1,评估视觉-语言模型在检测管状网络拓扑异常中的能力,发现现有模型缺乏拓扑感知,提出基于拓扑感知奖励的联合评分方法,显著提升模型在ID和OOD测试中的性能。
Comments 26 pages, 6 figures
EAGLE:专家增强的注意力引导用于多模态大语言模型中的无调优工业异常检测
机构 * Ewha Womans University(峨山女子大学)
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV
AI总结 EAGLE通过整合专家异常检测器与冻结的MLLM,提出无调优框架,提升多模态大语言模型在工业异常检测中的准确率,且在MVTec-AD和VisA数据集上达到94.4%和88.1%的异常鉴别准确率。
对视觉语言模型在观测天文学推理任务中的系统评估
机构 * Shanghai Astronomical Observatory, Chinese Academy of Sciences(上海天文台,中国科学院)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI
AI总结 本文系统评估了视觉语言模型在观测天文学推理任务中的表现,发现模型性能依赖于模态,且物理知识 grounding 对提升准确性至关重要。
Comments 24 pages, 5 figures
Re:Verse -- 能读懂漫画吗?
机构 * University of Central Florida(中央佛罗里达大学) ; Indian Institute of Technology, Jodhpur(印度理工学院,朱达浦尔) ; Indian Institute of Technology, Varanasi(印度理工学院,瓦拉纳西)
专题命中 视觉定位与Grounding :VLM(title,summary_cn);vision language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文通过分析漫画叙事理解,揭示现有VLM在时间因果和跨面板连贯性上的不足,提出新的评估框架,系统研究长篇叙事理解能力。
Comments Accepted (oral) at ICCV (AISTORY Workshop) 2025
Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 3820-3830
SmoGVLM:一种小型、图增强的视觉-语言模型
机构 * Samsung R\&D Institute India-Bangalore
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出SmoGVLM,一种结合图神经网络的视觉-语言模型,通过结构化知识提升小规模多模态推理性能,实验表明小型模型性能提升达16.24%。
Comments ICASSP 2026