arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2603.11975 2026-03-16 cs.CV cs.AI cs.CR 84%

HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios

HomeSafe-Bench:评估视觉-语言模型在家庭场景中对不安全行为检测的性能

Jiayue Pu, Zhongxiang Sun, Zilu Zhang, Xiao Zhang, Jun Xu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HomeSafe-Bench,用于评估视觉-语言模型在家庭场景中检测不安全行为的能力,同时引入HD-Guard架构提升实时安全监控效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23653 2026-03-13 cs.CV cs.AI 84%

ProtoDCS: Towards Robust and Efficient Open-Set Test-Time Adaptation for Vision-Language Models

ProtoDCS: 向 robust 和 efficient 的 open-set 测试时间适应方法迈进:为视觉-语言模型提供稳健高效的开放集测试时间适应

Wei Luo, Yangfan Ou, Jin Deng, Zeshuai Deng, Xiquan Yan, Zhiquan Wen, Mingkui Tan

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 ProtoDCS通过概率高斯混合模型和证据驱动适应策略,解决视觉-语言模型在开放集测试时间适应中的稳健性和效率问题,提升模型准确性和异常检测能力。

Comments 13 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01124 2026-03-03 cs.CV cs.AI 84%

ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models

ClinCoT:面向医学视觉语言模型的临床感知视觉推理链

Xiwei Liu, Yulong Li, Xinlin Zhuang, Xuhui Li, Jianxu Chen, Haolin Yang, Imran Razzak, Yutong Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) East China Normal University(东华大学)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 ClinCoT通过引入临床感知的视觉推理链框架,提升医学视觉语言模型在临床决策中的事实性支撑与多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24072 2026-02-26 cs.CV cs.AI 84%

Uncovering Grounding IDs: How External Cues Shape Multimodal Binding

揭示地面ID:外部线索如何塑造多模态绑定

Hosein Hasani, Amirmohammad Izadi, Fatemeh Askari, Mobin Bagherian, Sadegh Mohammadian, Mohammad Izadi, Mahdieh Soleymani Baghshah

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出地面ID概念,揭示外部线索通过增强多模态绑定的注意力机制,提升跨模态定位精度并减少幻觉。

Comments Under review as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18763 2026-02-24 cs.CV cs.AI 84%

TAG: Thinking with Action Unit Grounding for Facial Expression Recognition

TAG:基于动作单元的面部表情识别中的思维

Haobo Lin, Tianyi Bai, Jiajun Zhang, Xuanhao Chang, Sheng Lu, Fangming Gu, Zengjie Hu, Wentao Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 TAG通过基于动作单元的视觉-语言框架,提升面部表情识别的推理可信度和视觉一致性。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13712 2026-02-17 cs.CV cs.LG 84%

Fine-tuned Vision Language Model for Localization of Parasitic Eggs in Microscopic Images

用于微镜图像中寄生虫卵定位的微调视觉语言模型

Chan Hao Sien, Hezerul Abdul Karim, Nouar AlDahoul

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种微调的视觉语言模型,用于自动定位显微图像中的寄生虫卵,实验结果显示其在mIOU指标上优于其他目标检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09701 2026-02-11 cs.CV cs.AI 84%

GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation

GenSeg-R1: 通过强化学习驱动的视觉-语言接地进行细粒度指称分割

Sandesh Hegde, Jaison Saji Chacko, Debarshi Banerjee, Uma Mahesh

机构 * Camcom Technologies Pvt. Ltd.(Camcom技术有限公司)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 GenSeg-R1 通过强化学习驱动的视觉-语言接地方法,在细粒度指称分割任务中实现了优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06351 2026-02-09 cs.AI cs.CV 84%

Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion

Trifuse: 通过多模态融合增强基于注意力的GUI定位

Longhui Ma, Di Zhao, Siwei Wang, Zhao Lv, Miao Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Intelligent Game and Decision Lab, Academy of Military Sciences(智能游戏与决策实验室,军事科学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Trifuse通过多模态融合提升GUI定位性能,整合注意力、OCR文本和图标描述语义,无需任务微调即可实现高效定位。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19647 2026-02-09 cs.CV cs.AI 84%

Show or Tell? Effectively prompting Vision-Language Models for semantic segmentation

展示还是讲述?有效提示视觉-语言模型进行语义分割

Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PromptMatcher,通过结合文本和视觉提示提升VLMs在语义分割中的性能,实现优于现有方法的改进。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02537 2026-02-04 cs.CV cs.LG 84%

WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models

WorldVQA:评估多模态大语言模型的原子视觉世界知识

Runjie Zhou, Youbo Shao, Haoyu Lu, Bowei Xing, Tongtong Bai, Yujie Chen, Jie Zhao, Lin Sui, Haotian Yao, Zijia Zhao, Hao Yang, Haoning Wu, Zaida Zhou, Jinguo Zhu, Zhiqi Huang, Yiping Bao, Yangyang Liu, Y. Charles, Xinyu Zhou

机构 * Moonshot AI

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 WorldVQA通过评估多模态大语言模型的原子视觉知识,建立衡量其事实性和百科全书广度的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05609 2026-02-03 cs.CV cs.AI 84%

HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection

HOI-R1: 探索多模态大语言模型在人类-物体交互检测中的潜力

Junwen Chen, Peilin Xiong, Keiji Yanai

机构 * Department of Informatics, The University of Electro-Communications(信息学系,东京电通大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 HOI-R1利用多模态大语言模型的推理能力,无需额外模块实现人类-物体交互检测任务的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17050 2026-01-27 cs.CV cs.AI 84%

Single-Pixel Vision-Language Model for Intrinsic Privacy-Preserving Behavioral Intelligence

单像素视觉-语言模型用于内在隐私保护的行为智能

Hongjun An, Yiliang Song, Jiawei Shao, Zhe Sun, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 单像素视觉-语言模型通过内在隐私保护机制,在隐私敏感环境中实现安全监控与行为智能的平衡。

Comments Initial Version, Pending Updates. We welcome any feedback and suggestions for improvement. Please feel free to contact us at an.hongjun@foxmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16895 2026-01-26 cs.CV cs.AI 84%

Evaluating Large Vision-language Models for Surgical Tool Detection

评估大型视觉-语言模型用于手术工具检测

Nakul Poudel, Richard Simon, Cristian A. Linte

机构 * Rochester Institute of Technology(罗切斯特理工大学) Center for Imaging Science(成像科学中心) Center for Imaging Science and Biomedical Engineering(成像科学与生物医学工程中心)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究评估了三种大型视觉-语言模型在手术工具检测任务中的性能,发现Qwen2.5在检测和泛化能力上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16394 2026-01-26 cs.CV cs.AI 84%

ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation

ResAgent:基于熵的先验点发现与视觉推理的指称表达分割

Yihao Wang, Jusheng Zhang, Ziyi Tang, Keze Wang, Meng Yang

机构 * Sun Yat-sen University(中山大学)

专题命中 视觉定位与Grounding :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 ResAgent通过熵引导的点发现和视觉推理方法,提升指称表达分割的准确性与效率。

Comments 23 pages, 7gigures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21862 2026-01-26 cs.CV cs.AI cs.IR 84%

A Multi-Stage Hybrid Framework for Automated Interpretation of Multi-View Engineering Drawings Using Vision Language Model

一种多阶段混合框架用于利用视觉语言模型自动解释多视图工程图

Muhammad Tayyab Khan, Zane Yong, Lequn Chen, Wenhe Feng, Nicholas Yew Jin Tan, Seung Ki Moon

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多阶段混合框架,利用视觉语言模型自动解析多视图工程图,通过布局分割、方向感知检测和语义解析提升工程图解读效率。

Comments This draft has been accepted in the 13th International Conference on Industrial Engineering and Applications (ICIEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08183 2026-01-15 cs.CV cs.AI 84%

GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards

GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节

Yan Zhu, Te Luo, Pei-Yao Fu, Zhen Zhang, Zi-Long Wang, Yi-Fan Qu, Zi-Han Geng, Jia-Qi Xu, Lu Yao, Li-Yun Ma, Wei Su, Wei-Feng Chen, Quan-Lin Li, Shuo Wang, Ping-Hong Zhou

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。

Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07291 2026-01-13 cs.CV cs.AI 84%

A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model

基于前缀微调的视觉语义自适应水印

Qi Zheng, Shuliang Liu, Yu Huang, Sihang Jia, Jungang Li, Lyuhao Chen, Junhao Chen, Hanqian Li, Aiwei Liu, Yibo Yan, Xuming Hu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VISA-Mark,一种基于前缀微调的视觉语义自适应水印方法,通过动态视觉证据权重提升视觉与语义保真度,实现高效且可靠的多模态水印技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00716 2026-01-05 cs.CV cs.AI 84%

Detecting Performance Degradation under Data Shift in Pathology Vision-Language Model

在病理视觉-语言模型中检测数据偏移下的性能退化

Hao Guan, Li Zhou

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出DomainSAT工具,通过输入数据偏移检测与输出置信度指标结合,提升病理VLM在数据偏移下的性能退化检测可靠性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06726 2025-12-09 cs.CV cs.AI cs.CL 84%

The Role of Entropy in Visual Grounding: Analysis and Optimization

熵在视觉定位中的作用:分析与优化

Shuo Li, Jiajun Sun, Zhihao Zhang, Xiaoran Fan, Senjie Jin, Hui Li, Yuming Yang, Junjie Ye, Lixing Shen, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hikvision Research Institute(海康威视研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ECVGPO算法,通过熵控制优化视觉定位任务,提升探索与利用的平衡,实现多基准的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16937 2025-11-24 cs.CV cs.AI 84%

OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios

OmniGround: 一个全面的时空接地基准用于现实复杂场景

Hong Gao, Jingyu Wu, Xiangkai Xu, Kangni Xie, Yunchen Zhang, Bin Zhong, Xurui Gao, Min-Ling Zhang

机构 * SouthEast University(东南大学) ZTE Corporation(中兴通讯)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 OmniGround提出一个全面的时空接地基准,通过改进的标注流程和评估框架,提升了复杂现实场景中视频目标定位的性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25032 2025-10-30 cs.CV cs.AI 84%

Efficient License Plate Recognition via Pseudo-Labeled Supervision with Grounding DINO and YOLOv8

Zahra Ebrahimi Vargoorani, Amir Mohammad Ghoreyshi, Ching Yee Suen

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 6 pages, 8 figures. Presented at 2025 IEEE International Workshop on Machine Learning for Signal Processing (MLSP), August 31 - September 3, 2025, Istanbul, Turkey

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23775 2025-10-29 cs.CV cs.AI eess.IV 84%

Explainable Detection of AI-Generated Images with Artifact Localization Using Faster-Than-Lies and Vision-Language Models for Edge Devices

Aryan Mathur, Asaduddin Ahmed, Pushti Amit Vasoya, Simeon Kandan Sonar, Yasir Z, Madesh Kuppusamy

机构 * Indian Institute of Technology Palakkad, India(印度帕拉卡德理工学院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20244 2025-10-24 cs.CV cs.LG 84%

Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding

Minseok Kang, Minhyeok Lee, Minjung Kim, Donghyeong Kim, Sangyoun Lee

机构 * Yonsei University(延世大学) LG Electronics(LG电子)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

Comments Comments: 28 pages, including appendix. 5 figures. Full version of the NeurIPS 2025 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20612 2025-10-24 cs.CV cs.CL cs.LG 84%

Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models

Peter Robicheaux, Matvei Popov, Anish Madan, Isaac Robinson, Joseph Nelson, Deva Ramanan, Neehar Peri

机构 * Roboflow Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments The first two authors contributed equally. This work has been accepted to the Neural Information Processing Systems (NeurIPS) 2025 Datasets & Benchmark Track. Project Page: https://rf100-vl.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18188 2025-10-22 cs.CV cs.AI 84%

RadDiagSeg-M: A Vision Language Model for Joint Diagnosis and Multi-Target Segmentation in Radiology

Chengrun Li, Corentin Royer, Haozhe Luo, Bastian Wittmann, Xia Li, Ibrahim Hamamci, Sezgin Er, Anjany Sekuboyina, Bjoern Menze

专题命中 视觉定位与Grounding :vision language model(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14304 2025-10-17 cs.CV cs.AI 84%

Watermarking for Factuality: Guiding Vision-Language Models Toward Truth via Tri-layer Contrastive Decoding

Kyungryul Back, Seongbeom Park, Milim Kim, Mincheol Kwon, SangHyeok Lee, Hyunyoung Lee, Junhee Cho, Seunghyun Park, Jinkyu Kim

机构 * CSE, Korea University(韩国大学计算机科学与工程系) KT Corporation(KT公司) Soongsil University(顺成大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2025 Findings; Project: https://github.com/KR-0822/TCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03333 2025-10-13 cs.CV cs.AI 84%

RadVLM: A Multitask Conversational Vision-Language Model for Radiology

Nicolas Deperrois, Hidetoshi Matsuo, Samuel Ruipérez-Campillo, Moritz Vandenhirtz, Sonia Laguna, Alain Ryser, Koji Fujimoto, Mizuho Nishio, Thomas M. Sutter, Julia E. Vogt, Jonas Kluckert, Thomas Frauenfelder, Christian Blüthgen, Farhad Nooralahzadeh, Michael Krauthammer

机构 * Department of Radiology, Kobe University(金泽大学放射科) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Department of Advanced Imaging in Medical Magnetic Resonance, Kyoto University(京都大学医学磁共振高级成像部门) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Diagnostic and Interventional Radiology, University Hospital Zurich(苏黎世大学医院诊断与介入放射科)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12266 2025-10-07 cs.CV cs.AI cs.CL 84%

CBVLM: Training-free Explainable Concept-based Large Vision Language Models for Medical Image Classification

Cristiano Patrício, Isabel Rio-Torto, Jaime S. Cardoso, Luís F. Teixeira, João C. Neves

机构 * INESC TEC NOVA LINCS Universidade da Beira Interior(贝拉蒙特大学) Universidade do Porto(波尔图大学)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted for publication in Computers in Biology and Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04039 2025-10-07 cs.CV cs.AI 84%

\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding

Bin Lei, Nuo Xu, Ali Payani, Mingyi Hong, Chunhua Liao, Yu Cao, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Cisco Research(思科研究) Lawrence Livermore National Labs(劳伦斯利弗莫尔国家实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02155 2025-10-03 cs.CV cs.AI 84%

Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting

Shu Zou, Xinyu Tian, Lukas Wesemann, Fabian Waschkowski, Zhaoyuan Yang, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) Maincode GE Research(通用电气研究)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 14 pages, video anomaly detection

详情

展开后加载摘要…

URL PDF HTML 收藏