arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2601.04777 2026-01-09 cs.CV cs.AI 90%

GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models

GeM-VG:迈向通用多图像视觉 grounding 的多模态大语言模型

Shurong Zheng, Yousong Zhu, Hongyin Zhao, Fan Yang, Yufei Zhan, Ming Tang, Jinqiao Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 GeM-VG通过引入MG-Data-240K数据集和混合强化微调策略,提升多图像视觉 grounding 和通用多图像理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06118 2025-12-23 cs.CV cs.AI 90%

ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling

ViGoR:通过细粒度奖励建模提升大视觉语言模型的视觉 grounding

Siming Yan, Min Bai, Weifeng Chen, Xiong Zhou, Qixing Huang, Li Erran Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AWS AI(AWS人工智能)

专题命中 视觉定位与Grounding :vision language model(title,abstract);grounding(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 ViGoR通过细粒度奖励建模提升大视觉语言模型的视觉 grounding 能力,采用更经济的人类评估和自动化方法,有效提高视觉推理准确性。

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06146 2025-11-11 cs.CL cs.AI cs.CV 90%

Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models

Akshar Tumu, Varad Shinde, Parisa Kordjamshidi

机构 * UC San Diego(加州大学圣地亚哥分校) IIT Kanpur(印度理工学院坎pur) Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted at IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23903 2025-09-10 cs.CV cs.AI 90%

Grounding DINO-US-SAM: Text-Prompted Multi-Organ Segmentation in Ultrasound with LoRA-Tuned Vision-Language Models

Hamza Rasaee, Taha Koleilat, Hassan Rivaz

机构 * Department of Electrical and Computer Engineering, Concordia University(电气与计算机工程系,康科迪亚大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 3 figures, 7 tables

Journal ref IEEE Transactions on Ultrasonics, Ferroelectrics, and Frequency Control, Sept. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20188 2025-08-29 cs.CV cs.LG 90%

Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study

Max Torop, Masih Eskandar, Nicholas Kurtansky, Jinyang Liu, Jochen Weber, Octavia Camps, Veronica Rotemberg, Jennifer Dy, Kivanc Kose

机构 * Northeastern University(东北大学) Memorial Sloan Kettering Cancer Center(纪念斯隆凯特琳癌症中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04702 2025-07-08 cs.CV cs.AI 90%

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning

Feng Yue, Zhaoxing Zhang, Junming Jiao, Zhengyu Liang, Shiwen Cao, Feifei Zhang, Rong Shen

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08456 2026-04-10 cs.CV cs.CL 90%

Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models

熵-梯度基础:在视觉语言模型中无需训练的证据检索

Marcel Gröpl, Jaewoo Jung, Seungryong Kim, Marc Pollefeys, Sunghwan Hong

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心) KAIST AI(韩国科学技术院人工智能系)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的视觉语言模型证据检索方法,通过熵梯度映射提升对微小视觉细节和多区域线索的处理能力,实验显示在多个基准上取得显著改进。

Comments Project Page : https://entropy-gradient-grounding.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13860 2024-10-18 cs.CV cs.RO 90%

VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding

Runsen Xu, Zhiwei Huang, Tai Wang, Yilun Chen, Jiangmiao Pang, Dahua Lin

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments CoRL 2024 Camera Ready. 25 pages. A novel zero-shot 3D visual grounding framework based solely on 2D images

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17146 2026-08-19 cs.RO 新提交 89%

PDDL-ART: Autonomous Symbolic Abstraction From Demonstration For Long-Horizon Robotic Manipulation Using Vision-Language Models

PDDL-ART:基于演示的自主符号抽象方法,用于使用视觉语言模型的长时程机器人操纵

Disha Kamale, Dmitry Berenson

机构 * University of Michigan(密歇根大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract)

AI总结 PDDL-ART是一种基于VLM的框架,可自主从演示生成PDDL描述,经多阶段校正确保语义对齐,在发动机维护和家庭操纵任务上平均成功率达93.3%,优于基线规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16004 2026-08-18 cs.IR 新提交 89%

LineageRAG: Harnessing GraphRAG by Constructing Evidence Lineages with Source Grounding

LineageRAG:通过构建带源 grounding 的证据谱系来利用 GraphRAG

Linyao Zheng, Xuhang Shi, Zhifang Mao, Sai Zhou, Shuaixian An, Xiuquan Hou, Jinze Li

专题命中 视觉定位与Grounding :grounding(title,title_cn)

AI总结 LineageRAG 针对现有 GraphRAG 未明确证据发现与源 grounding 关联的问题,构建带源 grounding 的证据谱系,在三个多跳问答数据集上较基线实现多项指标提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04933 2026-08-06 cs.RO 新提交 89%

Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments

Mimir:面向交互环境中具身智能体的、具备动态 grounding 的神经符号记忆系统

Haoming Xu, Zhenlin He, Hengyi Wang, Jiafeng Xu, Hao Dong

专题命中 视觉定位与Grounding :grounding(title,title_cn)

AI总结 本文提出Mimir,一种分离世界与任务记忆并具备动态grounding的神经符号记忆系统,在EB-ALFRED、EB-Habitat等具身任务中显著提升了智能体的长程执行成功率。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28273 2026-06-29 cs.CL 新提交 89%

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models

视觉默认,先验覆盖:视觉-语言模型中感知-知识冲突的因果机制

Niclas Lietzow, Danielle Bitterman, Carsten Eickhoff, William Rudman, Michal Golovanevsky

机构 * University of Tübingen(图宾根大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract)

AI总结 通过激活修补和消融实验,发现VLM中视觉默认激活,而先验知识依赖少量因果注意力头(2.5-4.8%),形成不对称因果结构。

Comments 14 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29585 2026-05-29 cs.CL 89%

World Models in Words: Auditing Physical State-Transition Commitments in Vision-Language Models

语言中的世界模型:审计视觉语言模型中的物理状态转换承诺

Emmanuelle Bourigault

机构 * University of Oxford(牛津大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract)

AI总结 提出WMW框架,通过要求VLM输出结构化轨迹(初始状态、状态转换、结果状态和答案)并利用混合验证器检查模式有效性、状态基础、转换一致性和答案-轨迹兼容性,揭示仅评估最终答案所隐藏的物理推理失败。

Comments 8 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15281 2026-05-21 cs.SE 89%

Semantic Grounding of Digital Twin Metamodels Using RDF Graphs

基于 RDF 图的数字孪生元模型语义 grounding

Faima Abbasi, Jean-Sébastien Sottet, Cedric Pruski

专题命中 视觉定位与Grounding :grounding(title,title_cn)

AI总结 本文提出了一种基于 RDF 图的数字孪生元模型语义 grounding 方法,通过设计多层数字孪生模型、将元模型提升为 RDF 图以及图基对齐方法 SSM-OM,实现了多层数字孪生的语义一致性与互操作性。

Comments Submitted to Conference, 15 pages excluding references, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03417 2026-05-15 cs.CL 89%

FactNet: A Billion-Scale Knowledge Graph for Multilingual Factual Grounding

FactNet:一个十亿级的知识图谱用于多语言事实 grounding

Yingli Shen, Wen Lai, Jie Zhou, Xueren Zhang, Yudong Wang, Kangyang Luo, Shuo Wang, Ge Gao, Alexander Fraser, Maosong Sun

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) ModelBest Inc.(ModelBest公司) Minzu University of China(民族大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn)

AI总结 FactNet通过结合17亿条维基数据语句和301亿条证据指针,构建了一个十亿级多语言知识图谱,提供事实 grounding 的评估框架,并验证了跨语言结构的知识迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02791 2026-04-28 cs.CL 89%

Making Dialogue Grounding Data Rich: A Three-Tier Data Synthesis Framework for Generalized Referring Expression Comprehension

使对话 grounding 数据丰富:一种三层数据合成框架用于通用指称表达理解

Juexi Shao, Siyou Li, Yujian Gan, Chris Madge, Vanja Karan, Massimo Poesio

机构 * Queen Mary University of London(伦敦玛丽女王大学) Queen's University Belfast(贝尔法斯特女王大学) University of Vienna(维也纳大学) Utrecht University(乌得勒支大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn)

AI总结 本文提出三层数据合成框架,通过平衡真实性和可控性,生成可扩展的对话条件 grounding 监督,提升指称表达理解的性能。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 18142-18146

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12781 2026-08-19 cs.CV 版本更新 89%

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Large Language Model Department, Tencent(腾讯大语言模型部) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院)

专题命中 视觉定位与Grounding :MLLM(title_cn,summary_cn);grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。

Comments 8 tables and 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03631 2026-08-05 cs.CV 新提交 89%

SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification

SEER:用于受控空间关系分类的自 grounding 证据接口

Feixiang Liu, Likun Wang, Qiang Qiu, Hui Xu, Huawei Shen, Xueqi Cheng

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);grounding(title_cn,abstract);分类 cs.CV

AI总结 本文提出针对冻结VLM的无训练推理时证据接口SEER,通过构建查询特定证据缓解空间关系分类错误,在多数据集上取得显著性能提升,证明该干预措施的有效性。

Comments 23 pages total, 2 figures. Code: https://github.com/SouthWinter/SEER

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18373 2026-04-14 cs.CV 89%

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

MASS:面向视觉-语言模型中物理推理与理解的运动感知空间-时间 grounding

Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);vision language model(abstract);VLM(abstract)

AI总结 MASS通过引入空间-时间信号提升视觉-语言模型对物理现象的理解能力,提出MASS-Bench基准测试集并验证模型在物理推理中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23067 2026-03-26 cs.CV 89%

MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding

MLLM-HWSI: 一种用于分层全滑动图像理解的多模态大语言模型

Basit Alawode, Arif Mahmood, Muaz Khalifa Al-Radi, Shahad Albastaki, Asim Khan, Muhammad Bilal, Moshira Ali Abdalla, Mohammed Bennamoun, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系) Information Technology University(信息技术大学) KAU(卡乌大学) University of the Western Australia(西澳大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出MLLM-HWSI,一种分层全滑动图像级多模态大语言模型,通过四级尺度对齐视觉特征与病理语言,提升解释性证据接地推理能力,在六个CPath任务上取得新SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06965 2026-03-13 cs.CV 89%

MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images

MedMO:为医学图像构建和理解多模态大语言模型

Ankan Deria, Komal Kumar, Adinath Madhavrao Dukre, Eran Segal, Salman Khan, Imran Razzak

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 MedMO是一种基于通用MLLM架构构建的医学多模态基础模型,通过多阶段训练提升跨模态和任务的性能,超越现有开源基线,在医学图像识别和报告生成中取得显著提升。

Comments 21 pages, 6 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02329 2026-03-04 cs.CV 89%

HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

HAMMER: 通过跨模态整合利用大语言模型进行意图驱动的3D affordance grounding

Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 HAMMER通过跨模态整合多模态大语言模型,实现意图驱动的3D affordance grounding,提升3D表示的准确性和鲁棒性。

Comments Accepted by CVPR 2026. Project Page: https://rayyoh.github.io/Hammer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20794 2026-02-25 cs.CV 89%

VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving

VGGDrive: 通过跨视角几何 grounding 为自动驾驶赋能 Vision-Language 模型

Jie Wang, Guang Li, Zhijian Huang, Chenxu Dang, Hangjun Ye, Yahong Han, Long Chen

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Xiaomi EV(小米汽车)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract);分类 cs.CV

AI总结 VGGDrive通过引入跨视角几何 grounding 机制,提升Vision-Language模型在自动驾驶任务中的性能表现。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11904 2025-05-13 cs.CV 89%

GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding

Yue Zhou, Mengcheng Lan, Xiang Li, Litong Feng, Yiping Ke, Xue Jiang, Qingyun Li, Xue Yang, Wayne Zhang

机构 * Nanyang Technological University(南洋理工大学) University of Reading(阅读大学) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) SenseTime Research(商汤科技研究院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract);分类 cs.CV

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13983 2025-04-14 cs.CV 89%

SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability

Jiankang Wang, Zhihan Zhang, Zhihang Liu, Yang Li, Jiannan Ge, Hongtao Xie, Yongdong Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19325 2025-03-14 cs.CV 89%

GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks

Muhammad Sohail Danish, Muhammad Akhtar Munir, Syed Roshaan Ali Shah, Kartik Kuckreja, Fahad Shahbaz Khan, Paolo Fraccaro, Alexandre Lacoste, Salman Khan

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(title,abstract);LLaVA(abstract);分类 cs.CV

Comments This updated version includes revisions and additional analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10419 2025-03-14 cs.RO cs.AI 89%

HiFi-CS: Towards Open Vocabulary Visual Grounding For Robotic Grasping Using Vision-Language Models

Vineet Bhat, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12694 2025-02-19 cs.CV cs.CL 89%

VividMed: Vision Language Model with Versatile Visual Grounding for Medicine

Lingxiao Luo, Bingda Tang, Xuanzhong Chen, Rong Han, Ting Chen

专题命中 视觉定位与Grounding :vision language model(title,abstract);grounding(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10840 2024-12-17 cs.CV 89%

Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning

Hai-Ming Xu, Qi Chen, Lei Wang, Lingqiao Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14901 2024-11-25 cs.CV cs.CL 89%

ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos

Tanveer Hannan, Md Mohaiminul Islam, Jindong Gu, Thomas Seidl, Gedas Bertasius

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏