arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2601.06899 2026-01-19 cs.AI 79%

V2P: Visual Attention Calibration for GUI Grounding via Background Suppression and Center Peaking

V2P: 通过背景抑制和中心峰值校准实现GUI定位的视觉注意力校准

Jikai Chen, Long Chen, Dong Wang, Qinglin Su, Zhixuan Chu, Bingguang Hao, Leilei Gan, Chenyi Zhuang, Jinjie Gu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 V2P通过背景抑制和中心峰值校准方法提升GUI元素定位精度,实现更精确的GUI交互。

Comments This work was intended as a replacement of arXiv:2508.13634 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17493 2026-01-14 cs.AI cs.LO 79%

Automated Hybrid Grounding Using Structural and Data-Driven Heuristics

基于结构和数据驱动启发式的自动化混合接地

Alexander Beiser, Markus Hecher, Stefan Woltran

机构 * Univ. Artois, CNRS, UMR8188, Computer Science Research Center of Lens (CRIL), Lens, France(阿托瓦大学、法国国家科学研究中心、UMR8188、Lens计算科学研究中心(CRIL)、Lens)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出基于结构和数据驱动启发式的自动化混合接地方法,通过分割算法优化接地策略,提升难接地场景的性能并接近当前最佳水平。

Journal ref Theory and Practice of Logic Programming 25 (2025) 489-506

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22533 2026-01-12 cs.CL cs.AI 79%

CliCARE: Grounding Large Language Models in Clinical Guidelines for Decision Support over Longitudinal Cancer Electronic Health Records

CliCARE: 在纵向癌症电子健康记录上基于临床指南 grounding 大型语言模型以支持决策

Dongchen Li, Jitao Liang, Wei Li, Xiaoyu Wang, Longbing Cao, Kun Yu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 CliCARE 通过将纵向癌症 EHRs 转换为时序知识图谱并结合临床指南,为肿瘤科医生提供证据支持的决策支持。

Comments Accepted in AAAI Conference on Artificial Intelligence (AAAI-26, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18693 2026-01-09 cs.CV 79%

MVT: Mask-Grounded Vision-Language Models for Taxonomy-Aligned Land-Cover Tagging

MVT:基于分类对齐的土地覆盖标签的掩码导向视觉-语言模型

Siyi Chen, Kai Wang, Weicong Pang, Ruiming Yang, Ziru Chen, Renjun Gao, Alexis Kai Hon Lau, Dasa Gu, Chenchen Zhang, Cheng Li

机构 * HKUST(香港科技大学) JHU(约翰·霍普金斯大学) CUHKSZ(香港中文大学) NUS(新加坡国立大学) MUST(穆斯林大学)

专题命中 视觉定位与Grounding :vision-language model(title);MLLM(abstract);分类 cs.CV

AI总结 MVT通过三阶段框架结合类无关掩码证据与基于分类的场景解释,提升遥感土地覆盖标签的准确性和信息性。

Comments The project is available at https://charlescsyyy.github.io/MVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04201 2026-01-09 cs.CL cs.AI cs.CY cs.HC 79%

Collective Narrative Grounding: Community-Coordinated Data Contributions to Improve Local AI Systems

集体叙事 grounding:社区协调的数据贡献以改进本地 AI 系统

Zihan Gao, Mohsin Y. K. Yousufi, Jacob Thebault-Spieker

机构 * Information Science University of Wisconsin-Madison(信息科学大学威斯康星大学麦迪逊分校) Digital Media Georgia Tech(数字媒体佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出集体叙事 grounding 协议,通过社区协调的数据贡献,改进本地 AI 系统,解决社区特定查询的问答问题。

Comments 9 pages, 2 figures, Presented at the NeurIPS 2025 ACA Workshop accepted-papers.html" target="_blank" rel="noopener">https://acaworkshop.github.io/accepted-papers.html,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03850 2026-01-08 cs.AI 79%

Investigating the Grounding Bottleneck for a Large-Scale Configuration Problem: Existing Tools and Constraint-Aware Guessing

探讨大规模配置问题中的 grounding 阻塞问题:现有工具与约束感知猜测

Veronika Semmelrock, Gerhard Friedrich

机构 * Department of Artificial Intelligence(人工智能系) Cybersecurity University of Klagenfurt, Austria(克雷根弗特大学网络安全学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文探讨了ASP在大规模配置问题中的grounding瓶颈,提出约束感知猜测方法以减少内存需求。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 482-495

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02677 2026-01-07 cs.LG q-fin.RM q-fin.ST 79%

Uni-FinLLM: A Unified Multimodal Large Language Model with Modular Task Heads for Micro-Level Stock Prediction and Macro-Level Systemic Risk Assessment

Uni-FinLLM:一种具有模块化任务头的统一多模态大语言模型,用于微观层面的股票预测和宏观层面的系统性风险评估

Gongao Zhang, Haijiang Zeng, Lu Jiang

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.LG

AI总结 Uni-FinLLM通过统一多模态大语言模型,结合模块化任务头,实现了对股票预测和系统性风险评估的高效联合建模,显著提升了预测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01526 2026-01-06 cs.CV 79%

BARE: Towards Bias-Aware and Reasoning-Enhanced One-Tower Visual Grounding

BARE:面向偏见意识和推理增强的单塔视觉定位

Hongbing Li, Linhui Xiao, Zihan Zhao, Qi Shen, Yixiang Huang, Bo Xiao, Zhanyu Ma

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Pengcheng Laboratory(鹏城实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 BARE通过引入三个新模块,提升单塔视觉定位任务中对偏见的意识和推理能力,实现更高效和准确的多模态理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24605 2026-01-01 cs.CV 79%

MoniRefer: A Real-world Large-scale Multi-modal Dataset based on Roadside Infrastructure for 3D Visual Grounding

MoniRefer: 一种基于道路基础设施的现实世界大规模多模态数据集用于3D视觉定位

Panquan Yang, Junfei Huang, Zongzhangbao Yin, Yingsong Hu, Anni Xu, Xinyi Luo, Xueqi Sun, Hai Wu, Sheng Ao, Zhaoxing Zhu, Chenglu Wen, Cheng Wang

机构 * Xiamen University(厦门大学) Pengcheng Laboratory(鹏城实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出MoniRefer数据集和Moni3DVG方法,用于解决户外监控场景下的3D视觉定位问题。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22197 2025-12-30 cs.CV 79%

Quadrant Segmentation VLM with Few-Shot Adaptation and OCT Learning-based Explainability Methods for Diabetic Retinopathy

四象限分割视觉语言模型结合少样本适应与基于OCT学习的可解释方法用于糖尿病视网膜病变

Shivum Telang

机构 * Department of Biostatics(生物统计学系) North Allegheny Senior High School(北阿勒格尼高中) University of Pittsburgh Rangos Research Center(匹兹堡大学Rangos研究中心)

专题命中 视觉定位与Grounding :VLM(title,abstract);分类 cs.CV

AI总结 本文提出一种基于四象限分割和少样本学习的多模态视觉语言模型,利用OCT和视网膜图像生成可解释性热图,提升糖尿病视网膜病变的诊断效果。

Comments 4 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20732 2025-12-23 cs.MM cs.CV 79%

Prompt-Aware Adaptive Elastic Weight Consolidation for Continual Learning in Medical Vision-Language Models

面向提示的自适应弹性权重固化用于医学视觉-语言模型的持续学习

Ziyuan Gao, Philippe Morel

机构 * University College London(伦敦大学学院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 PA-EWC通过提示引导的参数专门化,有效缓解医疗视觉-语言模型在持续学习中的灾难性遗忘问题,提升多模态医学任务的性能。

Comments Accepted by 32nd International Conference on MultiMedia Modeling (MMM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16770 2025-12-19 cs.CL cs.AI 79%

GinSign: Grounding Natural Language Into System Signatures for Temporal Logic Translation

GinSign:将自然语言接地到系统签名以进行时序逻辑翻译

William English, Chase Walker, Dominic Simon, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 GinSign通过将自然语言接地到系统签名,提升时序逻辑翻译的准确性和下游模型检查能力,实现95.5%的逻辑等价分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13771 2025-12-17 cs.AI 79%

Semantic Grounding Index: Geometric Bounds on Context Engagement in RAG Systems

语义 grounding 指数:RAG 系统中上下文参与的几何界限

Javier Marín

机构 * CERT

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出语义 grounding 指数(SGI),通过几何角度分析 RAG 系统中响应与问题、上下文之间的关系,揭示幻觉响应在角度上接近问题而非上下文,验证了 SGI 在评估响应真实性中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12246 2025-12-16 cs.CV 79%

Moment and Highlight Detection via MLLM Frame Segmentation

通过MLLM帧分割进行时刻和亮点检测

I Putu Andika Bagas Jiwanta, Ayu Purwarianti

机构 * School of Electrical Engineering and Informatics(电气工程与信息学院) Institut Teknologi Bandung(万隆技术大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出通过MLLM帧分割实现视频时刻和亮点检测,利用分割损失与因果LM损失结合,提升检测精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09117 2025-12-11 cs.AI 79%

A Categorical Analysis of Large Language Models and Why LLMs Circumvent the Symbol Grounding Problem

大型语言模型的范畴分析及为何LLMs绕过了符号 grounding 问题

Luciano Floridi, Yiyang Jia, Fernando Tohmé

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文通过范畴分析,探讨了LLMs如何绕过符号 grounding 问题,而非解决它。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20409 2025-12-11 cs.LO cs.AI 79%

A Unified Formal Theory on the Logical Limits of Symbol Grounding

符号接地逻辑界限的统一正式理论

Zhangchi Liu

机构 * Zhangchi Liu(独立研究者)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出符号接地问题的统一理论,通过形式证明展示其逻辑界限,指出外部动态过程与具身交互的必要性。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00518 2025-12-10 cs.CV cs.CL 79%

Fine-grained Spatiotemporal Grounding on Egocentric Videos

细粒度眼动视频时空定位

Shuo Liang, Yiwu Zhong, Zi-Yuan Hu, Yeyao Tao, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出EgoMask基准和EgoMask-Train数据集,针对眼动视频细粒度时空定位的挑战,通过微调提升模型性能。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05996 2025-12-09 cs.CV cs.CY cs.RO eess.IV 79%

FishDetector-R1: Unified MLLM-Based Framework with Reinforcement Fine-Tuning for Weakly Supervised Fish Detection, Segmentation, and Counting

FishDetector-R1: 基于统一MLLM框架的弱监督鱼类检测、分割与计数强化微调方法

Yi Liu, Jingyu Song, Vedanth Kallakuri, Katherine A. Skinner

机构 * University of Michigan(密歇根大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);分类 cs.CV

AI总结 FishDetector-R1通过统一MLLM框架和强化学习微调,实现了弱监督下的鱼类检测、分割与计数的高效准确提升。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05482 2025-12-08 cs.CV 79%

Concept-based Explainable Data Mining with VLM for 3D Detection

基于概念的可解释数据挖掘与VLM用于3D检测

Mai Tsujimoto

机构 * The University of Tokyo(东京大学)

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于概念的可解释数据挖掘方法,利用VLMs识别稀有物体以提升3D检测性能,减少标注负担并提高模型效果。

Comments 28 pages including appendix. Code: https://github.com/mm1129/concept_based_rare_detector_2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04231 2025-12-05 cs.RO cs.AI 79%

CRAFT-E: A Neuro-Symbolic Framework for Embodied Affordance Grounding

CRAFT-E:一种用于具身赋能力量接地的神经符号框架

Zhou Chen, Joe Lin, Carson Bulgin, Sathyanarayanan N. Aakur

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 CRAFT-E通过结合神经符号方法和具身感知,提供了一种可解释且可定制的框架,用于辅助机器人系统中基于赋能力量的物体选择。

Comments 20 pages. 3 figures, 4 tables. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10194 2025-12-02 cs.CV 79%

B2N3D: Progressive Learning from Binary to N-ary Relationships for 3D Object Grounding

B2N3D: 从二元关系到N元关系的3D物体接地的渐进式学习

Feng Xiao, Hongbin Xu, Hai Ci, Wenxiong Kang

机构 * School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) ByteDance Seed(字节跳动种子) Show Lab, National University of Singapore(Show Lab,新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 B2N3D通过引入N元关系学习提升3D物体接地的准确性,利用分组监督损失和混合注意力机制实现更精确的多模态关系建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23151 2025-12-01 cs.CV 79%

Learning to Refuse: Refusal-Aware Reinforcement Fine-Tuning for Hard-Irrelevant Queries in Video Temporal Grounding

学习拒绝:用于视频时间定位中处理难相关查询的拒绝感知强化微调

Jin-Seop Lee, SungJoon Lee, SeongJun Jung, Boyang Li, Jee-Hyong Lee

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出RA-RFT方法,通过拒绝感知强化微调提升视频时间定位中对难相关查询的处理能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23867 2025-11-25 cs.CV 79%

Sim-DETR: Unlock DETR for Temporal Sentence Grounding

Sim-DETR: 解锁用于时间句子定位的DETR

Jiajin Tang, Zhengxuan Wei, Yuchen Zhu, Cheng Shi, Guanbin Li, Liang Lin, Sibei Yang

机构 * ShanghaiTech University(上海科技大学) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 Sim-DETR通过改进DETR的解码器层,解决了时间句子定位中的查询冲突问题,提升了模型性能。

Comments This work is accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18883 2025-11-24 cs.CV 79%

Universal Video Temporal Grounding with Generative Multi-modal Large Language Models

通用视频时间定位与生成多模态大语言模型

Zeqian Li, Shangzhe Di, Zhonghua Zhai, Weilin Huang, Yanfeng Wang, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ByteDance Seed(字节跳动种子)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15720 2025-11-21 cs.AI 79%

Automated Hazard Detection in Construction Sites Using Large Language and Vision-Language Models

利用大语言和视觉-语言模型进行施工工地自动危险检测

Islem Sahraoui

机构 * University of Houston Cullen College of Engineering Department of Civil and Environmental Engineering(德克萨斯大学休斯顿分校库伦工程学院土木与环境工程系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.AI

AI总结 本研究利用大语言和视觉-语言模型,通过分析文本和图像数据,提高施工工地的安全隐患检测效率。

Comments Master thesis, University of Houton

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10241 2025-11-21 cs.CV 79%

TubeRMC: Tube-conditioned Reconstruction with Mutual Constraints for Weakly-supervised Spatio-Temporal Video Grounding

TubeRMC: 基于互约束的管状重建用于弱监督空间-时间视频定位

Jinxuan Li, Yi Zhang, Jian-Fang Hu, Chaolei Tan, Tianming Liang, Beihao Xia

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 TubeRMC通过引入互约束的管状重建方法,在弱监督条件下提升空间-时间视频定位的准确性和一致性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15379 2025-11-20 cs.CV 79%

Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time Training

零样本开放词汇人体运动接地与测试时训练

Yunjiao Zhou, Xinyan Chen, Junlang Qian, Lihua Xie, Jianfei Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出ZOMG框架,通过语言语义分区和软掩码优化,在无需标注或微调的情况下实现零样本开放词汇的人体运动接地,提升了运动理解的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13924 2025-11-19 cs.CV 79%

Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding

Qingyang Yan, Guangyao Chen, Yixiong Zou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11438 2025-11-17 cs.CV 79%

VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models

Mingjie Xu, Jinpeng Chen, Yuzhi Zhao, Jason Chun Lok Li, Yue Qiu, Zekang Du, Mengyang Wu, Pingping Zhang, Kun Li, Hongzheng Yang, Wenao Ma, Jiaheng Wei, Qinbin Li, Kangcheng Liu, Wenqiang Lei

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments This is the extended version of the paper accepted at AAAI 2026, which includes all technical appendices and additional experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10705 2025-11-17 cs.AI cs.CL 79%

Co-EPG: A Framework for Co-Evolution of Planning and Grounding in Autonomous GUI Agents

Yuan Zhao, Hualei Zhu, Tingyu Jiang, Shen Li, Xiaohang Xu, Hao Henry Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏