arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2502.16786 2025-03-03 cs.CV 79%

SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding

Liangtao Shi, Ting Liu, Xiantao Hu, Yue Hu, Quanjun Yin, Richang Hong

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19247 2025-02-28 cs.CV 79%

ProxyTransformation: Preshaping Point Cloud Manifold With Proxy Attention For 3D Visual Grounding

Qihang Peng, Henry Zheng, Gao Huang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 12 pages, 3 figures. Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09599 2025-02-26 cs.CV cs.MM 79%

Language-Guided Diffusion Model for Visual Grounding

Sijia Chen, Baochun Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16842 2025-02-25 cs.CV 79%

Exploring Causes and Mitigation of Hallucinations in Large Vision Language Models

Yaqi Sun, Kyohei Atarashi, Koh Takeuchi, Hisashi Kashima

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16585 2025-02-25 cs.CV 79%

Anatomical grounding pre-training for medical phrase grounding

Wenjun Zhang, Shakes Chandra, Aaron Nicolson

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16539 2025-02-25 cs.CV 79%

Data-Efficient 3D Visual Grounding via Order-Aware Referring

Tung-Yu Wu, Sheng-Yu Huang, Yu-Chiang Frank Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments accepted to WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16223 2025-02-25 cs.CV 79%

Prompt as Knowledge Bank: Boost Vision-language model via Structural Representation for zero-shot medical detection

Yuguang Yang, Tongfei Chen, Haoyu Huang, Linlin Yang, Chunyu Xie, Dawei Leng, Xianbin Cao, Baochang Zhang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Accepted as ICLR 2025 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14638 2025-02-21 cs.CL cs.CV 79%

NAVIG: Natural Language-guided Analysis with Vision Language Models for Image Geo-localization

Zheyuan Zhang, Runze Li, Tasnim Kabir, Jordan Boyd-Graber

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00663 2025-02-20 cs.CV cs.RO 79%

Generalized Robot 3D Vision-Language Model with Fast Rendering and Pre-Training Vision-Language Alignment

Kangcheng Liu, Yong-Jin Liu, Baoquan Chen

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence, Manuscript Info: 17 Pages, 13 Figures, and 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12917 2025-02-19 cs.CV 79%

Contrast-Unity for Partially-Supervised Temporal Sentence Grounding

Haicheng Wang, Chen Ju, Weixiong Lin, Chaofan Ma, Shuai Xiao, Ya Zhang, Yanfeng Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICASSP 2025.The first two authors share the same contribution. arXiv admin note: text overlap with arXiv:2302.09850

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10455 2025-02-18 cs.LG cs.MM 79%

E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection

Junjie Wu, Yumeng Fu, Nan Yu, Guohong Fu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17207 2025-02-13 cs.CV cs.RO 79%

NanoMVG: USV-Centric Low-Power Multi-Task Visual Grounding based on Prompt-Guided Camera and 4D mmWave Radar

Runwei Guan, Jianan Liu, Liye Jia, Haocheng Zhao, Shanliang Yao, Xiaohui Zhu, Ka Lok Man, Eng Gee Lim, Jeremy Smith, Yutao Yue

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13382 2025-02-04 cs.CV 79%

VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding

Yongxin Guo, Jingyu Liu, Mingda Li, Dingxin Cheng, Xiaoying Tang, Dianbo Sui, Qingbin Liu, Xi Chen, Kevin Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17654 2025-01-30 cs.CL cs.AI 79%

Exploring Vision Language Models for Multimodal and Multilingual Stance Detection

Jake Vasilakes, Carolina Scarton, Zhixue Zhao

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.AI

Comments Submitted to the International AAAI Conference on Web and Social Media (ICWSM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13925 2025-01-24 cs.CV 79%

GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing

Akashah Shabbir, Mohammed Zumri, Mohammed Bennamoun, Fahad S. Khan, Salman Khan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09428 2025-01-17 cs.CV 79%

AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring

Xinyi Wang, Na Zhao, Zhiyuan Han, Dan Guo, Xun Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04693 2025-01-16 cs.RO cs.AI 79%

Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding

Joshua Jones, Oier Mees, Carmelo Sferrazza, Kyle Stachowicz, Pieter Abbeel, Sergey Levine

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06746 2025-01-15 cs.CV 79%

Diversified Augmentation with Domain Adaptation for Debiased Video Temporal Grounding

Junlong Ren, Gangjian Zhang, Haifeng Sun, Hao Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07396 2025-01-14 cs.CV 79%

Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models

Yasiru Ranasinghe, Vibashan VS, James Uplinger, Celso De Melo, Vishal M. Patel

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05228 2025-01-10 cs.CV 79%

Harnessing Large Language and Vision-Language Models for Robust Out-of-Distribution Detection

Pei-Kang Lee, Jun-Cheng Chen, Ja-Ling Wu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01416 2025-01-03 cs.CV 79%

Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension

Yaxian Wang, Henghui Ding, Shuting He, Xudong Jiang, Bifan Wei, Jun Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20059 2024-12-31 cs.CV 79%

AI-based Wearable Vision Assistance System for the Visually Impaired: Integrating Real-Time Object Recognition and Contextual Understanding Using Large Vision-Language Models

Mirza Samad Ahmed Baig, Syeda Anshrah Gillani, Shahid Munir Shah, Mahmoud Aljawarneh, Abdul Akbar Khan, Muhammad Hamzah Siddiqui

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);分类 cs.CV

Comments N-A

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16723 2024-12-24 cs.CV 79%

Divide and Conquer: Grounding a Bleeding Areas in Gastrointestinal Image with Two-Stage Model

Yu-Fan Lin, Bo-Cheng Qiu, Chia-Ming Lee, Chih-Chung Hsu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07870 2024-12-23 cs.CL cs.AI 79%

Trustful LLMs: Customizing and Grounding Text Generation with Knowledge Bases and Dual Decoders

Xiaofeng Zhu, Jaya Krishna Mandivarapu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Journal ref EMNLP CustomNLP4U 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22306 2024-12-23 cs.CV 79%

Multi-Object 3D Grounding with Dynamic Modules and Language-Informed Spatial Attention

Haomeng Zhang, Chiao-An Yang, Raymond A. Yeh

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00143 2024-12-20 cs.CV 79%

Diversifying Query: Region-Guided Transformer for Temporal Sentence Grounding

Xiaolong Sun, Liushuai Shi, Le Wang, Sanping Zhou, Kun Xia, Yabing Wang, Gang Hua

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by AAAI-25. Code is available at https://github.com/TensorsSun/RGTR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04925 2024-12-09 cs.CV 79%

$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models

Xiaojie Yin, Qilong Wang, Bing Cao, Qinghua Hu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00890 2024-12-03 cs.CV 79%

Exploring Large Vision-Language Models for Robust and Efficient Industrial Anomaly Detection

Kun Qian, Tianyu Sun, Wenhong Wang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12066 2024-12-03 cs.CV 79%

Temporally Grounding Instructional Diagrams in Unconstrained Videos

Jiahao Zhang, Frederic Z. Zhang, Cristian Rodriguez, Yizhak Ben-Shabat, Anoop Cherian, Stephen Gould

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to WACV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03077 2024-12-03 cs.CV 79%

MiKASA: Multi-Key-Anchor & Scene-Aware Transformer for 3D Visual Grounding

Chun-Peng Chang, Shaoxiang Wang, Alain Pagani, Didier Stricker

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏