arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2504.03193 2025-04-16 cs.CV 79%

Mamba as a Bridge: Where Vision Foundation Models Meet Vision Language Models for Domain-Generalized Semantic Segmentation

Xin Zhang, Robby T. Tan

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments Accepted to CVPR 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04918 2025-04-16 cs.CV 79%

Fine-Tuning Florence2 for Enhanced Object Detection in Un-constructed Environments: Vision-Language Model Approach

Aysegul Ucar, Soumyadeep Ro, Sanapala Satwika, Pamarthi Yasoda Gayathri, Mohmmad Ghaith Balsha

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 22 pages, 13 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10048 2025-04-15 cs.CV 79%

Multi-Object Grounding via Hierarchical Contrastive Siamese Transformers

Chengyi Du, Keyan Jin

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05821 2025-04-14 cs.CV 79%

F-LMM: Grounding Frozen Large Multimodal Models

Size Wu, Sheng Jin, Wenwei Zhang, Lumin Xu, Wentao Liu, Wei Li, Chen Change Loy

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Project Page: https://github.com/wusize/F-LMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14174 2025-04-14 cs.CV 79%

Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding

Jingjing Hu, Dan Guo, Kun Li, Zhan Si, Xun Yang, Xiaojun Chang, Meng Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to IEEE TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07252 2025-04-11 cs.CV 79%

Few-Shot Adaptation of Grounding DINO for Agricultural Domain

Rajhans Singh, Rafael Bidese Puhl, Kshitiz Dhakal, Sudhir Sornapudi

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20678 2025-04-08 cs.CV 79%

STPro: Spatial and Temporal Progressive Learning for Weakly Supervised Spatio-Temporal Grounding

Aaryan Garg, Akash Kumar, Yogesh S Rawat

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR'25 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14604 2025-04-08 cs.LG 79%

Noisy Test-Time Adaptation in Vision-Language Models

Chentao Cao, Zhun Zhong, Zhanke Zhou, Tongliang Liu, Yang Liu, Kun Zhang, Bo Han

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02286 2025-04-04 cs.CV 79%

Moment Quantization for Video Temporal Grounding

Xiaolong Sun, Le Wang, Sanping Zhou, Liushuai Shi, Kun Xia, Mengnan Liu, Yabing Wang, Gang Hua

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01952 2025-04-03 cs.CV 79%

Image Difference Grounding with Natural Language

Wenxuan Wang, Zijia Zhao, Yisi Zhang, Yepeng Tang, Erdong Hu, Xinlong Wang, Jing Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00019 2025-04-02 cs.CL cs.AI cs.SE 79%

ObscuraCoder: Powering Efficient Code LM Pre-Training Via Obfuscation Grounding

Indraneil Paul, Haoyi Yang, Goran Glavaš, Kristian Kersting, Iryna Gurevych

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10437 2025-04-02 cs.CV 79%

4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language Models

Wanhua Li, Renping Zhou, Jiawei Zhou, Yingwei Song, Johannes Herter, Minghan Qin, Gao Huang, Hanspeter Pfister

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments CVPR 2025. Project Page: https://4d-langsplat.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23181 2025-04-01 cs.CV 79%

Enhancing Weakly Supervised Video Grounding via Diverse Inference Strategies for Boundary and Prediction Selection

Sunoh Kim, Daeho Um

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18290 2025-03-27 cs.CV 79%

Stealthy Backdoor Attack in Self-Supervised Learning Vision Encoders for Large Vision Language Models

Zhaoyi Liu, Huan Zhang

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04923 2025-03-26 cs.CV 79%

VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos

Shehan Munasinghe, Hanan Gani, Wenqi Zhu, Jiale Cao, Eric Xing, Fahad Shahbaz Khan, Salman Khan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Technical Report of VideoGLaMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15024 2025-03-25 cs.CV 79%

Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models

Jin Wang, Chenghui Lv, Xian Li, Shichao Dong, Huadong Li, kelu Yao, Chao Li, Wenqi Shao, Ping Luo

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

Comments 31 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16776 2025-03-24 cs.CV 79%

OpenCity3D: What do Vision-Language Models know about Urban Environments?

Valentin Bieri, Marco Zamboni, Nicolas S. Blumer, Qingxuan Chen, Francis Engelmann

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Published at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10332 2025-03-24 cs.CV 79%

Number it: Temporal Grounding Videos like Flipping Manga

Yongliang Wu, Xinting Hu, Yuyang Sun, Yizhou Zhou, Wenbo Zhu, Fengyun Rao, Bernt Schiele, Xu Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17053 2025-03-18 cs.CV 79%

Contextual Self-paced Learning for Weakly Supervised Spatio-Temporal Video Grounding

Akash Kumar, Zsolt Kira, Yogesh Singh Rawat

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICLR'25 Main Conference. Project Page: https://akash2907.github.io/cospal_webpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08520 2025-03-18 cs.CV 79%

GroundingBooth: Grounding Text-to-Image Customization

Zhexiao Xiong, Wei Xiong, Jing Shi, He Zhang, Yizhi Song, Nathan Jacobs

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Project page: https://groundingbooth.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03461 2025-03-17 cs.CL cs.LG 79%

Auto-GDA: Automatic Domain Adaptation for Efficient Grounding Verification in Retrieval-Augmented Generation

Tobias Leemann, Periklis Petridis, Giuseppe Vietri, Dionysis Manousakas, Aaron Roth, Sergul Aydore

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10500 2025-03-14 cs.CV 79%

OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding

Jiali Yao, Xinran Deng, Xin Gu, Mengrui Dai, Bing Fan, Zhipeng Zhang, Yan Huang, Heng Fan, Libo Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07244 2025-03-13 cs.CV cs.CL 79%

Can Vision-Language Models Evaluate Handwritten Math?

Oikantik Nath, Hanani Bathina, Mohammed Safi Ur Rahman Khan, Mitesh M. Khapra

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08084 2025-03-12 cs.RO cs.AI 79%

Instruction-Augmented Long-Horizon Planning: Embedding Grounding Mechanisms in Embodied Mobile Manipulation

Fangyuan Wang, Shipeng Lyu, Peng Zhou, Anqing Duan, Guodong Guo, David Navarro-Alarcon

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 17 pages, 11 figures

Journal ref AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06142 2025-03-11 cs.CV 79%

VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models

Xinan He, Yue Zhou, Bing Fan, Bin Li, Guopu Zhu, Feng Ding

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04034 2025-03-11 cs.CV 79%

Task-oriented Sequential Grounding and Navigation in 3D Scenes

Zhuofan Zhang, Ziyu Zhu, Junhao Li, Pengxiang Li, Tianxu Wang, Tengyu Liu, Xiaojian Ma, Yixin Chen, Baoxiong Jia, Siyuan Huang, Qing Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments website: https://sg-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05082 2025-03-10 cs.CV 79%

Taming Video Diffusion Prior with Scene-Grounding Guidance for 3D Gaussian Splatting from Sparse Inputs

Yingji Zhong, Zhihao Li, Dave Zhenyu Chen, Lanqing Hong, Dan Xu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR2025. The project page is available at https://zhongyingji.github.io/guidevd-3dgs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04250 2025-03-07 cs.CV cs.HC 79%

An Egocentric Vision-Language Model based Portable Real-time Smart Assistant

Yifei Huang, Jilan Xu, Baoqi Pei, Yuping He, Guo Chen, Mingfang Zhang, Lijin Yang, Zheng Nie, Jinyao Liu, Guoshun Fan, Dechen Lin, Fang Fang, Kunpeng Li, Chang Yuan, Xinyuan Chen, Yaohui Wang, Yali Wang, Yu Qiao, Limin Wang

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05643 2025-03-04 cs.CV 79%

TRACE: Temporal Grounding Video LLM via Causal Event Modeling

Yongxin Guo, Jingyu Liu, Mingda Li, Qingbin Liu, Xi Chen, Xiaoying Tang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20572 2025-03-03 cs.CV cs.CL 79%

HazardNet: A Small-Scale Vision Language Model for Real-Time Traffic Safety Detection at Edge Devices

Mohammad Abu Tami, Mohammed Elhenawy, Huthaifa I. Ashqar

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏