arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2405.15274 2024-05-27 cs.CV cs.HC 79%

Talk to Parallel LiDARs: A Human-LiDAR Interaction Method Based on 3D Visual Grounding

Yuhang Liu, Boyi Sun, Guixu Zheng, Yishuo Wang, Jing Wang, Fei-Yue Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01174 2024-05-24 cs.CV cs.MM 79%

SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding

Wenrui Li, Xiaopeng Hong, Ruiqin Xiong, Xiaopeng Fan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11463 2024-05-15 cs.CV 79%

Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding

Chaolei Tan, Jianhuang Lai, Wei-Shi Zheng, Jian-Fang Hu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2024. v2: fix a typo in figure 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00197 2024-05-02 cs.AI cs.DB cs.IR 79%

Grounding Realizable Entities

Michael Rabenberg, Carter Benson, Federico Donato, Yongqun He, Anthony Huffman, Shane Babcock, John Beverley

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 13

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07973 2024-04-12 cs.CV 79%

Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models

Haotian Zhang, Haoxuan You, Philipp Dufter, Bowen Zhang, Chen Chen, Hong-You Chen, Tsu-Jui Fu, William Yang Wang, Shih-Fu Chang, Zhe Gan, Yinfei Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Preprint. 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02257 2024-04-08 cs.CV 79%

SnAG: Scalable and Accurate Video Grounding

Fangzhou Mu, Sicheng Mo, Yin Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Code available at https://github.com/fmu2/snag_release

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12686 2024-04-08 cs.CV cs.MM cs.RO 79%

WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar

Runwei Guan, Liye Jia, Fengyufan Yang, Shanliang Yao, Erick Purwanto, Xiaohui Zhu, Eng Gee Lim, Jeremy Smith, Ka Lok Man, Xuming Hu, Yutao Yue

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04077 2024-04-05 cs.RO cs.AI 79%

SayNav: Grounding Large Language Models for Dynamic Planning to Navigation in New Environments

Abhinav Rajvanshi, Karan Sikka, Xiao Lin, Bhoram Lee, Han-Pang Chiu, Alvaro Velasquez

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01207 2024-04-02 cs.CV 79%

Vision-language models for decoding provider attention during neonatal resuscitation

Felipe Parodi, Jordan Matelsky, Alejandra Regla-Vargas, Elizabeth Foglia, Charis Lim, Danielle Weinberg, Konrad Kording, Heidi Herrick, Michael Platt

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00901 2024-04-02 cs.CV 79%

Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding

Syed Talal Wasim, Muzammal Naseer, Salman Khan, Ming-Hsuan Yang, Fahad Shahbaz Khan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15383 2024-03-26 cs.CV 79%

Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding

Zhihao Yuan, Jinke Ren, Chun-Mei Feng, Hengshuang Zhao, Shuguang Cui, Zhen Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2024, project website: https://curryyuan.github.io/ZSVG3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.05997 2024-03-26 cs.CV 79%

Exploiting Auxiliary Caption for Video Grounding

Hongxiang Li, Meng Cao, Xuxin Cheng, Zhihong Zhu, Yaowei Li, Yuexian Zou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10103 2024-03-22 cs.CV 79%

GSVA: Generalized Segmentation via Multimodal Large Language Models

Zhuofan Xia, Dongchen Han, Yizeng Han, Xuran Pan, Shiji Song, Gao Huang

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by CVPR2024 (19 pages, 9 figures, 11 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10159 2024-03-22 cs.CV 79%

Vision-Language Models can Identify Distracted Driver Behavior from Naturalistic Videos

Md Zahid Hasan, Jiajing Chen, Jiyang Wang, Mohammed Shaiqur Rahman, Ameya Joshi, Senem Velipasalar, Chinmay Hegde, Anuj Sharma, Soumik Sarkar

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08182 2024-03-14 cs.CV 79%

SeCG: Semantic-Enhanced 3D Visual Grounding via Cross-modal Graph Attention

Feng Xiao, Hongbin Xu, Qiuxia Wu, Wenxiong Kang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07407 2024-03-13 cs.CV 79%

In-context learning enables multimodal large language models to classify cancer pathology images

Dyke Ferber, Georg Wölflein, Isabella C. Wiest, Marta Ligero, Srividhya Sainath, Narmin Ghaffari Laleh, Omar S. M. El Nahhas, Gustav Müller-Franzes, Dirk Jäger, Daniel Truhn, Jakob Nikolas Kather

专题命中 视觉定位与Grounding :multimodal large language model(title);vision language model(abstract);分类 cs.CV

Comments 40 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01091 2024-03-12 cs.CV 79%

Enriching Phrases with Coupled Pixel and Object Contexts for Panoptic Narrative Grounding

Tianrui Hui, Zihan Ding, Junshi Huang, Xiaoming Wei, Xiaolin Wei, Jiao Dai, Jizhong Han, Si Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by IJCAI 2023. Since the PNG benchmark adopts a different data partition manner from ours, we update the experimental results on the things/stuff/singulars/plurals subsets based on the PNG's code

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06071 2024-03-06 cs.CV cs.CL 79%

GroundingGPT:Language Enhanced Multi-modal Grounding Model

Zhaowei Li, Qi Xu, Dong Zhang, Hang Song, Yiqing Cai, Qi Qi, Ran Zhou, Junting Pan, Zefeng Li, Van Tu Vu, Zhida Huang, Tao Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19116 2024-03-05 cs.CL cs.AI 79%

How to Understand "Support"? An Implicit-enhanced Causal Inference Approach for Weakly-supervised Phrase Grounding

Jiamin Luo, Jianing Zhao, Jingjing Wang, Guodong Zhou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11265 2024-02-29 cs.CV 79%

End-to-End Dense Video Grounding via Parallel Regression

Fengyuan Shi, Weilin Huang, Limin Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by Computer Vision and Image Understanding (CVIU) in February 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10221 2024-02-26 cs.RO cs.CV 79%

RoboLLM: Robotic Vision Tasks Grounded on Multimodal Large Language Models

Zijun Long, George Killick, Richard McCreadie, Gerardo Aragon Camarasa

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13290 2024-02-22 cs.AI 79%

Grounding from an AI and Cognitive Science Lens

Goonmeet Bajaj, Srinivasan Parthasarathy, Valerie L. Shalin, Amit Sheth

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Journal ref IEEE Intelligent Systems, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12927 2024-02-21 cs.CV 79%

CLIPping the Deception: Adapting Vision-Language Models for Universal Deepfake Detection

Sohail Ahmed Khan, Duc-Tien Dang-Nguyen

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10992 2024-02-20 cs.CL cs.AI 79%

"Understanding AI": Semantic Grounding in Large Language Models

Holger Lyre

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08345 2024-02-20 cs.CV 79%

Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long Videos

Yulin Pan, Xiangteng He, Biao Gong, Yiliang Lv, Yujun Shen, Yuxin Peng, Deli Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 11 pages, 8 figures

Journal ref 2023 IEEE/CVF International Conference on Computer Vision (ICCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09760 2024-02-16 cs.CL cs.AI cs.IR 79%

Grounding Language Model with Chunking-Free In-Context Retrieval

Hongjin Qian, Zheng Liu, Kelong Mao, Yujia Zhou, Zhicheng Dou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07342 2024-02-13 cs.HC cs.AI 79%

Imagining a Future of Designing with AI: Dynamic Grounding, Constructive Negotiation, and Sustainable Motivation

Priyan Vaithilingam, Ian Arawjo, Elena L. Glassman

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13876 2024-02-08 cs.CV 79%

Cross3DVG: Cross-Dataset 3D Visual Grounding on Different RGB-D Scans

Taiki Miyanishi, Daichi Azuma, Shuhei Kurita, Motoki Kawanabe

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 3DV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14277 2024-01-10 cs.CV 79%

G2L: Semantically Aligned and Uniform Video Grounding via Geodesic and Game Theory

Hongxiang Li, Meng Cao, Xuxin Cheng, Yaowei Li, Zhihong Zhu, Yuexian Zou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV2023 oral, release the code

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.11092 2024-01-09 cs.RO cs.AI 79%

INVIGORATE: Interactive Visual Grounding and Grasping in Clutter

Hanbo Zhang, Yunfan Lu, Cunjun Yu, David Hsu, Xuguang Lan, Nanning Zheng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 12 pages, full version

详情

展开后加载摘要…

URL PDF HTML 收藏