arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2409.08251 2024-09-13 cs.CV 79%

Dynamic Prompting of Frozen Text-to-Image Diffusion Models for Panoptic Narrative Grounding

Hongyu Li, Tianrui Hui, Zihan Ding, Jing Zhang, Bin Ma, Xiaoming Wei, Jizhong Han, Si Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14206 2024-09-13 cs.CV 79%

LLM4VG: Large Language Models Evaluation for Video Grounding

Wei Feng, Xin Wang, Hong Chen, Zeyang Zhang, Houlun Chen, Zihan Song, Yuwei Zhou, Yuekui Yang, Haiyang Wu, Wenwu Zhu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04999 2024-09-10 cs.CV cs.MM 79%

Visual Grounding with Multi-modal Conditional Adaptation

Ruilin Yao, Shengwu Xiong, Yichen Zhao, Yi Rong

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2024 [Oral]

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09012 2024-09-10 cs.CV 79%

FashionLOGO: Prompting Multimodal Large Language Models for Fashion Logo Embeddings

Zhen Wang, Da Li, Yulin Su, Min Yang, Minghui Qiu, Walton Wang

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16341 2024-09-10 cs.CV 79%

Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding

Yuanhao Xiong, Long Zhao, Boqing Gong, Ming-Hsuan Yang, Florian Schroff, Ting Liu, Cho-Jui Hsieh, Liangzhe Yuan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to ICLR2024, see https://openreview.net/forum?id=5dlfiJIXoh for more details

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13400 2024-09-06 cs.CV 79%

HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding

Linhui Xiao, Xiaoshan Yang, Fang Peng, Yaowei Wang, Changsheng Xu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2024. The project page: https://github.com/linhuixiao/HiVG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03109 2024-09-06 cs.CV cs.CR 79%

FIDAVL: Fake Image Detection and Attribution using Vision-Language Model

Mamadou Keita, Wassim Hamidouche, Hessen Bougueffa Eutamene, Abdelmalik Taleb-Ahmed, Abdenour Hadid

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14491 2024-09-04 cs.CV 79%

PD-APE: A Parallel Decoding Framework with Adaptive Position Encoding for 3D Visual Grounding

Chenshu Hou, Liang Peng, Xiaopei Wu, Xiaofei He, Wenxiao Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14154 2024-09-04 cs.CL cs.CV cs.CY 79%

MM-Soc: Benchmarking Multimodal Large Language Models in Social Media Platforms

Yiqiao Jin, Minje Choi, Gaurav Verma, Jindong Wang, Srijan Kumar

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments In Proceedings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00556 2024-09-04 cs.CV 79%

FADE: Few-shot/zero-shot Anomaly Detection Engine using Large Vision-Language Model

Yuanwei Li, Elizaveta Ivanova, Martins Bruveris

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments 13 pages, 2 figures, Accepted for BMVC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00238 2024-09-04 cs.CL cs.CV 79%

Pre-Training Multimodal Hallucination Detectors with Corrupted Grounding Data

Spencer Whitehead, Jacob Phillips, Sean Hendryx

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16314 2024-08-30 cs.CV 79%

ResVG: Enhancing Relation and Semantic Understanding in Multiple Instances for Visual Grounding

Minghang Zheng, Jiahua Zhang, Qingchao Chen, Yuxin Peng, Yang Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01024 2024-08-22 cs.AI 79%

Semantic Skill Grounding for Embodied Instruction-Following in Cross-Domain Environments

Sangwoo Shin, Seunghyun Kim, Youngsoo Jang, Moontae Lee, Honguk Woo

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments Findings of ACL-2024 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09605 2024-08-20 cs.AI 79%

Does Thought Require Sensory Grounding? From Pure Thinkers to Large Language Models

David J. Chalmers

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Journal ref Proceedings and Addresses of the American Philosophical Association, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01669 2024-08-20 cs.CV cs.MM 79%

SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses

Chaolei Tan, Zihang Lin, Junfu Pu, Zhongang Qi, Wei-Yi Pei, Zhi Qu, Yexin Wang, Ying Shan, Wei-Shi Zheng, Jian-Fang Hu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to ACM MM 2024. Project page: https://synopground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07975 2024-08-16 cs.RO cs.CL cs.CV 79%

Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models

Tianyu Wang, Haitao Lin, Junqiu Yu, Yanwei Fu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by IROS 2024. 8 pages, 5 figures. See https://star-uu-wang.github.io/Polaris/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04961 2024-08-12 cs.CV 79%

In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic Segmentation

Dahyun Kang, Minsu Cho

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04023 2024-08-09 cs.CL cs.AI 79%

Improving Large Language Model (LLM) fidelity through context-aware grounding: A systematic approach to reliability and veracity

Wrick Talukdar, Anjanava Biswas

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 14 pages

Journal ref World Journal of Advanced Engineering Technology and Sciences, 2023, 10(2), 283-296

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01120 2024-08-05 cs.CV 79%

An Efficient and Effective Transformer Decoder-Based Framework for Multi-Task Visual Grounding

Wei Chen, Long Chen, Yu Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 21pages, 10 figures, 9 tables. Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00932 2024-08-05 cs.CV cs.CL 79%

Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)

Bin Han, Yiwei Yang, Anat Caspi, Bill Howe

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11273 2024-07-31 cs.CV 79%

Chain of Visual Perception: Harnessing Multimodal Large Language Models for Zero-shot Camouflaged Object Detection

Lv Tang, Peng-Tao Jiang, Zhihao Shen, Hao Zhang, Jinwei Chen, Bo Li

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by ACMMM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18391 2024-07-29 cs.CV 79%

UOUO: Uncontextualized Uncommon Objects for Measuring Knowledge Horizons of Vision Language Models

Xinyu Pi, Mingyuan Wu, Jize Jiang, Haozhen Zheng, Beitong Tian, Chengxiang Zhai, Klara Nahrstedt, Zhiting Hu

专题命中 视觉定位与Grounding :vision language model(title);grounding(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17035 2024-07-25 cs.CV 79%

Q-Ground: Image Quality Grounding with Large Multi-modality Models

Chaofeng Chen, Sensen Yang, Haoning Wu, Liang Liao, Zicheng Zhang, Annan Wang, Wenxiu Sun, Qiong Yan, Weisi Lin

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ACM Multimedia 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15728 2024-07-25 eess.IV cs.CV 79%

SAM2CLIP2SAM: Vision Language Model for Segmentation of 3D CT Scans for Covid-19 Detection

Dimitrios Kollias, Anastasios Arsenos, James Wingate, Stefanos Kollias

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03725 2024-07-25 cs.CV 79%

Efficient Temporal Sentence Grounding in Videos with Multi-Teacher Knowledge Distillation

Renjie Liang, Yiming Yang, Hui Lu, Li Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15046 2024-07-23 cs.CV cs.CL cs.MM 79%

Audio-visual training for improved grounding in video-text LLMs

Shivprasad Sagare, Hemachandran S, Kinshuk Sarabhai, Prashant Ullegaddi, Rajeshkumar SA

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05785 2024-07-23 cs.CV 79%

A Survey on Text-guided 3D Visual Grounding: Elements, Recent Advances, and Future Directions

Daizong Liu, Yang Liu, Wencan Huang, Wei Hu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00801 2024-07-23 cs.CV 79%

$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding

Ye Liu, Jixuan He, Wanhua Li, Junsik Kim, Donglai Wei, Hanspeter Pfister, Chang Wen Chen

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ECCV 2024 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14055 2024-07-23 cs.CV 79%

Multi-Sentence Grounding for Long-term Instructional Video

Zeqian Li, Qirui Chen, Tengda Han, Ya Zhang, Yanfeng Wang, Weidi Xie

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13589 2024-07-22 cs.CV 79%

ReGround: Improving Textual and Spatial Grounding at No Cost

Phillip Y. Lee, Minhyuk Sung

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to ECCV 2024. Project page: https://re-ground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏