arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2404.00603 2024-04-02 cs.CV 57%

Weak Distribution Detectors Lead to Stronger Generalizability of Vision-Language Prompt Tuning

Kun Ding, Haojian Zhang, Qiang Yu, Ying Wang, Shiming Xiang, Chunhong Pan

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00246 2024-04-02 cs.CL cs.AI cs.HC 57%

Your Co-Workers Matter: Evaluating Collaborative Capabilities of Language Models in Blocks World

Guande Wu, Chen Zhao, Claudio Silva, He He

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08653 2024-04-02 cs.CV 57%

SKDF: A Simple Knowledge Distillation Framework for Distilling Open-Vocabulary Knowledge to Open-world Object Detector

Shuailei Ma, Yuefeng Wang, Ying Wei, Jiaqi Fan, Enming Zhang, Xinyu Sun, Peihao Chen

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2303.11623

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19975 2024-04-01 cs.CV 57%

Context-Aware Integration of Language and Visual References for Natural Language Tracking

Yanyan Shao, Shuting He, Qi Ye, Yuchao Feng, Wenhan Luo, Jiming Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19880 2024-04-01 eess.IV cs.CV 57%

Vision-Language Synthetic Data Enhances Echocardiography Downstream Tasks

Pooria Ashrafian, Milad Yazdani, Moein Heidari, Dena Shahriari, Ilker Hacihaliloglu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Submitted as a conference paper to MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19113 2024-03-29 cs.CL cs.AI 57%

FACTOID: FACtual enTailment fOr hallucInation Detection

Vipula Rawte, S. M Towhidul Islam Tonmoy, Krishnav Rajbangshi, Shravani Nag, Aman Chadha, Amit P. Sheth, Amitava Das

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18036 2024-03-28 cs.CV 57%

Move as You Say, Interact as You Can: Language-guided Human Motion Generation with Scene Affordance

Zan Wang, Yixin Chen, Baoxiong Jia, Puhao Li, Jinlu Zhang, Jingze Zhang, Tengyu Liu, Yixin Zhu, Wei Liang, Siyuan Huang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments CVPR 2024; 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17007 2024-03-26 cs.CV 57%

DreamLIP: Language-Image Pre-training with Long Captions

Kecheng Zheng, Yifei Zhang, Wei Wu, Fan Lu, Shuailei Ma, Xin Jin, Wei Chen, Yujun Shen

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11557 2024-03-26 cs.CV 57%

SAI3D: Segment Any Instance in 3D Scenes

Yingda Yin, Yuzheng Liu, Yang Xiao, Daniel Cohen-Or, Jingwei Huang, Baoquan Chen

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14056 2024-03-22 cs.CV cs.RO 57%

Semantics from Space: Satellite-Guided Thermal Semantic Segmentation Annotation for Aerial Field Robots

Connor Lee, Saraswati Soedarmadji, Matthew Anderson, Anthony J. Clark, Soon-Jo Chung

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08007 2024-03-22 cs.CV 57%

Unveiling Parts Beyond Objects:Towards Finer-Granularity Referring Expression Segmentation

Wenxuan Wang, Tongtian Yue, Yisi Zhang, Longteng Guo, Xingjian He, Xinlong Wang, Jing Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments This work is accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05381 2024-03-11 cs.CV 57%

Exploring Robust Features for Few-Shot Object Detection in Satellite Imagery

Xavier Bou, Gabriele Facciolo, Rafael Grompone von Gioi, Jean-Michel Morel, Thibaud Ehret

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04593 2024-03-08 cs.CV 57%

Embodied Understanding of Driving Scenarios

Yunsong Zhou, Linyan Huang, Qingwen Bu, Jia Zeng, Tianyu Li, Hang Qiu, Hongzi Zhu, Minyi Guo, Yu Qiao, Hongyang Li

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 43 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04292 2024-03-08 cs.AI 57%

A challenge in A(G)I, cybernetics revived in the Ouroboros Model as one algorithm for all thinking

Knud Thomsen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 26 pages, 11 figures

Journal ref Artificial Intelligence and Autonomous Systems Volume 1 Issue 1, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00453 2024-03-05 cs.CV 57%

CLIP-AD: A Language-Guided Staged Dual-Path Model for Zero-shot Anomaly Detection

Xuhai Chen, Jiangning Zhang, Guanzhong Tian, Haoyang He, Wuhao Zhang, Yabiao Wang, Chengjie Wang, Yong Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07490 2024-03-05 cs.CV 57%

Top-Down Framework for Weakly-supervised Grounded Image Captioning

Chen Cai, Suchen Wang, Kim-hui Yap, Yi Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11325 2024-02-28 cs.CV 57%

ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation Models

Zhenghang Yuan, Zhitong Xiong, Lichao Mou, Xiao Xiang Zhu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15537 2024-02-28 cs.CV 57%

SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic Segmentation

Bin Xie, Jiale Cao, Jin Xie, Fahad Shahbaz Khan, Yanwei Pang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13252 2024-02-28 cs.CL cs.AI 57%

"According to ...": Prompting Language Models Improves Quoting from Pre-Training Data

Orion Weller, Marc Marone, Nathaniel Weir, Dawn Lawrie, Daniel Khashabi, Benjamin Van Durme

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted to EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11157 2024-02-27 cs.SI cs.AI cs.IR 57%

Contextualizing Internet Memes Across Social Media Platforms

Saurav Joshi, Filip Ilievski, Luca Luceri

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.05946 2024-02-27 cs.CV cs.CL 57%

OmDet: Large-scale vision-language multi-dataset pre-training with multimodal detection network

Tiancheng Zhao, Peng Liu, Kyusong Lee

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Published at IET CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15360 2024-02-26 q-bio.QM cs.LG cs.SD eess.AS 57%

All Thresholds Barred: Direct Estimation of Call Density in Bioacoustic Data

Amanda K. Navine, Tom Denton, Matthew J. Weldy, Patrick J. Hart

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments 14 pages, 6 figures, 3 tables; submitted to Frontiers in Bird Science; Our Hawaiian PAM dataset and classifier scores, as well as annotation information for the three study species, can be found on Zenodo at https://doi.org/10.5281/zenodo.10581530. The fully annotated Powdermill dataset assembled by Chronister et al. that was used in this study is available at https://doi.org/10.1002/ecy.3329

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17270 2024-02-23 cs.CV 57%

YOLO-World: Real-Time Open-Vocabulary Object Detection

Tianheng Cheng, Lin Song, Yixiao Ge, Wenyu Liu, Xinggang Wang, Ying Shan

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Work still in progress. Code & models are available at: https://github.com/AILab-CVC/YOLO-World

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09312 2024-02-23 cs.CL cs.LG cs.MM cs.SI 57%

Multi-Modal Discussion Transformer: Integrating Text, Images and Graph Transformers to Detect Hate Speech on Social Media

Liam Hebert, Gaurav Sahu, Yuxuan Guo, Nanda Kishore Sreenivas, Lukasz Golab, Robin Cohen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments Accepted to AAAI 2024 (AI for Social Impact Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02296 2024-02-22 cs.CV 57%

CLIP Is Also a Good Teacher: A New Learning Framework for Inductive Zero-shot Semantic Segmentation

Jialei Chen, Daisuke Deguchi, Chenkai Zhang, Xu Zheng, Hiroshi Murase

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08968 2024-02-15 cs.AI 57%

GrounDial: Human-norm Grounded Safe Dialog Response Generation

Siwon Kim, Shuyang Dai, Mohammad Kachuee, Shayan Ray, Tara Taghavi, Sungroh Yoon

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted to findings of EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07566 2024-02-13 cs.CL cs.CV 57%

VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena

Letitia Parcalabescu, Michele Cafagna, Lilitta Muradjan, Anette Frank, Iacer Calixto, Albert Gatt

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Paper accepted for publication at ACL 2022 Main; 28 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17699 2024-02-01 cs.CV 57%

Unified Physical-Digital Face Attack Detection

Hao Fang, Ajian Liu, Haocheng Yuan, Junze Zheng, Dingheng Zeng, Yanhong Liu, Jiankang Deng, Sergio Escalera, Xiaoming Liu, Jun Wan, Zhen Lei

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08775 2024-02-01 cs.AI 57%

GEAR: Augmenting Language Models with Generalizable and Efficient Tool Resolution

Yining Lu, Haoping Yu, Daniel Khashabi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00162 2024-02-01 cs.CL cs.LG eess.AS 57%

What Do Self-Supervised Speech Models Know About Words?

Ankita Pasad, Chung-Ming Chien, Shane Settle, Karen Livescu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments Pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏