arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2303.14644 2023-03-28 cs.CV 79%

Affordance Grounding from Demonstration Video to Target Image

Joya Chen, Difei Gao, Kevin Qinghong Lin, Mike Zheng Shou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13186 2023-03-24 cs.CV 79%

ScanERU: Interactive 3D Visual Grounding based on Embodied Reference Understanding

Ziyang Lu, Yunqiang Pei, Guoqing Wang, Yang Yang, Zheng Wang, Heng Tao Shen

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12027 2023-03-22 cs.CV 79%

Joint Visual Grounding and Tracking with Natural Language Specification

Li Zhou, Zikun Zhou, Kaige Mao, Zhenyu He

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08063 2023-03-21 cs.CV 79%

MINOTAUR: Multi-task Video Grounding From Multimodal Queries

Raghav Goyal, Effrosyni Mavroudi, Xitong Yang, Sainbayar Sukhbaatar, Leonid Sigal, Matt Feiszli, Lorenzo Torresani, Du Tran

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 22 pages, 8 figures and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09665 2023-03-20 cs.CV 79%

LOCATE: Localize and Transfer Object Parts for Weakly Supervised Affordance Grounding

Gen Li, Varun Jampani, Deqing Sun, Laura Sevilla-Lara

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR 2023, Project page: https://reagan1311.github.io/locate/, Video: https://www.youtube.com/watch?v=RLHansdFxII

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07748 2023-03-15 cs.CV cs.MM 79%

Generation-Guided Multi-Level Unified Network for Video Grounding

Xing Cheng, Xiangyu Wu, Dong Shen, Hezheng Lin, Fan Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07618 2023-03-15 cs.CV 79%

Medical Phrase Grounding with Region-Phrase Context Contrastive Alignment

Zhihao Chen, Yang Zhou, Anh Tran, Junting Zhao, Liang Wan, Gideon Ooi, Lionel Cheng, Choon Hua Thng, Xinxing Xu, Yong Liu, Huazhu Fu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06545 2023-03-14 cs.CV 79%

Towards Diverse Temporal Grounding under Single Positive Labels

Hao Zhou, Chongyang Zhang, Yanjun Chen, Chuanping Hu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments The source codes are available at https://github.com/zhouhaocv/DTG-SPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15639 2023-02-27 cs.CV 79%

F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models

Weicheng Kuo, Yin Cui, Xiuye Gu, AJ Piergiovanni, Anelia Angelova

专题命中 视觉定位与Grounding :VLM(title,abstract);分类 cs.CV

Comments Accepted to ICLR 2023 (https://iclr.cc/Conferences/2023). 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11252 2023-02-23 cs.CV 79%

Focusing On Targets For Improving Weakly Supervised Visual Grounding

Viet-Quoc Pham, Nao Mishima

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments accepted by ICASSP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10813 2023-02-22 cs.CV 79%

Tracking Objects and Activities with Attention for Temporal Sentence Grounding

Zeyu Xiong, Daizong Liu, Pan Zhou, Jiahao Zhu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments accepted by ICASSP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09850 2023-02-21 cs.CV 79%

Constraint and Union for Partially-Supervised Temporal Sentence Grounding

Chen Ju, Haicheng Wang, Jinxiang Liu, Chaofan Ma, Ya Zhang, Peisen Zhao, Jianlong Chang, Qi Tian

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.02219 2023-02-15 cs.CV 79%

Understanding and Mitigating Overfitting in Prompt Tuning for Vision-Language Models

Chengcheng Ma, Yang Liu, Jiankang Deng, Lingxi Xie, Weiming Dong, Changsheng Xu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.11100 2023-01-27 cs.CV cs.CY cs.HC 79%

Vision-Language Models Performing Zero-Shot Tasks Exhibit Gender-based Disparities

Melissa Hall, Laura Gustafson, Aaron Adcock, Ishan Misra, Candace Ross

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03160 2023-01-10 cs.CV 79%

Towards Real-Time Panoptic Narrative Grounding by an End-to-End Grounding Network

Haowei Wang, Jiayi Ji, Yiyi Zhou, Yongjian Wu, Xiaoshuai Sun

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 9 pages, 5 figures, accepted by AAAI23

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.02401 2023-01-09 cs.CL cs.AI 79%

You Truly Understand What I Need: Intellectual and Friendly Dialogue Agents grounding Knowledge and Persona

Jungwoo Lim, Myunghoon Kang, Yuna Hur, Seungwon Jung, Jinsung Kim, Yoonna Jang, Dongyub Lee, Hyesung Ji, Donghoon Shin, Seungryong Kim, Heuiseok Lim

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments Accepted at Findings of EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00514 2023-01-03 cs.CV 79%

Rethinking the Video Sampling and Reasoning Strategies for Temporal Sentence Grounding

Jiahao Zhu, Daizong Liu, Pan Zhou, Xing Di, Yu Cheng, Song Yang, Wenzheng Xu, Zichuan Xu, Yao Wan, Lichao Sun, Zeyu Xiong

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by EMNLP Findings, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.14757 2023-01-02 cs.CV 79%

A Simple Baseline for Open-Vocabulary Semantic Segmentation with Pre-trained Vision-language Model

Mengde Xu, Zheng Zhang, Fangyun Wei, Yutong Lin, Yue Cao, Han Hu, Xiang Bai

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13163 2022-12-29 cs.CV 79%

MRTNet: Multi-Resolution Temporal Network for Video Sentence Grounding

Wei Ji, Long Chen, Yinwei Wei, Yiming Wu, Tat-Seng Chua

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00836 2022-12-05 cs.CV 79%

UniT3D: A Unified Transformer for 3D Dense Captioning and Visual Grounding

Dave Zhenyu Chen, Ronghang Hu, Xinlei Chen, Matthias Nießner, Angel X. Chang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12006 2022-12-02 cs.AI 79%

Differentiable Fuzzy $\mathcal{ALC}$: A Neural-Symbolic Representation Language for Symbol Grounding

Xuan Wu, Xinhao Zhu, Yizheng Zhao, Xinyu Dai

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13306 2022-12-02 cs.CV 79%

Embracing Consistency: A One-Stage Approach for Spatio-Temporal Video Grounding

Yang Jin, Yongzhi Li, Zehuan Yuan, Yadong Mu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 18 pages, 7 figures, Accepted by Neurips 2022, Spotlight Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15516 2022-12-01 cs.CV 79%

DQ-DETR: Dual Query Detection Transformer for Phrase Extraction and Grounding

Shilong Liu, Yaoyuan Liang, Feng Li, Shijia Huang, Hao Zhang, Hang Su, Jun Zhu, Lei Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15521 2022-11-29 cs.CV cs.CL 79%

G^3: Geolocation via Guidebook Grounding

Grace Luo, Giscard Biamby, Trevor Darrell, Daniel Fried, Anna Rohrbach

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Findings of EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.16265 2022-11-29 cs.CV 79%

SeqTR: A Simple yet Universal Network for Visual Grounding

Chaoyang Zhu, Yiyi Zhou, Yunhang Shen, Gen Luo, Xingjia Pan, Mingbao Lin, Chao Chen, Liujuan Cao, Xiaoshuai Sun, Rongrong Ji

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 21 pages, 8 figures

Journal ref European Conference on Computer Vision, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14241 2022-11-28 cs.CV 79%

Look Around and Refer: 2D Synthetic Semantics Knowledge Distillation for 3D Visual Grounding

Eslam Mohamed Bakr, Yasmeen Alsaedy, Mohamed Elhoseiny

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Journal ref NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11492 2022-11-22 cs.CV 79%

ClipCrop: Conditioned Cropping Driven by Vision-Language Model

Zhihang Zhong, Mingxi Cheng, Zhirong Wu, Yuhui Yuan, Yinqiang Zheng, Ji Li, Han Hu, Stephen Lin, Yoichi Sato, Imari Sato

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09646 2022-11-18 cs.CV 79%

Language Conditioned Spatial Relation Reasoning for 3D Object Grounding

Shizhe Chen, Pierre-Louis Guhur, Makarand Tapaswi, Cordelia Schmid, Ivan Laptev

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted in NeurIPS 2022; Project website: https://cshizhe.github.io/projects/vil3dref.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.07912 2022-11-16 cs.CV 79%

YORO -- Lightweight End to End Visual Grounding

Chih-Hui Ho, Srikar Appalaraju, Bhavan Jasani, R. Manmatha, Nuno Vasconcelos

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to ECCVW on International Challenge on Compositional and Multimodal Perception

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.01901 2022-11-15 cs.CV cs.CL 79%

Incremental Object Grounding Using Scene Graphs

John Seon Keun Yi, Yoonwoo Kim, Sonia Chernova

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏