arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2210.13942 2022-10-26 cs.LG cs.CL cs.MA 79%

Entity Divider with Language Grounding in Multi-Agent Reinforcement Learning

Ziluo Ding, Wanpeng Zhang, Junpeng Yue, Xiangjun Wang, Tiejun Huang, Zongqing Lu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12977 2022-10-25 cs.CV 79%

Language-free Training for Zero-shot Video Grounding

Dahye Kim, Jungin Park, Jiyoung Lee, Seongheon Park, Kwanghoon Sohn

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to WACV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12658 2022-10-25 cs.CL cs.CV 79%

Extending Phrase Grounding with Pronouns in Visual Dialogues

Panzhong Lu, Xin Zhang, Meishan Zhang, Min Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06354 2022-10-13 cs.CL cs.AI cs.SD eess.AS 79%

Text-to-Audio Grounding Based Novel Metric for Evaluating Audio Caption Similarity

Swapnil Bhosale, Rupayan Chakraborty, Sunil Kumar Kopparapu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 9 pages, 8 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.00277 2022-09-02 cs.CV cs.CL cs.SD eess.AS 79%

Video-Guided Curriculum Learning for Spoken Video Grounding

Yan Xia, Zhou Zhao, Shangwei Ye, Yang Zhao, Haoyuan Li, Yi Ren

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.01691 2022-08-17 cs.RO cs.CL cs.LG 79%

Do As I Can, Not As I Say: Grounding Language in Robotic Affordances

Michael Ahn, Anthony Brohan, Noah Brown, Yevgen Chebotar, Omar Cortes, Byron David, Chelsea Finn, Chuyuan Fu, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Daniel Ho, Jasmine Hsu, Julian Ibarz, Brian Ichter, Alex Irpan, Eric Jang, Rosario Jauregui Ruano, Kyle Jeffrey, Sally Jesmonth, Nikhil J Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Kuang-Huei Lee, Sergey Levine, Yao Lu, Linda Luu, Carolina Parada, Peter Pastor, Jornell Quiambao, Kanishka Rao, Jarek Rettinghouse, Diego Reyes, Pierre Sermanet, Nicolas Sievers, Clayton Tan, Alexander Toshev, Vincent Vanhoucke, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Mengyuan Yan, Andy Zeng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

Comments See website at https://say-can.github.io/ V1. Initial Upload. V2. Added PaLM results. Added study about new capabilities (drawer manipulation, chain of thought prompting, multilingual instructions). Added an ablation study of language model size. Added an open-source version of \algname on a simulated tabletop environment. Improved readability

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05647 2022-08-12 cs.CV cs.MM 79%

PPMN: Pixel-Phrase Matching Network for One-Stage Panoptic Narrative Grounding

Zihan Ding, Zi-han Ding, Tianrui Hui, Junshi Huang, Xiaoming Wei, Xiaolin Wei, Si Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.14698 2022-08-08 cs.CV 79%

Can Shuffling Video Benefit Temporal Bias Problem: A Novel Training Framework for Temporal Grounding

Jiachang Hao, Haifeng Sun, Pengfei Ren, Jingyu Wang, Qi Qi, Jianxin Liao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ECCV2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.10168 2022-08-05 cs.CV 79%

Explore-And-Match: Bridging Proposal-Based and Proposal-Free With Transformer for Sentence Grounding in Videos

Sangmin Woo, Jinyoung Park, Inyong Koo, Sumin Lee, Minki Jeong, Changick Kim

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Code: https://github.com/sangminwoo/Explore-And-Match

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13457 2022-07-28 cs.CV 79%

Reducing the Vision and Language Bias for Temporal Sentence Grounding

Daizong Liu, Xiaoye Qu, Wei Hu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13325 2022-07-28 cs.CV 79%

SiRi: A Simple Selective Retraining Mechanism for Transformer-based Visual Grounding

Mengxue Qu, Yu Wu, Wu Liu, Qiqi Gong, Xiaodan Liang, Olga Russakovsky, Yao Zhao, Yunchao Wei

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 21 pages (including Supplementary Materials); Accepted to ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.04769 2022-07-26 cs.AI 79%

On the Foundations of Grounding in Answer Set Programming

Roland Kaminski, Torsten Schaub

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments unpublished draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.01551 2022-07-25 cs.CV 79%

D3Net: A Unified Speaker-Listener Architecture for 3D Dense Captioning and Visual Grounding

Dave Zhenyu Chen, Qirui Wu, Matthias Nießner, Angel X. Chang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Project website: https://daveredrum.github.io/D3Net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.08879 2022-07-22 cs.CV cs.CL 79%

Bottom Up Top Down Detection Transformers for Language Grounding in Images and Point Clouds

Ayush Jain, Nikolaos Gkanatsios, Ishita Mediratta, Katerina Fragkiadaki

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments First two authors contributed equally | ECCV 2022 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08386 2022-07-19 cs.CV 79%

Entity-enhanced Adaptive Reconstruction Network for Weakly Supervised Referring Expression Grounding

Xuejing Liu, Liang Li, Shuhui Wang, Zheng-Jun Zha, Zechao Li, Qi Tian, Qingming Huang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 17 pages, 10 figures, accepted by TPAMI. arXiv admin note: text overlap with arXiv:1908.10568

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02756 2022-07-07 cs.CV 79%

STVGFormer: Spatio-Temporal Video Grounding with Static-Dynamic Cross-Modal Understanding

Zihang Lin, Chaolei Tan, Jian-Fang Hu, Zhi Jin, Tiancai Ye, Wei-Shi Zheng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Technical report. The 1st place solution in the HC-STVG track of the 4th Person in Context Challenge(2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.00744 2022-07-05 cs.CV 79%

Gaussian Kernel-based Cross Modal Network for Spatio-Temporal Video Grounding

Zeyu Xiong, Daizong Liu, Pan Zhou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICIP2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09358 2022-06-28 cs.CV 79%

What is Where by Looking: Weakly-Supervised Open-World Phrase-Grounding without Text Inputs

Tal Shaharabany, Yoad Tewel, Lior Wolf

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08172 2022-06-17 cs.CV 79%

RefCrowd: Grounding the Target in Crowd with Referring Expressions

Heqian Qiu, Hongliang Li, Taijin Zhao, Lanxiao Wang, Qingbo Wu, Fanman Meng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.06619 2022-06-15 cs.CV 79%

TransVG++: End-to-End Visual Grounding with Language Conditioned Vision Transformer

Jiajun Deng, Zhengyuan Yang, Daqing Liu, Tianlang Chen, Wengang Zhou, Yanyong Zhang, Houqiang Li, Wanli Ouyang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2104.08541

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.00272 2022-06-09 cs.CV 79%

Improving Visual Grounding with Visual-Linguistic Verification and Iterative Reasoning

Li Yang, Yan Xu, Chunfeng Yuan, Wei Liu, Bing Li, Weiming Hu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.06686 2022-06-07 cs.CV 79%

Unpaired Referring Expression Grounding via Bidirectional Cross-Modal Matching

Hengcan Shi, Munawar Hayat, Jianfei Cai

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.08013 2022-05-24 cs.CV 79%

End-to-End Modeling via Information Tree for One-Shot Natural Language Spatial Video Grounding

Mengze Li, Tianbao Wang, Haoyu Zhang, Shengyu Zhang, Zhou Zhao, Jiaxu Miao, Wenqiao Zhang, Wenming Tan, Jin Wang, Peng Wang, Shiliang Pu, Fei Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.06919 2022-05-17 cs.HC cs.AI 79%

Grounding Explainability Within the Context of Global South in XAI

Deepa Singh, Michal Slupczynski, Ajit G. Pillai, Vinoth Pandian Sermuga Pandian

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 4 pages, Presented at CHI 2022 Workshop on Human-Centered Explainable AI (HCXAI): Beyond Opening the Black-Box of AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.08619 2022-05-17 cs.CL cs.AI 79%

Call for Customized Conversation: Customized Conversation Grounding Persona and Knowledge

Yoonna Jang, Jungwoo Lim, Yuna Hur, Dongsuk Oh, Suhyune Son, Yeonsoo Lee, Donghoon Shin, Seungryong Kim, Heuiseok Lim

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments Accepted paper at the Thirty-Sixth AAAI Conference on Artificial Intelligence (AAAI-22)

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.10634 2022-05-06 cs.CV 79%

Augmented 2D-TAN: A Two-stage Approach for Human-centric Spatio-Temporal Video Grounding

Chaolei Tan, Zihang Lin, Jian-Fang Hu, Xiang Li, Wei-Shi Zheng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Best Paper Award at the 3rd Person in Context (PIC) Challenge CVPR Workshop 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05499 2022-04-13 cs.CV 79%

Position-aware Location Regression Network for Temporal Video Grounding

Sunoh Kim, Kimin Yun, Jin Young Choi

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted in AVSS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.06085 2022-04-12 cs.CV cs.CL 79%

On Pursuit of Designing Multi-modal Transformer for Video Grounding

Meng Cao, Long Chen, Mike Zheng Shou, Can Zhang, Yuexian Zou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by Conference on Empirical Methods in Natural Language Processing (EMNLP 2021, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.04347 2022-04-12 cs.CL cs.AI 79%

On the Importance of Karaka Framework in Multi-modal Grounding

Sai Kiran Gorthi, Radhika Mamidi

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.02174 2022-04-06 cs.CV cs.CL 79%

Multi-View Transformer for 3D Visual Grounding

Shijia Huang, Yilun Chen, Jiaya Jia, Liwei Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments cvpr2022

详情

展开后加载摘要…

URL PDF HTML 收藏