arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2109.04988 2021-09-13 cs.CV 79%

Panoptic Narrative Grounding

C. González, N. Ayobi, I. Hernández, J. Hernández, J. Pont-Tuset, P. Arbeláez

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 10 pages, 6 figures, to appear at ICCV 2021 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.10576 2021-08-25 cs.CV 79%

Support-Set Based Cross-Supervision for Video Grounding

Xinpeng Ding, Nannan Wang, Shiwei Zhang, De Cheng, Xiaomeng Li, Ziyuan Huang, Mingqian Tang, Xinbo Gao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.10132 2021-08-17 cs.CV cs.CL 79%

VLG-Net: Video-Language Graph Matching Network for Video Grounding

Mattia Soldan, Mengmeng Xu, Sisi Qu, Jesper Tegner, Bernard Ghanem

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 14 pages, 7 figures, In proceeding of the ICCV21 workshop: AI for Creative Video Editing and Understanding 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.05675 2021-08-13 cs.CV 79%

Learning Visual Affordance Grounding from Demonstration Videos

Hongchen Luo, Wei Zhai, Jing Zhang, Yang Cao, Dacheng Tao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.01128 2021-07-30 cs.CV 79%

InstanceRefer: Cooperative Holistic Understanding for Visual Grounding on Point Clouds through Instance Multi-level Contextual Referring

Zhihao Yuan, Xu Yan, Yinghong Liao, Ruimao Zhang, Sheng Wang, Zhen Li, Shuguang Cui

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments To appear in ICCV 2021. Codes are released in https://github.com/CurryYuan/InstanceRefer

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.11013 2021-07-08 cs.CV cs.CL 79%

Interventional Video Grounding with Dual Contrastive Learning

Guoshun Nan, Rui Qiao, Yao Xiao, Jun Liu, Sicong Leng, Hao Zhang, Wei Lu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted in CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.16136 2021-07-01 cs.CV 79%

Weakly Supervised Temporal Adjacent Network for Language Grounding

Yuechen Wang, Jiajun Deng, Wengang Zhou, Houqiang Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Multimedia, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.04053 2021-06-09 cs.CV cs.MM 79%

Discriminative Triad Matching and Reconstruction for Weakly Referring Expression Grounding

Mingjie Sun, Jimin Xiao, Eng Gee Lim, Si Liu, John Y. Goulermas

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.09829 2021-04-21 cs.CV 79%

Detector-Free Weakly Supervised Grounding by Separation

Assaf Arbelle, Sivan Doveh, Amit Alfassy, Joseph Shtok, Guy Lev, Eli Schwartz, Hilde Kuehne, Hila Barak Levi, Prasanna Sattigeri, Rameswar Panda, Chun-Fu Chen, Alex Bronstein, Kate Saenko, Shimon Ullman, Raja Giryes, Rogerio Feris, Leonid Karlinsky

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.07679 2021-04-15 cs.CL cs.CV 79%

OCID-Ref: A 3D Robotic Dataset with Embodied Language for Clutter Scene Grounding

Ke-Jyun Wang, Yun-Hsuan Liu, Hung-Ting Su, Jen-Wei Wang, Yu-Siang Wang, Winston H. Hsu, Wen-Chin Chen

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments NAACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.06008 2021-04-14 cs.CV cs.CL 79%

Disentangled Motif-aware Graph Learning for Phrase Grounding

Zongshen Mu, Siliang Tang, Jie Tan, Qiang Yu, Yueting Zhuang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 10 pages, 6 figures, AAAI 2021 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.04386 2021-04-12 cs.CV 79%

Look Before You Leap: Learning Landmark Features for One-Stage Visual Grounding

Binbin Huang, Dongze Lian, Weixin Luo, Shenghua Gao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Code is available at https://github.com/svip-lab/LBYLNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.02866 2021-04-08 cs.CV 79%

Deep Transformers for Fast Small Intestine Grounding in Capsule Endoscope Video

Xinkai Zhao, Chaowei Fang, Feng Gao, De-Jun Fan, Xutao Lin, Guanbin Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.02026 2021-04-06 cs.CV cs.MM cs.SD eess.AS 79%

Cyclic Co-Learning of Sounding Object Visual Grounding and Sound Separation

Yapeng Tian, Di Hu, Chenliang Xu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.16057 2021-04-06 cs.CL cs.LG 79%

Grounding Open-Domain Instructions to Automate Web Support Tasks

Nancy Xu, Sam Masling, Michael Du, Giovanni Campagna, Larry Heck, James Landay, Monica S Lam

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

Comments To be published in NAACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.16381 2021-03-31 cs.CV 79%

Free-form Description Guided 3D Visual Graph Network for Object Grounding in Point Cloud

Mingtao Feng, Zhen Li, Qi Li, Liang Zhang, XiangDong Zhang, Guangming Zhu, Hui Zhang, Yaonan Wang, Ajmal Mian

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.12989 2021-03-25 cs.CV 79%

Relation-aware Instance Refinement for Weakly Supervised Visual Grounding

Yongfei Liu, Bo Wan, Lin Ma, Xuming He

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.12944 2021-03-25 cs.CV 79%

Scene-Intuitive Agent for Remote Embodied Visual Grounding

Xiangru Lin, Guanbin Li, Yizhou Yu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.11555 2021-03-23 cs.CV 79%

Context-aware Biaffine Localizing Network for Temporal Sentence Grounding

Daizong Liu, Xiaoye Qu, Jianfeng Dong, Pan Zhou, Yu Cheng, Wei Wei, Zichuan Xu, Yulai Xie

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.10191 2021-03-19 cs.CV 79%

Decoupled Spatial Temporal Graphs for Generic Visual Grounding

Qianyu Feng, Yunchao Wei, Mingming Cheng, Yi Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.07894 2021-03-18 cs.CV 79%

Refer-it-in-RGBD: A Bottom-up Approach for 3D Visual Grounding in RGBD Images

Haolin Liu, Anran Lin, Xiaoguang Han, Lei Yang, Yizhou Yu, Shuguang Cui

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR 2021, project page: https://unclemedm.github.io/Refer-it-in-RGBD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.05187 2021-03-10 cs.CV 79%

Iterative Shrinking for Referring Expression Grounding Using Deep Reinforcement Learning

Mingjie Sun, Jimin Xiao, Eng Gee Lim

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.09486 2020-12-18 cs.CL cs.LG 79%

ReferentialGym: A Nomenclature and Framework for Language Emergence & Grounding in (Visual) Referential Games

Kevin Denamganaï, James Alfred Walker

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

Comments Accepted at 4th NeurIPS Workshop on Emergent Communication (EmeCom @ NeurIPS 2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.01634 2020-12-04 cs.CV 79%

Rel3D: A Minimally Contrastive Benchmark for Grounding Spatial Relations in 3D

Ankit Goyal, Kaiyu Yang, Dawei Yang, Jia Deng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted to NeurIPS 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.06316 2020-11-17 cs.CV 79%

Grounding-Tracking-Integration

Zhengyuan Yang, Tushar Kumar, Tianlang Chen, Jinsong Su, Jiebo Luo

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.02655 2020-11-06 cs.CV 79%

Utilizing Every Image Object for Semi-supervised Phrase Grounding

Haidong Zhu, Arka Sadhu, Zhaoheng Zheng, Ram Nevatia

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.16363 2020-11-02 cs.CL cs.CV 79%

Domain-Specific Lexical Grounding in Noisy Visual-Textual Documents

Gregory Yauney, Jack Hessel, David Mimno

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Journal ref Published in EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.13546 2020-10-19 cs.NE cs.CL cs.LG 79%

Crossmodal Language Grounding in an Embodied Neurocognitive Model

Stefan Heinrich, Yuan Yao, Tobias Hinz, Zhiyuan Liu, Thomas Hummel, Matthias Kerzel, Cornelius Weber, Stefan Wermter

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

Journal ref Frontiers in Neurorobotics, vol 14(52), 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.14338 2020-10-19 cs.CL cs.CV 79%

Beyond Instructional Videos: Probing for More Diverse Visual-Textual Grounding on YouTube

Jack Hessel, Zhenhai Zhu, Bo Pang, Radu Soricut

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 11 pages including supplementary materials

Journal ref Published in EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.04372 2020-10-12 cs.CL cs.AI 79%

Pragmatically Informative Color Generation by Grounding Contextual Modifiers

Zhengxuan Wu, Desmond C. Ong

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏