arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2111.09452 2022-07-14 cs.CV 57%

Open Vocabulary Object Detection with Pseudo Bounding-Box Labels

Mingfei Gao, Chen Xing, Juan Carlos Niebles, Junnan Li, Ran Xu, Wenhao Liu, Caiming Xiong

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.14480 2022-06-30 cs.AI 57%

Representation and Synthesis of C++ Programs for Generalized Planning

Javier Segovia-Aguas, Yolanda E-Martín, Sergio Jiménez

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted at sixth workshop on Generalization in Planning at IJCAI-ECAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11953 2022-06-27 cs.CL cs.AI 57%

Do Trajectories Encode Verb Meaning?

Dylan Ebert, Chen Sun, Ellie Pavlick

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments NAACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.03027 2022-06-15 cs.RO cs.AI 57%

Learning Symbolic Operators: A Neurosymbolic Solution for Autonomous Disassembly of Electric Vehicle Battery

Yidong Du, Wenshuo Wang, Zhigang Wang, Hua Yang, Haitao Wang, Yinghao Cai, Ming Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07057 2022-06-10 cs.CV 57%

Self-Promoted Supervision for Few-Shot Transformer

Bowen Dong, Pan Zhou, Shuicheng Yan, Wangmeng Zuo

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Code is available at https://github.com/DongSky/few-shot-vit

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.08129 2022-06-06 cs.CV 57%

Animal Kingdom: A Large and Diverse Dataset for Animal Behavior Understanding

Xun Long Ng, Kian Eng Ong, Qichen Zheng, Yun Ni, Si Yong Yeo, Jun Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted by CVPR2022 (Oral). Dataset: https://sutdcv.github.io/Animal-Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.03052 2022-06-02 cs.CV cs.CL 57%

OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

Peng Wang, An Yang, Rui Men, Junyang Lin, Shuai Bai, Zhikang Li, Jianxin Ma, Chang Zhou, Jingren Zhou, Hongxia Yang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted at ICML2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.08276 2022-06-02 cs.CL cs.CV 57%

Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts

Yan Zeng, Xinsong Zhang, Hang Li

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

Comments ICML 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.02655 2022-06-01 cs.CV cs.CL 57%

Language Models Can See: Plugging Visual Controls in Text Generation

Yixuan Su, Tian Lan, Yahui Liu, Fangyu Liu, Dani Yogatama, Yan Wang, Lingpeng Kong, Nigel Collier

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments 21 pages, 5 figures, 5 tables; (v2 adds some experimental details)

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.06013 2022-06-01 cs.CV cs.CL 57%

Learning to Ground Visual Objects for Visual Dialog

Feilong Chen, Xiuyi Chen, Can Xu, Daxin Jiang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Findings of the Association for Computational Linguistics: EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.13928 2022-05-30 cs.CL cs.AI 57%

Commonsense and Named Entity Aware Knowledge Grounded Dialogue Generation

Deeksha Varshney, Akshara Prabhakar, Asif Ekbal

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.12293 2022-04-27 cs.CV 57%

Contrastive Language-Action Pre-training for Temporal Localization

Mengmeng Xu, Erhan Gundogdu, Maksim Lapin, Bernard Ghanem, Michael Donoser, Loris Bazzani

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.06232 2022-04-26 cs.CL cs.AI 57%

Retrieval-Free Knowledge-Grounded Dialogue Response Generation with Adapters

Yan Xu, Etsuko Ishii, Samuel Cahyawijaya, Zihan Liu, Genta Indra Winata, Andrea Madotto, Dan Su, Pascale Fung

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments The first two authors contribute equally; Accepted in ACL 2022 DialDoc Workshop (Best Student Paper Award)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07910 2022-04-18 cs.CV 57%

Decoupling Zero-Shot Semantic Segmentation

Jian Ding, Nan Xue, Gui-Song Xia, Dengxin Dai

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03752 2022-04-11 cs.AI 57%

Automated Isovist Computation for Minecraft

Jean-Baptiste Hervé, Christoph Salge

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.01734 2022-04-07 cs.CV cs.SI 57%

On Explaining Multimodal Hateful Meme Detection Models

Ming Shan Hee, Roy Ka-Wei Lee, Wen-Haw Chong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.00966 2022-03-31 cs.CV 57%

Translating Images into Maps

Avishkar Saha, Oscar Mendez Maldonado, Chris Russell, Richard Bowden

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to ICRA 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.10133 2022-03-30 cs.CL cs.AI 57%

Probing Factually Grounded Content Transfer with Factual Ablation

Peter West, Chris Quirk, Michel Galley, Yejin Choi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.11425 2022-03-23 cs.CL cs.AI 57%

Towards Abstractive Grounded Summarization of Podcast Transcripts

Kaiqiang Song, Chen Li, Xiaoyang Wang, Dong Yu, Fei Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.03153 2022-02-24 cs.GT cs.LG 57%

Are You Smarter Than a Random Expert? The Robust Aggregation of Substitutable Signals

Eric Neyman, Tim Roughgarden

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments 23 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.09305 2022-02-21 cs.LG stat.ML 57%

Masked prediction tasks: a parameter identifiability view

Bingbin Liu, Daniel Hsu, Pradeep Ravikumar, Andrej Risteski

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.08926 2022-02-21 cs.CV 57%

On Guiding Visual Attention with Language Specification

Suzanne Petryk, Lisa Dunlap, Keyan Nasseri, Joseph Gonzalez, Trevor Darrell, Anna Rohrbach

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.09893 2022-02-21 cs.LG stat.ML 57%

A Fair Comparison of Graph Neural Networks for Graph Classification

Federico Errica, Marco Podda, Davide Bacciu, Alessio Micheli

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments Extended version of the paper published at the International Conference on Learning Representations (ICLR), 2020. Additional results are shown in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08795 2022-02-14 cs.LG cs.RO cs.SY eess.SY 57%

Intuitive Physics Guided Exploration for Sample Efficient Sim2real Transfer

Buddhika Laknath Semage, Thommen George Karimpanal, Santu Rana, Svetha Venkatesh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.06860 2022-01-19 cs.SE cs.AI 57%

A Knowledge-driven Business Process Analysis Canvas

Michele Missikoff

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 15 pages, 3 fugures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10066 2021-12-21 cs.CV 57%

LocFormer: Enabling Transformers to Perform Temporal Moment Localization on Long Untrimmed Videos With a Feature Sampling Approach

Cristian Rodriguez-Opazo, Edison Marrese-Taylor, Basura Fernando, Hiroya Takamura, Qi Wu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.07263 2021-12-08 cs.CL cs.LG 57%

End-to-End Learning of Flowchart Grounded Task-Oriented Dialogs

Dinesh Raghu, Shantanu Agarwal, Sachindra Joshi, Mausam

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments This is a Post-EMNLP Version that contains results on the new hidden test set. D.Raghu and S.Agarwal contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.01642 2021-12-06 cs.LG 57%

Probabilistic Contrastive Loss for Self-Supervised Learning

Shen Li, Jianqing Xu, Bryan Hooi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.07975 2021-11-16 cs.RO cs.CV 57%

Semantically Grounded Object Matching for Robust Robotic Scene Rearrangement

Walter Goodwin, Sagar Vaze, Ioannis Havoutis, Ingmar Posner

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.08716 2021-11-10 cs.CV 57%

Text-based Localization of Moments in a Video Corpus

Sudipta Paul, Niluthpol Chowdhury Mithun, Amit K. Roy-Chowdhury

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏