arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2209.04372 2022-09-12 cs.CV 57%

Pre-training image-language transformers for open-vocabulary tasks

AJ Piergiovanni, Weicheng Kuo, Anelia Angelova

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.12066 2022-08-30 cs.CV 57%

Zero-shot Object Detection Through Vision-Language Embedding Alignment

Johnathan Xie, Shuai Zheng

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Code: https://github.com/Johnathan-Xie/ZSD-YOLO

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02583 2022-08-16 cs.CV 57%

PIC 4th Challenge: Semantic-Assisted Multi-Feature Encoding and Multi-Head Decoding for Dense Video Captioning

Yifan Lu, Ziqi Zhang, Yuxin Chen, Chunfeng Yuan, Bing Li, Weiming Hu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 5 pages, 2 figures, report of PIC 4th Challenge Accepted by PIC'22 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.04060 2022-08-09 cs.CV 57%

GRIT-VLP: Grouped Mini-batch Sampling for Efficient Vision and Language Pre-training

Jaeseok Byun, Taebaek Hwang, Jianlong Fu, Taesup Moon

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.03550 2022-08-09 cs.CV 57%

Frozen CLIP Models are Efficient Video Learners

Ziyi Lin, Shijie Geng, Renrui Zhang, Peng Gao, Gerard de Melo, Xiaogang Wang, Jifeng Dai, Yu Qiao, Hongsheng Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.05333 2022-08-02 cs.CV cs.LG 57%

IDEA: Increasing Text Diversity via Online Multi-Label Recognition for Vision-Language Pre-training

Xinyu Huang, Youcai Zhang, Ying Cheng, Weiwei Tian, Ruiwei Zhao, Rui Feng, Yuejie Zhang, Yaqian Li, Yandong Guo, Xiaobo Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by the 30th ACM International Conference on Multimedia (ACM MM 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11100 2022-07-29 cs.CV 57%

Zero-Shot Video Captioning with Evolving Pseudo-Tokens

Yoad Tewel, Yoav Shalev, Roy Nadler, Idan Schwartz, Lior Wolf

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.09248 2022-07-21 cs.CV 57%

Don't Stop Learning: Towards Continual Learning for the CLIP Model

Yuxuan Ding, Lingqiao Liu, Chunna Tian, Jingyuan Yang, Haoxuan Ding

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.06230 2022-07-21 cs.CV 57%

Simple Open-Vocabulary Object Detection with Vision Transformers

Matthias Minderer, Alexey Gritsenko, Austin Stone, Maxim Neumann, Dirk Weissenborn, Alexey Dosovitskiy, Aravindh Mahendran, Anurag Arnab, Mostafa Dehghani, Zhuoran Shen, Xiao Wang, Xiaohua Zhai, Thomas Kipf, Neil Houlsby

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ECCV 2022 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08034 2022-07-19 cs.CV 57%

Progress and limitations of deep networks to recognize objects in unusual poses

Amro Abbas, Stéphane Deny

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.07993 2022-07-12 cs.CL 57%

CoLLIE: Continual Learning of Language Grounding from Language-Image Embeddings

Gabriel Skantze, Bram Willemsen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Published in Journal of Artificial Intelligence Research (JAIR)

Journal ref Journal of Artificial Intelligence Research (JAIR), 2022, vol. 74, pp. 1201-1223

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01076 2022-07-05 cs.CV 57%

Divert More Attention to Vision-Language Tracking

Mingzhe Guo, Zhipeng Zhang, Heng Fan, Liping Jing

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09541 2022-06-22 cs.CV 57%

DualCoOp: Fast Adaptation to Multi-Label Recognition with Limited Annotations

Ximeng Sun, Ping Hu, Kate Saenko

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.06619 2022-06-15 cs.CV 57%

TransVG++: End-to-End Visual Grounding with Language Conditioned Vision Transformer

Jiajun Deng, Zhengyuan Yang, Daqing Liu, Tianlang Chen, Wengang Zhou, Yanyong Zhang, Houqiang Li, Wanli Ouyang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2104.08541

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.05912 2022-06-14 cs.CV 57%

INDIGO: Intrinsic Multimodality for Domain Generalization

Puneet Mangla, Shivam Chandhok, Milan Aggarwal, Vineeth N Balasubramanian, Balaji Krishnamurthy

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Under Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03039 2022-05-09 cs.CV 57%

Dual-Level Decoupled Transformer for Video Captioning

Yiqi Gao, Xinglin Hou, Wei Suo, Mengyang Sun, Tiezheng Ge, Yuning Jiang, Peng Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.16056 2022-04-29 cs.CL 57%

Generating Radiology Reports via Memory-driven Transformer

Zhihong Chen, Yan Song, Tsung-Hui Chang, Xiang Wan

专题命中 图文多模态 :image-text(abstract);分类 cs.CL

Comments Natural Language Processing. 11 pages, 6 figures. EMNLP-2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.12974 2022-04-28 cs.CV 57%

CapOnImage: Context-driven Dense-Captioning on Image

Yiqi Gao, Xinglin Hou, Yuanmeng Zhang, Tiezheng Ge, Yuning Jiang, Peng Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 13pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07910 2022-04-18 cs.CV 57%

Decoupling Zero-Shot Semantic Segmentation

Jian Ding, Nan Xue, Gui-Song Xia, Dengxin Dai

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.15350 2022-03-30 cs.CV 57%

End-to-End Transformer Based Model for Image Captioning

Yiyu Wang, Jungang Xu, Yingfei Sun

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments AAAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.15174 2022-03-16 cs.CV 57%

CRIS: CLIP-Driven Referring Image Segmentation

Zhaoqing Wang, Yu Lu, Qiang Li, Xunqiang Tao, Yandong Guo, Mingming Gong, Tongliang Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 10 pages, 5 figures, Accepted by CVPR2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05175 2022-03-11 cs.CV 57%

MVP: Multimodality-guided Visual Pre-training

Longhui Wei, Lingxi Xie, Wengang Zhou, Houqiang Li, Qi Tian

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.04705 2022-03-10 cs.CV 57%

FlexIT: Towards Flexible Semantic Image Translation

Guillaume Couairon, Asya Grechka, Jakob Verbeek, Holger Schwenk, Matthieu Cord

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments accepted at CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.05139 2022-03-03 cs.CV cs.GR 57%

CLIP-NeRF: Text-and-Image Driven Manipulation of Neural Radiance Fields

Can Wang, Menglei Chai, Mingming He, Dongdong Chen, Jing Liao

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments To Appear at CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.12362 2022-02-28 cs.CV 57%

StyleCLIPDraw: Coupling Content and Style in Text-to-Drawing Translation

Peter Schaldenbrand, Zhixuan Liu, Jean Oh

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.12086 2022-02-16 cs.CV 57%

BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation

Junnan Li, Dongxu Li, Caiming Xiong, Steven Hoi

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.01288 2022-02-08 cs.CL 57%

UNISON: Unpaired Cross-lingual Image Captioning

Jiahui Gao, Yi Zhou, Philip L. H. Yu, Shafiq Joty, Jiuxiang Gu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL

Comments Accepted by AAAI-2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.03965 2022-01-12 cs.CV cs.LG 57%

On the Efficacy of Co-Attention Transformer Layers in Visual Question Answering

Ankur Sikarwar, Gabriel Kreiman

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.12349 2022-01-12 cs.CV 57%

When CNNs Meet Random RNNs: Towards Multi-Level Analysis for RGB-D Object and Scene Recognition

Ali Caglayan, Nevrez Imamoglu, Ahmet Burak Can, Ryosuke Nakamura

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 15 pages, 9 figures, 5 tables (To appear in Computer Vision and Image Understanding, Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.04404 2021-12-09 cs.AI cs.IR cs.LG 57%

Gaudí: Conversational Interactions with Deep Representations to Generate Image Collections

Victor S. Bursztyn, Jennifer Healey, Vishwa Vinay

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI

Comments Accepted at the NeurIPS 2021 Workshop on Machine Learning for Creativity and Design

详情

展开后加载摘要…

URL PDF HTML 收藏