arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46294 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4676 篇

2212.11109 2022-12-22 cs.CV cs.CL cs.LG 81%

MAViC: Multimodal Active Learning for Video Captioning

Gyanendra Das, Xavier Thomas, Anant Raj, Vikram Gupta

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07075 2022-12-15 cs.CV cs.CL 81%

Cross-Modal Similarity-Based Curriculum Learning for Image Captioning

Hongkuan Zhang, Saku Sugawara, Akiko Aizawa, Lei Zhou, Ryohei Sasano, Koichi Takeda

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.16431 2022-11-01 cs.CV cs.CL 81%

DiMBERT: Learning Vision-Language Grounded Representations with Disentangled Multimodal-Attention

Fenglin Liu, Xian Wu, Shen Ge, Xuancheng Ren, Wei Fan, Xu Sun, Yuexian Zou

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Published in ACM TKDD2022 (ACM Transactions on Knowledge Discovery from Data)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15937 2022-10-31 cs.CL cs.SD eess.AS 81%

On the Use of Modality-Specific Large-Scale Pre-Trained Encoders for Multimodal Sentiment Analysis

Atsushi Ando, Ryo Masumura, Akihiko Takashima, Satoshi Suzuki, Naoki Makishima, Keita Suzuki, Takafumi Moriya, Takanori Ashihara, Hiroshi Sato

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments Accepted to SLT 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14823 2022-10-31 cs.CV cs.AI 81%

Visual Answer Localization with Cross-modal Mutual Knowledge Transfer

Yixuan Weng, Bin Li

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

Comments 4 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14712 2022-10-27 cs.CL cs.AI 81%

Bloom Library: Multimodal Datasets in 300+ Languages for a Variety of Downstream Tasks

Colin Leong, Joshua Nemecek, Jacob Mansdorfer, Anna Filighera, Abraham Owodunni, Daniel Whitenack

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 14 pages, 1 figure, 3 tables, accepted to and presented at EMNLP 2022

Journal ref EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.01744 2022-08-04 cs.CV cs.AI cs.LG 81%

Cross-Modal Alignment Learning of Vision-Language Conceptual Systems

Taehyeong Kim, Hyeonseop Song, Byoung-Tak Zhang

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.04174 2022-07-12 cs.CV cs.AI 81%

Towards Multimodal Vision-Language Models Generating Non-Generic Text

Wes Robbins, Zanyar Zohourianshahzadi, Jugal Kalita

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Journal ref 2021 International Conference on Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11091 2022-06-23 cs.CL cs.AI 81%

Generalizing Multimodal Pre-training into Multilingual via Language Acquisition

Liang Zhang, Anwen Hu, Qin Jin

专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.04363 2022-06-09 cs.CV cs.AI cs.LG 81%

Beyond a Pre-Trained Object Detector: Cross-Modal Textual and Visual Context for Image Captioning

Chia-Wen Kuo, Zsolt Kira

专题命中 图文多模态 :cross-modal(title);multi-modal(abstract);分类 cs.CV、cs.AI

Comments paper accepted in CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.04347 2022-04-12 cs.CL cs.AI 81%

On the Importance of Karaka Framework in Multi-modal Grounding

Sai Kiran Gorthi, Radhika Mamidi

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03610 2022-04-08 cs.CV cs.AI cs.LG 81%

Unified Contrastive Learning in Image-Text-Label Space

Jianwei Yang, Chunyuan Li, Pengchuan Zhang, Bin Xiao, Ce Liu, Lu Yuan, Jianfeng Gao

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

Comments CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.06683 2022-03-21 cs.CL cs.AI cs.LG 81%

Assessing Multilingual Fairness in Pre-trained Multimodal Representations

Jialu Wang, Yang Liu, Xin Eric Wang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 15 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05349 2022-03-11 cs.MM cs.CV 81%

Two-stream Hierarchical Similarity Reasoning for Image-text Matching

Ran Chen, Hanli Wang, Lei Wang, Sam Kwong

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.06558 2022-03-07 cs.CV cs.AI 81%

MAGIC: Multimodal relAtional Graph adversarIal inferenCe for Diverse and Unpaired Text-based Image Captioning

Wenqiao Zhang, Haochen Shi, Jiannan Guo, Shengyu Zhang, Qingpeng Cai, Juncheng Li, Sihui Luo, Yueting Zhuang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Journal ref AAAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.11431 2021-11-23 cs.CV cs.CL 81%

RedCaps: web-curated image-text data created by the people, for the people

Karan Desai, Gaurav Kaul, Zubin Aysola, Justin Johnson

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

Comments NeurIPS 2021 Datasets and Benchmarks. Website: https://redcaps.xyz

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.03349 2021-11-08 cs.CV cs.CL cs.IR 81%

Negative Sample is Negative in Its Own Way: Tailoring Negative Sentences for Image-Text Retrieval

Zhihao Fan, Zhongyu Wei, Zejun Li, Siyuan Wang, Jianqing Fan

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11767 2021-10-29 cs.CV cs.AI 81%

Exploiting Cross-Modal Prediction and Relation Consistency for Semi-Supervised Image Captioning

Yang Yang, Hongchen Wei, Hengshu Zhu, Dianhai Yu, Hui Xiong, Jian Yang

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.02623 2021-10-07 cs.CV cs.AI 81%

Is An Image Worth Five Sentences? A New Look into Semantics for Image-Text Matching

Ali Furkan Biten, Andres Mafla, Lluis Gomez, Dimosthenis Karatzas

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

Comments Accepted WACV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.10559 2021-09-23 cs.CV cs.AI 81%

Hierarchical Multimodal Transformer to Summarize Videos

Bin Zhao, Maoguo Gong, Xuelong Li

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.08849 2021-04-16 cs.CV cs.CL 81%

Multilingual Multimodal Pre-training for Zero-Shot Cross-Lingual Transfer of Vision-Language Models

Po-Yao Huang, Mandela Patrick, Junjie Hu, Graham Neubig, Florian Metze, Alexander Hauptmann

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments accepted by NAACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.08981 2021-03-31 cs.CV cs.CL 81%

Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts

Soravit Changpinyo, Piyush Sharma, Nan Ding, Radu Soricut

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

Comments IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2021). Our dataset is available at https://github.com/google-research-datasets/conceptual-12m

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.03662 2021-03-23 cs.CV cs.CL 81%

Confidence-aware Non-repetitive Multimodal Transformers for TextCaps

Zhaokai Wang, Renda Bao, Qi Wu, Si Liu

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 9 pages; Accepted by AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.10480 2021-03-22 cs.LG cs.CL cs.CV 81%

Reading Isn't Believing: Adversarial Attacks On Multi-Modal Neurons

David A. Noever, Samantha E. Miller Noever

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.01368 2021-01-06 cs.CV cs.MM 81%

Similarity Reasoning and Filtration for Image-Text Matching

Haiwen Diao, Ying Zhang, Lin Ma, Huchuan Lu

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.MM

Comments 14 pages, 8 figures, Accepted by AAAI2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.12870 2020-12-08 cs.CV cs.AI 81%

Multimodal Learning for Hateful Memes Detection

Yi Zhou, Zhenhao Chen

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.11760 2020-11-25 cs.CV cs.CL cs.LG 81%

Multimodal Pretraining for Dense Video Captioning

Gabriel Huang, Bo Pang, Zhenhai Zhu, Clara Rivera, Radu Soricut

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments AACL-IJCNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.03119 2020-05-08 cs.CL cs.CV 81%

Unsupervised Multimodal Neural Machine Translation with Pseudo Visual Pivoting

Po-Yao Huang, Junjie Hu, Xiaojun Chang, Alexander Hauptmann

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.00390 2020-04-02 cs.CV cs.CL 81%

More Grounded Image Captioning by Distilling Image-Text Matching Model

Yuanen Zhou, Meng Wang, Daqing Liu, Zhenzhen Hu, Hanwang Zhang

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.06745 2020-03-17 cs.CV cs.CL 81%

Vision-Dialog Navigation by Exploring Cross-modal Memory

Yi Zhu, Fengda Zhu, Zhaohuan Zhan, Bingqian Lin, Jianbin Jiao, Xiaojun Chang, Xiaodan Liang

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

Comments CVPR2020

详情

展开后加载摘要…

URL PDF HTML 收藏