arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46294 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4676 篇

2303.04751 2024-01-09 cs.CV cs.AI 81%

Multimodal Parameter-Efficient Few-Shot Class Incremental Learning

Marco D'Alessandro, Alberto Alonso, Enrique Calabrés, Mikel Galar

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Journal ref 2023 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), Paris, France, 2023, pp. 3385-3395

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02347 2024-01-05 cs.CV cs.AI 81%

Mining Fine-Grained Image-Text Alignment for Zero-Shot Captioning via Text-Only Training

Longtian Qiu, Shan Ning, Xuming He

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

Comments AAAI 2024.Open sourced, Code and Model Available

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11171 2023-12-19 cs.CV cs.AI 81%

UniDCP: Unifying Multiple Medical Vision-language Tasks via Dynamic Cross-modal Learnable Prompts

Chenlu Zhan, Yufei Zhang, Yu Lin, Gaoang Wang, Hongwei Wang

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09812 2023-12-18 cs.CV cs.AI 81%

Structural Information Guided Multimodal Pre-training for Vehicle-centric Perception

Xiao Wang, Wentao Wu, Chenglong Li, Zhicheng Zhao, Zhe Chen, Yukai Shi, Jin Tang

专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08213 2023-11-15 cs.CV cs.CL 81%

Unlock the Power: Competitive Distillation for Multi-Modal Large Language Models

Xinwei Li, Li Lin, Shuai Wang, Chen Qian

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01855 2023-11-14 cs.CV cs.AI 81%

Multimodal Data Augmentation for Image Captioning using Diffusion Models

Changrong Xiao, Sean Xin Xu, Kunpeng Zhang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16741 2023-11-03 cs.AI cs.CV 81%

Socratis: Are large multimodal models emotionally aware?

Katherine Deng, Arijit Ray, Reuben Tan, Saadia Gabriel, Bryan A. Plummer, Kate Saenko

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments ICCV 2023 WECIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20159 2023-11-01 cs.CV cs.AI 81%

Language Guided Visual Question Answering: Elevate Your Multimodal Language Model Using Knowledge-Enriched Prompts

Deepanway Ghosal, Navonil Majumder, Roy Ka-Wei Lee, Rada Mihalcea, Soujanya Poria

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06939 2023-10-31 cs.CV cs.CL 81%

Multimodal C4: An Open, Billion-scale Corpus of Images Interleaved with Text

Wanrong Zhu, Jack Hessel, Anas Awadalla, Samir Yitzhak Gadre, Jesse Dodge, Alex Fang, Youngjae Yu, Ludwig Schmidt, William Yang Wang, Yejin Choi

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments NeurIPS D&B 2023. Project homepage: https://github.com/allenai/mmc4

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13812 2023-10-26 cs.CL cs.CV 81%

Coarse-to-Fine Contrastive Learning in Image-Text-Graph Space for Improved Vision-Language Compositionality

Harman Singh, Pengchuan Zhang, Qifan Wang, Mengjiao Wang, Wenhan Xiong, Jingfei Du, Yu Chen

专题命中 图文多模态 :image-text(title);multimodal(abstract);分类 cs.CV、cs.CL

Comments EMNLP 2023 (long paper, main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14616 2023-10-25 cs.CL cs.CV 81%

Exploring Affordance and Situated Meaning in Image Captions: A Multimodal Analysis

Pin-Er Chen, Po-Ya Angela Wang, Hsin-Yu Chou, Yu-Hsiang Tseng, Shu-Kai Hsieh

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14581 2023-10-24 cs.CV cs.AI 81%

Leveraging Image-Text Similarity and Caption Modification for the DataComp Challenge: Filtering Track and BYOD Track

Shuhei Yokoo, Peifei Zhu, Yuchi Ishikawa, Mikihiro Tanaka, Masayoshi Kondo, Hirokatsu Kataoka

专题命中 图文多模态 :image-text(title);multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted at the ICCV 2023 Workshop on Towards the Next Generation of Computer Vision Datasets: DataComp Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11173 2023-10-18 cs.CV cs.AI 81%

Knowledge Extraction and Distillation from Large-Scale Image-Text Colonoscopy Records Leveraging Large Language and Vision Models

Shuo Wang, Yan Zhu, Xiaoyuan Luo, Zhiwei Yang, Yizhe Zhang, Peiyao Fu, Manning Wang, Zhijian Song, Quanlin Li, Pinghong Zhou, Yike Guo

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16705 2023-10-18 cs.CV cs.CL cs.LG 81%

Multimodal Analysis Of Google Bard And GPT-Vision: Experiments In Visual Reasoning

David Noever, Samantha Elizabeth Miller Noever

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00653 2023-10-03 cs.CV cs.AI 81%

Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants

Tianyu Yu, Jinyi Hu, Yuan Yao, Haoye Zhang, Yue Zhao, Chongyi Wang, Shan Wang, Yinxv Pan, Jiao Xue, Dahai Li, Zhiyuan Liu, Hai-Tao Zheng, Maosong Sun

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01544 2023-10-03 cs.CV cs.CL 81%

Multimodal Neurons in Pretrained Text-Only Transformers

Sarah Schwettmann, Neil Chowdhury, Samuel Klein, David Bau, Antonio Torralba

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Oral presentation at ICCV CLVL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13563 2023-09-28 cs.CV cs.AI 81%

Noise-aware Learning from Web-crawled Image-Text Data for Image Captioning

Wooyoung Kang, Jonghwan Mun, Sungjun Lee, Byungseok Roh

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10475 2023-09-14 cs.CL cs.CV 81%

Findings of Factify 2: Multimodal Fake News Detection

S Suryavardan, Shreyash Mishra, Megha Chakraborty, Parth Patwa, Anku Rani, Aman Chadha, Aishwarya Reganti, Amitava Das, Amit Sheth, Manoj Chinnakotla, Asif Ekbal, Srijan Kumar

专题命中 图文多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.CL

Comments Defactify2 @AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12305 2023-08-25 cs.LG cs.AI cs.MM 81%

FedDAT: An Approach for Foundation Model Finetuning in Multi-Modal Heterogeneous Federated Learning

Haokun Chen, Yao Zhang, Denis Krompass, Jindong Gu, Volker Tresp

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06494 2023-08-25 cs.CV cs.AI 81%

Multi-modal Pre-training for Medical Vision-language Understanding and Generation: An Empirical Study with A New Benchmark

Li Xu, Bo Liu, Ameer Hamza Khan, Lu Fan, Xiao-Ming Wu

专题命中 图文多模态 :multi-modal(title);image-text(abstract);分类 cs.CV、cs.AI

Comments Published as oral paper in CHIL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11797 2023-08-24 cs.CV cs.IR cs.MM 81%

CLIP Multi-modal Hashing: A new baseline CLIPMH

Jian Zhu, Mingkai Sheng, Mingda Ke, Zhangmin Huang, Jingfei Chang

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.MM

Comments submit to ICASSP2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07933 2023-08-17 cs.CL cs.CV cs.LG 81%

Evaluating Picture Description Speech for Dementia Detection using Image-text Alignment

Youxiang Zhu, Nana Lin, Xiaohui Liang, John A. Batsis, Robert M. Roth, Brian MacWhinney

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04380 2023-08-09 cs.CV cs.IR cs.MM 81%

Your Negative May not Be True Negative: Boosting Image-Text Matching with False Negative Elimination

Haoxuan Li, Yi Bin, Junrong Liao, Yang Yang, Heng Tao Shen

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.MM

Comments Accepted at ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04118 2023-08-09 cs.CV cs.MM 81%

Multimodal Color Recommendation in Vector Graphic Documents

Qianru Qiu, Xueting Wang, Mayu Otani

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

Comments Accepted to ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12260 2023-05-26 cs.CV cs.CL 81%

Cross2StrA: Unpaired Cross-lingual Image Captioning with Cross-lingual Cross-modal Structure-pivoted Alignment

Shengqiong Wu, Hao Fei, Wei Ji, Tat-Seng Chua

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13273 2023-05-09 cs.CV cs.CL cs.LG 81%

From Association to Generation: Text-only Captioning by Unsupervised Cross-modal Mapping

Junyang Wang, Ming Yan, Yi Zhang, Jitao Sang

专题命中 图文多模态 :cross-modal(title);image-text(abstract);分类 cs.CV、cs.CL

Comments 11 pages, 15 figures, has been accepted by IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10766 2023-03-22 cs.CV cs.AI 81%

Multi-modal reward for visual relationships-based image captioning

Ali Abedi, Hossein Karshenas, Peyman Adibi

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01510 2023-03-06 cs.LG cs.AI cs.CL 81%

INO at Factify 2: Structure Coherence based Multi-Modal Fact Verification

Yinuo Zhang, Zhulin Tao, Xi Wang, Tongyue Wang

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI

Comments AAAI-23 DeFactify 2 Workshop (2nd Prize)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00181 2023-03-02 cs.CV cs.MM 81%

Selectively Hard Negative Mining for Alleviating Gradient Vanishing in Image-Text Matching

Zheng Li, Caili Guo, Xin Wang, Zerun Feng, Zhongtian Du

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.09667 2023-02-15 cs.CV cs.CL 81%

Video Captioning with Guidance of Multimodal Latent Topics

Shizhe Chen, Jia Chen, Qin Jin, Alexander Hauptmann

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments ACM Multimedia 2017

详情

展开后加载摘要…

URL PDF HTML 收藏