arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4657 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2501.17654 2025-01-30 cs.CL cs.AI 81%

Exploring Vision Language Models for Multimodal and Multilingual Stance Detection

Jake Vasilakes, Carolina Scarton, Zhixue Zhao

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Submitted to the International AAAI Conference on Web and Social Media (ICWSM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17759 2024-12-24 cs.AI cs.CV cs.LG 81%

Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy

Priyaranjan Pattnayak, Hitesh Laxmichand Patel, Bhargava Kumar, Amit Agarwal, Ishan Banerjee, Srikant Panda, Tejaswini Kumar

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13702 2024-12-20 cs.CL cs.AI 81%

Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models

Kunat Pipatanakul, Potsawee Manakul, Natapong Nitarach, Warit Sirichotedumrong, Surapon Nonesung, Teetouch Jaknamon, Parinthapat Pengpun, Pittawat Taveekitworachai, Adisai Na-Thalang, Sittipong Sripaisarnmongkol, Krisanapong Jirayoot, Kasima Tharnpipitchai

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments technical report, 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13794 2024-12-19 cs.CL cs.AI cs.CY 81%

MATCHED: Multimodal Authorship-Attribution To Combat Human Trafficking in Escort-Advertisement Data

Vageesh Saxena, Benjamin Bashpole, Gijs Van Dijck, Gerasimos Spanakis

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10707 2024-12-17 cs.CV cs.MM 81%

MambaPro: Multi-Modal Object Re-Identification with Mamba Aggregation and Synergistic Prompt

Yuhao Wang, Xuehu Liu, Tianyu Yan, Yang Liu, Aihua Zheng, Pingping Zhang, Huchuan Lu

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.MM

Comments This work is accepted by AAAI2025. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07979 2024-12-12 cs.LG cs.AI cs.CV 81%

AmCLR: Unified Augmented Learning for Cross-Modal Representations

Ajay Jagannath, Aayush Upadhyay, Anant Mehta

专题命中 图文多模态 :cross-modal(title);multi-modal(abstract);分类 cs.CV、cs.AI

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10839 2024-11-13 cs.CV cs.CL 81%

Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags

Daiqing Qi, Handong Zhao, Zijun Wei, Sheng Li

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Main Conference at EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06872 2024-11-12 cs.CV cs.AI 81%

Multi-Modal interpretable automatic video captioning

Antoine Hanna-Asaad, Decky Aspandi, Titus Zaharia

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17610 2024-10-31 cs.CL cs.CV 81%

ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue

Zhangpu Li, Changhong Zou, Suxue Ma, Zhicheng Yang, Chen Du, Youbao Tang, Zhenjie Cao, Ning Zhang, Jui-Hsin Lai, Ruei-Sung Lin, Yuan Ni, Xingzhi Sun, Jing Xiao, Jieke Hou, Kai Zhang, Mei Han

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14703 2024-10-29 cs.LG cs.CL cs.MM 81%

MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification

Siddhant Bikram Shah, Shuvam Shiwakoti, Maheep Chaudhary, Haohan Wang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM

Comments Accepted to EMNLP 2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16063 2024-10-22 cs.CV cs.AI 81%

Integrated Image-Text Based on Semi-supervised Learning for Small Sample Instance Segmentation

Ruting Chi, Zhiyi Huang, Yuexing Han

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14050 2024-10-21 cs.CL cs.CV cs.CY cs.HC 81%

Learning Multimodal Cues of Children's Uncertainty

Qi Cheng, Mert İnan, Rahma Mbarki, Grace Grmek, Theresa Choi, Yiming Sun, Kimele Persaud, Jenny Wang, Malihe Alikhani

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments SIGDIAL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13733 2024-10-18 cs.CV cs.MM 81%

Improving Multi-modal Large Language Model through Boosting Vision Capabilities

Yanpeng Sun, Huaxin Zhang, Qiang Chen, Xinyu Zhang, Nong Sang, Gang Zhang, Jingdong Wang, Zechao Li

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17894 2024-10-15 cs.CV cs.AI 81%

White-box Multimodal Jailbreaks Against Large Vision-Language Models

Ruofan Wang, Xingjun Ma, Hanxu Zhou, Chuanjun Ji, Guangnan Ye, Yu-Gang Jiang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06682 2024-10-14 cs.CV cs.CL eess.IV 81%

Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization

Changli Tang, Yixuan Li, Yudong Yang, Jimin Zhuang, Guangzhi Sun, Wei Li, Zujun Ma, Chao Zhang

专题命中 图文多模态 :multimodal(title);audio-visual(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08209 2024-10-11 cs.CY cs.CL cs.CV cs.LG 81%

Who's in and who's out? A case study of multimodal CLIP-filtering in DataComp

Rachel Hong, William Agnew, Tadayoshi Kohno, Jamie Morgenstern

专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CV、cs.CL

Comments Content warning: This paper discusses societal stereotypes and sexually-explicit material that may be disturbing, distressing, and/or offensive to the reader

Journal ref Proceedings of the 4th ACM Conference on Equity and Access in Algorithms, Mechanisms, and Optimization (EAAMO 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00226 2024-10-02 cs.CV cs.CL 81%

Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training

Tongkun Su, Jun Li, Xi Zhang, Haibo Jin, Hao Chen, Qiong Wang, Faqin Lv, Baoliang Zhao, Yin Hu

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by MICCAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18346 2024-09-30 cs.CL cs.CV 81%

MultiClimate: Multimodal Stance Detection on Climate Change Videos

Jiawen Wang, Longfei Zuo, Siyao Peng, Barbara Plank

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14899 2024-09-24 cs.CV cs.AI cs.CR cs.LG 81%

Stop Reasoning! When Multimodal LLM with Chain-of-Thought Reasoning Meets Adversarial Image

Zefeng Wang, Zhen Han, Shuo Chen, Fan Xue, Zifeng Ding, Xun Xiao, Volker Tresp, Philip Torr, Jindong Gu

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07078 2024-09-12 cs.CV cs.AI 81%

Multimodal Emotion Recognition with Vision-language Prompting and Modality Dropout

Anbin QI, Zhongliang Liu, Xinyong Zhou, Jinba Xiao, Fengrun Zhang, Qi Gan, Ming Tao, Gaozheng Zhang, Lu Zhang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18799 2024-09-10 cs.CV cs.CL 81%

X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning

Artemis Panagopoulou, Le Xue, Ning Yu, Junnan Li, Dongxu Li, Shafiq Joty, Ran Xu, Silvio Savarese, Caiming Xiong, Juan Carlos Niebles

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02958 2024-09-06 cs.CV cs.AI cs.LG 81%

Multi-Modal Adapter for Vision-Language Models

Dominykas Seputis, Serghei Mihailov, Soham Chatterjee, Zehao Xiao

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00608 2024-08-27 cs.CV cs.AI 81%

Reviving the Context: Camera Trap Species Classification as Link Prediction on Multimodal Knowledge Graphs

Vardaan Pahuja, Weidi Luo, Yu Gu, Cheng-Hao Tu, Hong-You Chen, Tanya Berger-Wolf, Charles Stewart, Song Gao, Wei-Lun Chao, Yu Su

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12292 2024-08-23 cs.CV cs.AI 81%

Towards Deconfounded Image-Text Matching with Causal Inference

Wenhui Li, Xinqi Su, Dan Song, Lanjun Wang, Kun Zhang, An-An Liu

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

Comments ACM MM

Journal ref 2023/10/26,Proceedings of the 31st ACM International Conference on Multimedia,6264-6273

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05831 2024-08-13 cs.CV cs.AI 81%

Robust Domain Generalization for Multi-modal Object Recognition

Yuxin Qiao, Keqin Li, Junhong Lin, Rong Wei, Chufeng Jiang, Yang Luo, Haoyu Yang

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments 6 pages, 2 figures. This is a preprint version of the article. The final version will be published in the proceedings of the IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18279 2024-08-13 cs.CV cs.AI 81%

Contextual Object Detection with Multimodal Large Language Models

Yuhang Zang, Wei Li, Jun Han, Kaiyang Zhou, Chen Change Loy

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments IJCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03735 2024-08-08 cs.CV cs.AI cs.LG 81%

Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation

Jingjing Xie, Yuxin Zhang, Mingbao Lin, Liujuan Cao, Rongrong Ji

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by ACMMM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19185 2024-07-30 cs.CV cs.AI 81%

LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models

Ruiyi Zhang, Yufan Zhou, Jian Chen, Jiuxiang Gu, Changyou Chen, Tong Sun

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2024 Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14321 2024-07-22 cs.CL cs.IR cs.MM 81%

Multimodal Misinformation Detection using Large Vision-Language Models

Sahar Tahmasebi, Eric Müller-Budack, Ralph Ewerth

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM

Comments Accepted for publication in: Conference on Information and Knowledge Management (CIKM) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03766 2024-07-18 cs.CL cs.CV 81%

Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment

Brian Gordon, Yonatan Bitton, Yonatan Shafir, Roopal Garg, Xi Chen, Dani Lischinski, Daniel Cohen-Or, Idan Szpektor

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

Journal ref ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏