arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46294 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4676 篇

2403.11176 2025-03-11 cs.CV cs.CL 81%

Quality-Aware Image-Text Alignment for Opinion-Unaware Image Quality Assessment

Lorenzo Agnolucci, Leonardo Galteri, Marco Bertini

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03321 2025-03-06 cs.CV cs.AI 81%

See What You Are Told: Visual Attention Sink in Large Multimodal Models

Seil Kang, Jinyeong Kim, Junhyeok Kim, Seong Jae Hwang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20420 2025-03-03 cs.CL cs.CV 81%

Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation

Shaharukh Khan, Ayush Tarun, Ali Faraz, Palash Kamble, Vivek Dahiya, Praveen Pokala, Ashish Kulkarni, Chandra Khatri, Abhinav Ravi, Shubham Agarwal

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Journal ref https://aclanthology.org/2024.wmt-1.80/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14906 2025-02-24 cs.CL cs.AI 81%

Beyond Words: Exploring Cultural Value Sensitivity in Multimodal Models

Srishti Yadav, Zhi Zhang, Daniel Hershcovich, Ekaterina Shutova

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17237 2025-02-20 cs.CV cs.CL 81%

MVAM: Multi-View Attention Method for Fine-grained Image-Text Matching

Wanqing Cui, Rui Cheng, Jiafeng Guo, Xueqi Cheng

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

Comments Published as a conference paper at ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11288 2025-02-18 cs.CL cs.CV 81%

MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models

Shengkang Wang, Hongzhan Lin, Ziyang Luo, Zhen Ye, Guang Chen, Jing Ma

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10642 2025-02-18 cs.AI cs.CV 81%

Demographic User Modeling for Social Robotics with Multimodal Pre-trained Models

Hamed Rahimi, Mouad Abrini, Mahdi Khoramshahi, Mohamed Chetouani

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11403 2025-02-03 cs.CL cs.IR cs.MM 81%

Verifying Cross-modal Entity Consistency in News using Vision-language Models

Sahar Tahmasebi, David Ernst, Eric Müller-Budack, Ralph Ewerth

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CL、cs.MM

Comments Accepted for publication in: European Conference on Information Retrieval (ECIR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17654 2025-01-30 cs.CL cs.AI 81%

Exploring Vision Language Models for Multimodal and Multilingual Stance Detection

Jake Vasilakes, Carolina Scarton, Zhixue Zhao

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Submitted to the International AAAI Conference on Web and Social Media (ICWSM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17759 2024-12-24 cs.AI cs.CV cs.LG 81%

Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy

Priyaranjan Pattnayak, Hitesh Laxmichand Patel, Bhargava Kumar, Amit Agarwal, Ishan Banerjee, Srikant Panda, Tejaswini Kumar

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13702 2024-12-20 cs.CL cs.AI 81%

Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models

Kunat Pipatanakul, Potsawee Manakul, Natapong Nitarach, Warit Sirichotedumrong, Surapon Nonesung, Teetouch Jaknamon, Parinthapat Pengpun, Pittawat Taveekitworachai, Adisai Na-Thalang, Sittipong Sripaisarnmongkol, Krisanapong Jirayoot, Kasima Tharnpipitchai

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments technical report, 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13794 2024-12-19 cs.CL cs.AI cs.CY 81%

MATCHED: Multimodal Authorship-Attribution To Combat Human Trafficking in Escort-Advertisement Data

Vageesh Saxena, Benjamin Bashpole, Gijs Van Dijck, Gerasimos Spanakis

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10707 2024-12-17 cs.CV cs.MM 81%

MambaPro: Multi-Modal Object Re-Identification with Mamba Aggregation and Synergistic Prompt

Yuhao Wang, Xuehu Liu, Tianyu Yan, Yang Liu, Aihua Zheng, Pingping Zhang, Huchuan Lu

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.MM

Comments This work is accepted by AAAI2025. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07979 2024-12-12 cs.LG cs.AI cs.CV 81%

AmCLR: Unified Augmented Learning for Cross-Modal Representations

Ajay Jagannath, Aayush Upadhyay, Anant Mehta

专题命中 图文多模态 :cross-modal(title);multi-modal(abstract);分类 cs.CV、cs.AI

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10839 2024-11-13 cs.CV cs.CL 81%

Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags

Daiqing Qi, Handong Zhao, Zijun Wei, Sheng Li

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Main Conference at EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06872 2024-11-12 cs.CV cs.AI 81%

Multi-Modal interpretable automatic video captioning

Antoine Hanna-Asaad, Decky Aspandi, Titus Zaharia

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17610 2024-10-31 cs.CL cs.CV 81%

ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue

Zhangpu Li, Changhong Zou, Suxue Ma, Zhicheng Yang, Chen Du, Youbao Tang, Zhenjie Cao, Ning Zhang, Jui-Hsin Lai, Ruei-Sung Lin, Yuan Ni, Xingzhi Sun, Jing Xiao, Jieke Hou, Kai Zhang, Mei Han

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14703 2024-10-29 cs.LG cs.CL cs.MM 81%

MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification

Siddhant Bikram Shah, Shuvam Shiwakoti, Maheep Chaudhary, Haohan Wang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM

Comments Accepted to EMNLP 2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16063 2024-10-22 cs.CV cs.AI 81%

Integrated Image-Text Based on Semi-supervised Learning for Small Sample Instance Segmentation

Ruting Chi, Zhiyi Huang, Yuexing Han

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14050 2024-10-21 cs.CL cs.CV cs.CY cs.HC 81%

Learning Multimodal Cues of Children's Uncertainty

Qi Cheng, Mert İnan, Rahma Mbarki, Grace Grmek, Theresa Choi, Yiming Sun, Kimele Persaud, Jenny Wang, Malihe Alikhani

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments SIGDIAL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13733 2024-10-18 cs.CV cs.MM 81%

Improving Multi-modal Large Language Model through Boosting Vision Capabilities

Yanpeng Sun, Huaxin Zhang, Qiang Chen, Xinyu Zhang, Nong Sang, Gang Zhang, Jingdong Wang, Zechao Li

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17894 2024-10-15 cs.CV cs.AI 81%

White-box Multimodal Jailbreaks Against Large Vision-Language Models

Ruofan Wang, Xingjun Ma, Hanxu Zhou, Chuanjun Ji, Guangnan Ye, Yu-Gang Jiang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06682 2024-10-14 cs.CV cs.CL eess.IV 81%

Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization

Changli Tang, Yixuan Li, Yudong Yang, Jimin Zhuang, Guangzhi Sun, Wei Li, Zujun Ma, Chao Zhang

专题命中 图文多模态 :multimodal(title);audio-visual(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08209 2024-10-11 cs.CY cs.CL cs.CV cs.LG 81%

Who's in and who's out? A case study of multimodal CLIP-filtering in DataComp

Rachel Hong, William Agnew, Tadayoshi Kohno, Jamie Morgenstern

专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CV、cs.CL

Comments Content warning: This paper discusses societal stereotypes and sexually-explicit material that may be disturbing, distressing, and/or offensive to the reader

Journal ref Proceedings of the 4th ACM Conference on Equity and Access in Algorithms, Mechanisms, and Optimization (EAAMO 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00226 2024-10-02 cs.CV cs.CL 81%

Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training

Tongkun Su, Jun Li, Xi Zhang, Haibo Jin, Hao Chen, Qiong Wang, Faqin Lv, Baoliang Zhao, Yin Hu

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by MICCAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18346 2024-09-30 cs.CL cs.CV 81%

MultiClimate: Multimodal Stance Detection on Climate Change Videos

Jiawen Wang, Longfei Zuo, Siyao Peng, Barbara Plank

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14899 2024-09-24 cs.CV cs.AI cs.CR cs.LG 81%

Stop Reasoning! When Multimodal LLM with Chain-of-Thought Reasoning Meets Adversarial Image

Zefeng Wang, Zhen Han, Shuo Chen, Fan Xue, Zifeng Ding, Xun Xiao, Volker Tresp, Philip Torr, Jindong Gu

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07078 2024-09-12 cs.CV cs.AI 81%

Multimodal Emotion Recognition with Vision-language Prompting and Modality Dropout

Anbin QI, Zhongliang Liu, Xinyong Zhou, Jinba Xiao, Fengrun Zhang, Qi Gan, Ming Tao, Gaozheng Zhang, Lu Zhang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18799 2024-09-10 cs.CV cs.CL 81%

X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning

Artemis Panagopoulou, Le Xue, Ning Yu, Junnan Li, Dongxu Li, Shafiq Joty, Ran Xu, Silvio Savarese, Caiming Xiong, Juan Carlos Niebles

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02958 2024-09-06 cs.CV cs.AI cs.LG 81%

Multi-Modal Adapter for Vision-Language Models

Dominykas Seputis, Serghei Mihailov, Soham Chatterjee, Zehao Xiao

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏