arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6918 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6918 篇

2403.06832 2025-01-16 cs.CL cs.AI 81%

Noise-powered Multi-modal Knowledge Graph Representation Framework

Zhuo Chen, Yin Fang, Yichi Zhang, Lingbing Guo, Jiaoyan Chen, Jeff Z. Pan, Huajun Chen, Wen Zhang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CL、cs.AI

Comments COLING 2025 Accepted, Repo is available at https://github.com/zjukg/SNAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07746 2025-01-15 cs.SI cs.CL cs.CV 81%

A Heterogeneous Multimodal Graph Learning Framework for Recognizing User Emotions in Social Networks

Sree Bhattacharyya, Shuhua Yang, James Z. Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07542 2025-01-14 cs.CL cs.CV cs.LG 81%

Imagine while Reasoning in Space: Multimodal Visualization-of-Thought

Chengzu Li, Wenshan Wu, Huanyu Zhang, Yan Xia, Shaoguang Mao, Li Dong, Ivan Vulić, Furu Wei

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 11 pages, 6 figures, 4 tables (27 pages, 10 figures, 16 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07110 2025-01-14 cs.CV cs.IR cs.MM 81%

Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation

Han Liu, Yinwei Wei, Fan Liu, Wenjie Wang, Liqiang Nie, Tat-Seng Chua

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

Comments This paper has been accepted by ACM Transactions on Information Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09792 2025-01-14 cs.CV cs.CL 81%

Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models

Yifan Li, Hangyu Guo, Kun Zhou, Wayne Xin Zhao, Ji-Rong Wen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments ECCV 2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02699 2025-01-07 cs.CV cs.AI 81%

EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models

Andrés Villa, Juan León Alcázar, Motasem Alfarra, Vladimir Araujo, Alvaro Soto, Bernard Ghanem

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01611 2025-01-06 cs.CV cs.AI 81%

Google is all you need: Semi-Supervised Transfer Learning Strategy For Light Multimodal Multi-Task Classification Model

Haixu Liu, Penghao Jiang, Zerui Tao

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00365 2024-12-31 cs.AI cs.CV eess.IV 81%

Multimodal Fusion and Coherence Modeling for Video Topic Segmentation

Hai Yu, Chong Deng, Qinglin Zhang, Jiaqing Liu, Qian Chen, Wen Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07012 2024-12-31 cs.CV cs.AI 81%

ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models

Jieyu Zhang, Le Xue, Linxin Song, Jun Wang, Weikai Huang, Manli Shu, An Yan, Zixian Ma, Juan Carlos Niebles, Silvio Savarese, Caiming Xiong, Zeyuan Chen, Ranjay Krishna, Ran Xu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments code: https://github.com/JieyuZ2/ProVision dataset: https://huggingface.co/datasets/Salesforce/ProVision-10M

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18076 2024-12-25 cs.CV cs.AI 81%

COMO: Cross-Mamba Interaction and Offset-Guided Fusion for Multimodal Object Detection

Chang Liu, Xin Ma, Xiaochen Yang, Yuxiang Zhang, Yanni Dong

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09817 2024-12-16 cs.CV cs.CL 81%

Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation

Xiaofeng Zhang, Fanshuo Zeng, Yihao Quan, Zheng Hui, Jiawei Yao

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08169 2024-12-12 cs.CV cs.CL 81%

Illusory VQA: Benchmarking and Enhancing Multimodal Models on Visual Illusions

Mohammadmostafa Rostamkhani, Baktash Ansari, Hoorieh Sabzevari, Farzan Rahmani, Sauleh Eetemadi

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03467 2024-12-05 cs.CV cs.AI 81%

Training-Free Mitigation of Language Reasoning Degradation After Multimodal Instruction Tuning

Neale Ratzlaff, Man Luo, Xin Su, Vasudev Lal, Phillip Howard

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08027 2024-12-05 cs.CV cs.AI cs.LG q-bio.QM 81%

SurvMamba: State Space Model with Multi-grained Multi-modal Interaction for Survival Prediction

Ying Chen, Jiajing Xie, Yuxiang Lin, Yuhang Song, Wenxian Yang, Rongshan Yu

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17593 2024-12-03 cs.CL cs.AI cs.LG 81%

What Differentiates Educational Literature? A Multimodal Fusion Approach of Transformers and Computational Linguistics

Jordan J. Bird

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15446 2024-11-26 cs.CV cs.AI 81%

freePruner: A Training-free Approach for Large Multimodal Model Acceleration

Bingxin Xu, Yuzhang Shang, Yunhao Ge, Qian Lou, Yan Yan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13036 2024-11-21 cs.CV cs.AI 81%

Unsupervised Homography Estimation on Multimodal Image Pair via Alternating Optimization

Sanghyeob Song, Jaihyun Lew, Hyemi Jang, Sungroh Yoon

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments This paper is accepted to the Thirty-Eighth Annual Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11799 2024-11-19 eess.IV cs.AI cs.CV 81%

Edge-Enhanced Dilated Residual Attention Network for Multimodal Medical Image Fusion

Meng Zhou, Yuxuan Zhang, Xiaolan Xu, Jiayi Wang, Farzad Khalvati

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments An extended version of the paper accepted at IEEE BIBM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10060 2024-11-18 cs.MM cs.CL 81%

CMATH: Cross-Modality Augmented Transformer with Hierarchical Variational Distillation for Multimodal Emotion Recognition in Conversation

Xiaofei Zhu, Jiawei Cheng, Zhou Yang, Zhuo Chen, Qingyang Wang, Jianfeng Yao

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10032 2024-11-18 cs.CV cs.AI 81%

VMID: A Multimodal Fusion LLM Framework for Detecting and Identifying Misinformation of Short Videos

Weihao Zhong, Yinhao Xiao, Minghui Xu, Xiuzhen Cheng

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments arXiv admin note: text overlap with arXiv:2211.10973 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02793 2024-11-06 cs.CL cs.CV 81%

Toward Robust Incomplete Multimodal Sentiment Analysis via Hierarchical Representation Learning

Mingcheng Li, Dingkang Yang, Yang Liu, Shunli Wang, Jiawei Chen, Shuaibing Wang, Jinjie Wei, Yue Jiang, Qingyao Xu, Xiaolu Hou, Mingyang Sun, Ziyun Qian, Dongliang Kou, Lihua Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00822 2024-11-05 cs.CV cs.AI cs.HC 81%

EEG-based Multimodal Representation Learning for Emotion Recognition

Kang Yin, Hye-Bin Shin, Dan Li, Seong-Whan Lee

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11161 2024-11-05 cs.AI cs.MM 81%

Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning

Zebang Cheng, Zhi-Qi Cheng, Jun-Yan He, Jingdong Sun, Kai Wang, Yuxiang Lin, Zheng Lian, Xiaojiang Peng, Alexander Hauptmann

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI、cs.MM

Comments Accepted at NeurIPS 2024. 49 pages, 13 figures, Project: https://github.com/ZebangCheng/Emotion-LLaMA, Demo: https://huggingface.co/spaces/ZebangCheng/Emotion-LLaMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23822 2024-11-01 cs.CV cs.AI 81%

Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding

Jinlong He, Pengfei Li, Gang Liu, Shenjun Zhong

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15657 2024-10-31 cs.AI cs.CL cs.LG 81%

M$^2$PT: Multimodal Prompt Tuning for Zero-shot Instruction Learning

Taowen Wang, Yiyang Liu, James Chenhao Liang, junhan zhao, Yiming Cui, Yuning Mao, Shaoliang Nie, Jiahao Liu, Fuli Feng, Zenglin Xu, Cheng Han, Lifu Huang, Qifan Wang, Dongfang Liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04125 2024-10-30 cs.CV cs.CL cs.LG 81%

No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance

Vishaal Udandarao, Ameya Prabhu, Adhiraj Ghosh, Yash Sharma, Philip H. S. Torr, Adel Bibi, Samuel Albanie, Matthias Bethge

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Short version accepted at DPFM, ICLR'24; Full paper at NeurIPS'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15591 2024-10-22 cs.CL cs.AI 81%

AMPLE: Emotion-Aware Multimodal Fusion Prompt Learning for Fake News Detection

Xiaoman Xu, Xiangrun Li, Taihang Wang, Ye Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07167 2024-10-17 cs.CV cs.CL 81%

Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate

Qidong Huang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin, Weiming Zhang, Nenghai Yu

专题命中 多模态训练与对齐 :cross-modal(title);multi-modal(abstract);分类 cs.CV、cs.CL

Comments Project page: https://github.com/shikiw/Modality-Integration-Rate

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10923 2024-10-16 cs.LG cs.AI cs.CV 81%

ATLAS: Adapter-Based Multi-Modal Continual Learning with a Two-Stage Learning Strategy

Hong Li, Zhiquan Tan, Xingyu Li, Weiran Huang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07268 2024-10-11 cs.CV cs.AI 81%

Learning Content-Aware Multi-Modal Joint Input Pruning via Bird's-Eye-View Representation

Yuxin Li, Yiheng Li, Xulei Yang, Mengying Yu, Zihang Huang, Xiaojun Wu, Chai Kiat Yeo

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏