arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2504.15619 2025-04-23 cs.CV 79%

AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization

Jinda Lu, Jinghan Li, Yuan Gao, Junkang Wu, Jiancan Wu, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10150 2025-04-23 cs.IR cs.MM 79%

HistLLM: A Unified Framework for LLM-Based Multimodal Recommendation with User History Encoding and Compression

Chen Zhang, Bo Hu, Weidong Chen, Zhendong Mao

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

Comments We want to withdraw this paper and revise its experimental details. The revised version will be uploaded after further verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07677 2025-04-23 cs.RO cs.CV 79%

Localization Meets Uncertainty: Uncertainty-Aware Multi-Modal Localization

Hye-Min Won, Jieun Lee, Jiyong Oh

机构 * Polaris3D

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14847 2025-04-22 cs.CV 79%

Reliable Multi-Modal Object Re-Identification via Modality-Aware Graph Reasoning

Xixi Wan, Aihua Zheng, Zi Wang, Bo Jiang, Jin Tang, Jixin Ma

机构 * Information Materials and Intelligent Sensing Laboratory of Anhui Province(安徽省信息材料与智能传感实验室) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能省级重点实验室) School(学校)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13319 2025-04-22 cs.CV cs.LG eess.IV 79%

HyperFusion: A Hypernetwork Approach to Multimodal Integration of Tabular and Medical Imaging Data for Predictive Modeling

Daniel Duenias, Brennan Nichyporuk, Tal Arbel, Tammy Riklin Raviv

机构 * Ben Gurion University of the Negev(本· Gurion 大学) Centre for Intelligent Machines, McGill University(智能机器中心,麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments 20 pages, 11 figures

Journal ref Medical Image Analysis, Volume 102, May 2025, 103503

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15379 2025-04-22 cs.CL 79%

DualKanbaFormer: An Efficient Selective Sparse Framework for Multimodal Aspect-based Sentiment Analysis

Adamu Lawan, Juhua Pu, Haruna Yunusa, Muhammad Lawan, Aliyu Umar, Adamu Sani Yahya, Mahmoud Basi

机构 * School of Computer Science and Technology, Beihang University, Beijing, China(北京航空航天大学计算机科学与技术学院) School of Automation Science and Electrical Engineering, Beihang University, Beijing, China(北京航空航天大学自动化科学与电气工程学院) School of Computing, University of Portsmouth, Portsmouth, UK(普利茅斯大学计算机学院) Department of Information and Communication Technology, Federal University, Gusau, Nigeria(加兹阿大学信息与通信技术系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

Comments 12 pages, 2 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19950 2025-04-17 cs.LG cs.AI 79%

Multimodal Lego: Model Merging and Fine-Tuning Across Topologies and Modalities in Biomedicine

Konstantin Hemker, Nikola Simidjievski, Mateja Jamnik

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11262 2025-04-16 cs.CV 79%

Enhanced Small Target Detection via Multi-Modal Fusion and Attention Mechanisms: A YOLOv5 Approach

Xiaoxiao Ma, Junxiong Tong

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted by ATC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10985 2025-04-16 cs.CV 79%

DMPT: Decoupled Modality-aware Prompt Tuning for Multi-modal Object Re-identification

Minghui Lin, Shu Wang, Xiang Wang, Jianhua Tang, Longbin Fu, Zhengrong Zuo, Nong Sang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

Comments 2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09197 2025-04-15 cs.AI 79%

Graph Learning-Driven Multi-Vessel Association: Fusing Multimodal Data for Maritime Intelligence

Yuxu Lu, Kaisen Yang, Dong Yang, Haifeng Ding, Jinxian Weng, Ryan Wen Liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09106 2025-04-15 cs.CV 79%

Multi-modal and Multi-view Fundus Image Fusion for Retinopathy Diagnosis via Multi-scale Cross-attention and Shifted Window Self-attention

Yonghao Huang, Leiting Chen, Chuan Zhou

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14496 2025-04-15 cs.CV 79%

WikiStyle+: A Multimodal Approach to Content-Style Representation Disentanglement for Artistic Image Stylization

Ma Zhuoqi, Zhang Yixuan, You Zejun, Tian Long, Liu Xiyang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07300 2025-04-09 cs.LG cs.CL 79%

CALF: Aligning LLMs for Time Series Forecasting via Cross-modal Fine-Tuning

Peiyuan Liu, Hang Guo, Tao Dai, Naiqi Li, Jigang Bao, Xudong Ren, Yong Jiang, Shu-Tao Xia

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13659 2025-04-08 cs.CV 79%

LMFNet: An Efficient Multimodal Fusion Approach for Semantic Segmentation in High-Resolution Remote Sensing

Tong Wang, Guanzhou Chen, Xiaodong Zhang, Chenxi Liu, Xiaoliang Tan, Jiaqi Wang, Chanjuan He, Wenlin Zhou

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11223 2025-04-07 cs.CV 79%

Multimodal Attention-Enhanced Feature Fusion-based Weekly Supervised Anomaly Violence Detection

Yuta Kaneko, Abu Saleh Musa Miah, Najmul Hassan, Hyoun-Sup Lee, Si-Woong Jang, Jungpil Shin

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Journal ref IEEE Open Journal of the Computer Society, vol. 6, pp. 129-140, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19776 2025-04-01 cs.CV 79%

Resilient Sensor Fusion under Adverse Sensor Failures via Multi-Modal Expert Fusion

Konyul Park, Yecheol Kim, Daehun Kim, Jun Won Choi

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17426 2025-04-01 cs.LG cs.AI cs.CR cs.ET 79%

Enhanced Smart Contract Reputability Analysis using Multimodal Data Fusion on Ethereum

Cyrus Malik, Josef Bajada, Joshua Ellul

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21367 2025-03-28 cs.CV 79%

Multimodal surface defect detection from wooden logs for sawing optimization

Bořek Reich, Matej Kunda, Fedor Zolotarev, Tuomas Eerola, Pavel Zemčík, Tomi Kauppi

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21124 2025-03-28 cs.CV 79%

AdaMHF: Adaptive Multimodal Hierarchical Fusion for Survival Prediction

Shuaiyu Zhang, Xun Lin, Rongxiang Zhang, Yu Bai, Yong Xu, Tao Tan, Xunbin Zheng, Zitong Yu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20190 2025-03-27 cs.CV 79%

Cross-Modal Prototype Allocation: Unsupervised Slide Representation Learning via Patch-Text Contrast in Computational Pathology

Yuxuan Chen, Jiawen Li, Jiali Hu, Xitong Ling, Tian Guan, Anjia Han, Yonghong He

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

Comments 11pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20011 2025-03-27 cs.CV cs.RO 79%

Hyperdimensional Uncertainty Quantification for Multimodal Uncertainty Fusion in Autonomous Vehicles Perception

Luke Chen, Junyao Wang, Trier Mortlock, Pramod Khargonekar, Mohammad Abdullah Al Faruque

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08497 2025-03-27 cs.LG cs.CV 79%

MMRL: Multi-Modal Representation Learning for Vision-Language Models

Yuncheng Guo, Xiaodong Gu

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10636 2025-03-25 cs.LG cs.AI 79%

Adapt-$\infty$: Scalable Continual Multimodal Instruction Tuning via Dynamic Data Selection

Adyasha Maharana, Jaehong Yoon, Tianlong Chen, Mohit Bansal

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments First two authors contributed equally. Code: https://github.com/adymaharana/adapt-inf

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17337 2025-03-25 cs.CV 79%

Neural-MCRL: Neural Multimodal Contrastive Representation Learning for EEG-based Visual Decoding

Yueyang Li, Zijian Kang, Shengyu Gong, Wenhao Dong, Weiming Zeng, Hongjie Yan, Wai Ting Siok, Nizhuan Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16467 2025-03-24 cs.HC cs.AI cs.RO 79%

Enhancing Explainability with Multimodal Context Representations for Smarter Robots

Anargh Viswanath, Lokesh Veeramacheneni, Hendrik Buschmeier

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments Presented at 3rd Workshop on Explainability in Human-Robot Collaboration at HRI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21982 2025-03-24 cs.CV 79%

A Survey on RGB, 3D, and Multimodal Approaches for Unsupervised Industrial Image Anomaly Detection

Yuxuan Lin, Yang Chang, Xuan Tong, Jiawen Yu, Antonio Liotta, Guofan Huang, Wei Song, Deyu Zeng, Zongze Wu, Yan Wang, Wenqiang Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15022 2025-03-20 cs.CV 79%

xMOD: Cross-Modal Distillation for 2D/3D Multi-Object Discovery from 2D motion

Saad Lahlali, Sandra Kara, Hejer Ammar, Florian Chabot, Nicolas Granger, Hervé Le Borgne, Quoc-Cuong Pham

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13814 2025-03-19 cs.CV 79%

FusDreamer: Label-efficient Remote Sensing World Model for Multimodal Data Classification

Jinping Wang, Weiwei Song, Hao Chen, Jinchang Ren, Huimin Zhao

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09496 2025-03-19 cs.CV 79%

Robust Multimodal Survival Prediction with the Latent Differentiation Conditional Variational AutoEncoder

Junjie Zhou, Jiao Tang, Yingli Zuo, Peng Wan, Daoqiang Zhang, Wei Shao

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11347 2025-03-18 cs.CV 79%

EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Guankun Wang, Long Bai, Junyi Wang, Kun Yuan, Zhen Li, Tianxu Jiang, Xiting He, Jinlin Wu, Zhen Chen, Zhen Lei, Hongbin Liu, Jiazheng Wang, Fan Zhang, Nicolas Padoy, Nassir Navab, Hongliang Ren

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏