arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2501.07496 2025-03-17 cs.CV 79%

Aligning First, Then Fusing: A Novel Weakly Supervised Multimodal Violence Detection Method

Wenping Jin, Li Zhu, Jing Sun

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10057 2025-03-14 cs.CV 79%

Multi-Modal Mamba Modeling for Survival Prediction (M4Survive): Adapting Joint Foundation Model Representations

Ho Hin Lee, Alberto Santamaria-Pang, Jameson Merkov, Matthew Lungren, Ivan Tarapov

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04851 2025-03-14 cs.CV 79%

AdaptiveFusion: Adaptive Multi-Modal Multi-View Fusion for 3D Human Body Reconstruction

Anjun Chen, Xiangyu Wang, Zhi Xu, Kun Shi, Yan Qin, Yuchi Huo, Jiming Chen, Qi Ye

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

Comments TMM 2025, Project Page: https://chen3110.github.io/adaptivefusion/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01131 2025-03-14 cs.CV 79%

M2IST: Multi-Modal Interactive Side-Tuning for Efficient Referring Expression Comprehension

Xuyang Liu, Ting Liu, Siteng Huang, Yi Xin, Yue Hu, Quanjun Yin, Donglin Wang, Yuanyuan Wu, Honggang Chen

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08726 2025-03-13 cs.LG cs.AI eess.SP 79%

SIMAC: A Semantic-Driven Integrated Multimodal Sensing And Communication Framework

Yubo Peng, Luping Xiang, Kun Yang, Feibo Jiang, Kezhi Wang, Dapeng Oliver Wu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08461 2025-03-12 cs.MM cs.DC 79%

FastCache: Optimizing Multimodal LLM Serving through Lightweight KV-Cache Compression Framework

Jianian Zhu, Hang Wu, Haojie Wang, Yinghui Li, Biao Hou, Ruixuan Li, Jidong Zhai

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.MM

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08092 2025-03-12 cs.CV 79%

SparseVoxFormer: Sparse Voxel-based Transformer for Multi-modal 3D Object Detection

Hyeongseok Son, Jia He, Seung-In Park, Ying Min, Yunhao Zhang, ByungIn Yoo

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07655 2025-03-12 cs.LG cs.AI 79%

GraphT5: Unified Molecular Graph-Language Modeling via Multi-Modal Cross-Token Attention

Sangyeup Kim, Nayeon Kim, Yinhua Piao, Sun Kim

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07636 2025-03-12 cs.LG cs.AI 79%

An Optimization Algorithm for Multimodal Data Alignment

Wei Zhang, Xinyue Wang, Lan Yu, Shi Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments ACL SRW submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06945 2025-03-11 eess.IV cs.CV 79%

Dynamic Cross-Modal Feature Interaction Network for Hyperspectral and LiDAR Data Classification

Junyan Lin, Feng Gap, Lin Qi, Junyu Dong, Qian Du, Xinbo Gao

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

Comments Accepted by IEEE TGRS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06141 2025-03-11 cs.CV 79%

Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model

Mingxing Li, Rui Wang, Lei Sun, Yancheng Bai, Xiangxiang Chu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04444 2025-03-07 cs.CV 79%

ToFu: Visual Tokens Reduction via Fusion for Multi-modal, Multi-patch, Multi-image Task

Vittorio Pippi, Matthieu Guillaumin, Silvia Cascianelli, Rita Cucchiara, Maximilian Jaritz, Loris Bazzani

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00299 2025-03-07 cs.CV 79%

GSPR: Multimodal Place Recognition Using 3D Gaussian Splatting for Autonomous Driving

Zhangshuo Qi, Junyi Ma, Jingyi Xu, Zijie Zhou, Luqi Cheng, Guangming Xiong

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03280 2025-03-06 cs.CV 79%

BEVMOSNet: Multimodal Fusion for BEV Moving Object Segmentation

Hiep Truong Cong, Ajay Kumar Sigatapu, Arindam Das, Yashwanth Sharma, Venkatesh Satagopan, Ganesh Sistu, Ciaran Eising

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments In Proceedings of the 20th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02221 2025-03-05 cs.AI 79%

Attention Bootstrapping for Multi-Modal Test-Time Adaptation

Yusheng Zhao, Junyu Luo, Xiao Luo, Jinsheng Huang, Jingyang Yuan, Zhiping Xiao, Ming Zhang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02702 2025-03-05 cs.CV 79%

VoxelNextFusion: A Simple, Unified and Effective Voxel Fusion Framework for Multi-Modal 3D Object Detection

Ziying Song, Guoxin Zhang, Jun Xie, Lin Liu, Caiyan Jia, Shaoqing Xu, Zhepeng Wang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 61, 2023, pp. 1-12

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01654 2025-03-04 cs.CV 79%

A Shared Encoder Approach to Multimodal Representation Learning

Shuvendu Roy, Franklin Ogidi, Ali Etemad, Elham Dolatabadi, Arash Afkanpour

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01022 2025-03-04 cond-mat.mtrl-sci cs.AI cs.LG 79%

LLM-Fusion: A Novel Multimodal Fusion Model for Accelerated Material Discovery

Onur Boyar, Indra Priyadarsini, Seiji Takeda, Lisa Hamada

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments 4 pages, presented at AAAI 2025 Workshop on AI to Accelerating Science and Engineering (AI2ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00364 2025-03-04 cs.CV 79%

CFSum: A Transformer-Based Multi-Modal Video Summarization Framework With Coarse-Fine Fusion

Yaowei Guo, Jiazheng Xing, Xiaojun Hou, Shuo Xin, Juntao Jiang, Demetri Terzopoulos, Chenfanfu Jiang, Yong Liu

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20077 2025-03-03 cs.CV 79%

SegLocNet: Multimodal Localization Network for Autonomous Driving via Bird's-Eye-View Segmentation

Zijie Zhou, Zhangshuo Qi, Luqi Cheng, Guangming Xiong

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04916 2025-02-28 cs.CV 79%

Completed Feature Disentanglement Learning for Multimodal MRIs Analysis

Tianling Liu, Hongying Liu, Fanhua Shang, Lequan Yu, Tong Han, Liang Wan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments Accept by IEEE JBHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17900 2025-02-26 cs.LG cs.AI 79%

Knowledge-enhanced Multimodal ECG Representation Learning with Arbitrary-Lead Inputs

Che Liu, Cheng Ouyang, Zhongwei Wan, Haozhe Wang, Wenjia Bai, Rossella Arcucci

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17524 2025-02-26 eess.SP cs.AI cs.LG 79%

Multimodal Bearing Fault Classification Under Variable Conditions: A 1D CNN with Transfer Learning

Tasfiq E. Alam, Md Manjurul Ahsan, Shivakumar Raman

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00321 2025-02-25 cs.IR cs.AI 79%

MIM: Multi-modal Content Interest Modeling Paradigm for User Behavior Modeling

Bencheng Yan, Si Chen, Shichang Jia, Jianyu Liu, Yueran Liu, Chenghan Fu, Wanxian Guan, Hui Zhao, Xiang Zhang, Kai Zhang, Wenbo Su, Pengjie Wang, Jian Xu, Bo Zheng, Baolin Liu

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15542 2025-02-24 cs.IR cs.AI 79%

Bridging Domain Gaps between Pretrained Multimodal Models and Recommendations

Wenyu Zhang, Jie Luo, Xinming Zhang, Yuan Fang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15740 2025-02-24 cs.CV cs.RO 79%

MambaPlace:Text-to-Point-Cloud Cross-Modal Place Recognition with Attention Mamba Mechanisms

Tianyi Shang, Zhenyu Li, Pengjie Xu, Jinwei Qiao

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12478 2025-02-19 cs.CL 79%

MSE-Adapter: A Lightweight Plugin Endowing LLMs with the Capability to Perform Multimodal Sentiment Analysis and Emotion Recognition

Yang Yang, Xunde Dong, Yupeng Qiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15208 2025-02-18 cs.CV cs.LG cs.RO 79%

OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving

Shuo Xing, Chengyuan Qian, Yuping Wang, Hongyuan Hua, Kexin Tian, Yang Zhou, Zhengzhong Tu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments The 3rd WACV Workshop on Large Language and Vision Models for Autonomous Driving (LLVM-AD) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15981 2025-02-13 cs.CV cs.LG 79%

Robust Visual Representation Learning with Multi-modal Prior Knowledge for Image Classification Under Distribution Shift

Hongkuan Zhou, Lavdim Halilaj, Sebastian Monka, Stefan Schmid, Yuqicheng Zhu, Bo Xiong, Steffen Staab

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01162 2025-02-13 cs.CV 79%

Sparsity Meets Similarity: Leveraging Long-Tail Distribution for Dynamic Optimized Token Representation in Multimodal Large Language Models

Gaotong Yu, Yi Chen, Jian Xu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏