arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2307.01124 2025-06-23 eess.IV cs.CV 79%

Cross-modality Attention Adapter: A Glioma Segmentation Fine-tuning Method for SAM Using Multimodal Brain MR Images

Xiaoyu Shi, Shurong Chai, Yinhao Li, Jingliang Cheng, Jie Bai, Guohua Zhao, Yen-Wei Chen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18014 2025-06-19 cs.AI 79%

Coupled Mamba: Enhanced Multi-modal Fusion with Coupled State Space Model

Wenbing Li, Hang Zhou, Junqing Yu, Zikai Song, Wei Yang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10794 2025-06-18 cs.CV 79%

Distraction is All You Need for Multimodal Large Language Model Jailbreaking

Zuopeng Yang, Jiluan Fan, Anli Yan, Erdun Gao, Xin Lin, Tao Li, Kanghua Mo, Changyu Dong

机构 * Guangzhou University(广州大学) Shanghai Jiao Tong University(上海交通大学) Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments CVPR 2025 highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13705 2025-06-17 cs.LG cs.AI 79%

TimeMaster: Training Time-Series Multimodal LLMs to Reason via Reinforcement Learning

Junru Zhang, Lang Feng, Xu Guo, Yuhan Wu, Yabo Dong, Duanqing Xu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00942 2025-06-17 cs.CL 79%

Experiential Semantic Information and Brain Alignment: Are Multimodal Models Better than Language Models?

Anna Bavaresco, Raquel Fernández

机构 * Institute for Logic, Language and Computation University of Amsterdam(逻辑、语言与计算研究所 阿姆斯特丹大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to CoNLL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16282 2025-06-16 cs.LG cs.AI 79%

Understanding the Emergence of Multimodal Representation Alignment

Megan Tjandrasuwita, Chanakya Ekbote, Liu Ziyin, Paul Pu Liang

机构 * Massachusetts Institute of Technology, USA(麻省理工学院) NTT Research, USA(NTT研究)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments To appear as a poster in ICML 2025. 21 pages, 22 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11454 2025-06-13 cs.LG cs.AI q-bio.QM 79%

Elucidating the Design Space of Multimodal Protein Language Models

Cheng-Yen Hsieh, Xinyou Wang, Daiheng Zhang, Dongyu Xue, Fei Ye, Shujian Huang, Zaixiang Zheng, Quanquan Gu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments ICML 2025 Spotlight; Project Page: https://bytedance.github.io/dplm/dplm-2.1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08716 2025-06-11 eess.IV cs.CV 79%

Enhancing Synthetic CT from CBCT via Multimodal Fusion: A Study on the Impact of CBCT Quality and Alignment

Maximilian Tschuchnig, Lukas Lamminger, Philipp Steininger, Michael Gadermayr

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) MedPhoton GmbH(MedPhoton公司) University of Salzburg(萨尔茨堡大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments Data is open source. Code will be provided on acceptance. Paper currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07077 2025-06-10 cs.CR cs.AI 79%

Dual-Priv Pruning : Efficient Differential Private Fine-Tuning in Multimodal Large Language Models

Qianshan Wei, Jiaqi Li, Zihan You, Yi Zhan, Kecen Li, Jialin Wu, Xinfeng Li Hengjun Liu, Yi Yu, Bin Cao, Yiwen Xu, Yang Liu, Guilin Qi

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06730 2025-06-10 cs.CR cs.AI 79%

Fuse and Federate: Enhancing EV Charging Station Security with Multimodal Fusion and Federated Learning

Rabah Rahal, Abdelaziz Amara Korba, Yacine Ghamri-Doudane

机构 * Rabah Rahal Networks and Systems Laboratory (LRS), Badji Mokhtar Annaba University, Algeria(拉比·拉尔实验室,巴吉·莫克塔尔安纳巴大学,阿尔及利亚) Abdelaziz Amara korba Networks and Systems Laboratory (LRS), Badji Mokhtar Annaba University, Algeria(阿卜杜勒阿齐兹·阿马拉·科尔巴实验室,巴吉·莫克塔尔安纳巴大学,阿尔及利亚) L3I, University of La Rochelle, France(L3I,拉罗歇尔大学,法国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05890 2025-06-09 cs.CV 79%

Unleashing the Potential of Consistency Learning for Detecting and Grounding Multi-Modal Media Manipulation

Yiheng Li, Yang Yang, Zichang Tan, Huan Liu, Weihua Chen, Xu Zhou, Zhen Lei

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算机辅助研究部) School of Computer Science and Engineering, the Faculty of Innovation Engineering, M.U.S.T(慕斯科技大学计算机科学与工程学院) Sangfor Technologies Inc.(Sangfor技术有限公司) Beijing Jiaotong University(北京交通大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13088 2025-06-09 cs.CV cs.LG 79%

Cross-modal feature fusion for robust point cloud registration with ambiguous geometry

Zhaoyi Wang, Shengyu Huang, Jemil Avers Butt, Yuanzhou Cai, Matej Varga, Andreas Wieser

机构 * ETH Zürich, Institute of Geodesy and Photogrammetry(苏黎世联邦理工学院测绘与摄影测量研究所) Atlas optimization GmbH(Atlas优化公司) University of Zürich(苏黎世大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

Comments To appear in the ISPRS Journal of Photogrammetry and Remote Sensing. 19 pages, 14 figures

Journal ref ISPRS J. Photogramm. Remote Sens. 227 (2025) 31-47

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15334 2025-06-09 cs.CV 79%

Modality-Fair Preference Optimization for Trustworthy MLLM Alignment

Songtao Jiang, Yan Zhang, Ruizhe Chen, Tianxiang Hu, Yeying Jin, Qinglin He, Yang Feng, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动) National University of Singapore(新加坡国立大学) Angelalign Inc., China(中国Angelalign公司)

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07987 2025-06-06 cs.AI 79%

Universal Adversarial Attack on Aligned Multimodal LLMs

Temurbek Rahmatullaev, Polina Druzhinina, Nikita Kurdiukov, Matvey Mikhalchuk, Andrey Kuznetsov, Anton Razzhigaev

机构 * AIRI MSU(莫斯科国立大学) HSE University(俄罗斯高等经济大学) Skoltech(斯克里普钦科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments Added benchmarks, baselines, author, appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03675 2025-06-05 cs.CV 79%

BiXFormer: A Robust Framework for Maximizing Modality Effectiveness in Multi-Modal Semantic Segmentation

Jialei Chen, Xu Zheng, Danda Pani Paudel, Luc Van Gool, Hiroshi Murase, Daisuke Deguchi

机构 * Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科) AI Thrust, The Hong Kong University of Science and Technology(香港科学与技术大学人工智能 thrust) INSAIT, Sofia University(索菲亚大学INSAIT)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01456 2025-06-03 q-bio.GN cs.AI cs.LG q-bio.NC 79%

GenDMR: A dynamic multimodal role-swapping network for identifying risk gene phenotypes

Lina Qin, Cheng Zhu, Chuqi Zhou, Yukun Huang, Jiayi Zhu, Ping Liang, Jinju Wang, Yixing Huang, Cheng Luo, Dezhong Yao, Ying Tan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01097 2025-06-03 cs.CV 79%

Generic Token Compression in Multimodal Large Language Models from an Explainability Perspective

Lei Lei, Jie Gu, Xiaokang Ma, Chu Tang, Jingmin Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) Rightly Robotics(Rightly机器人公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00813 2025-06-03 cs.CV cs.LG 79%

TIME: TabPFN-Integrated Multimodal Engine for Robust Tabular-Image Learning

Jiaqi Luo, Yuan Yuan, Shixin Xu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00466 2025-06-03 eess.AS cs.SD 79%

M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction

Cunhang Fan, Ying Chen, Jian Zhou, Zexu Pan, Jingjing Zhang, Youdian Gao, Xiaoke Yang, Zhengqi Wen, Zhao Lv

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Alibaba group(阿里巴巴集团) Department of Automation, Tsinghua University(清华大学自动化系) Beijing National Research Center for lnformation Science and Technology, Tsinghua University(清华大学信息科学与技术国家研究中心)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 eess.AS

Comments Accepted to IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00365 2025-06-03 cs.CV eess.SP 79%

Feature Fusion and Knowledge-Distilled Multi-Modal Multi-Target Detection

Ngoc Tuyen Do, Tri Nhu Do

机构 * School of Information and Communications, Hanoi University of Science and Technology(信息与通信学院,河内科学技术大学) Telecom Neural Detection Lab, Polytechnique Montréal(电信神经检测实验室,蒙特利尔理工学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23830 2025-06-02 cs.CL 79%

EvoMoE: Expert Evolution in Mixture of Experts for Multimodal Large Language Models

Linglin Jing, Yuting Gao, Zhigang Wang, Wang Lan, Yiwen Tang, Wenhai Wang, Kaipeng Zhang, Qingpei Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Ant Group(蚂蚁集团)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23380 2025-05-30 cs.CV 79%

UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning

Weijia Mao, Zhenheng Yang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(1 显示实验室,新加坡国立大学) ByteDance(2 字节跳动)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10974 2025-05-30 cs.CV eess.IV 79%

Self-Supervised Enhancement of Forward-Looking Sonar Images: Bridging Cross-Modal Degradation Gaps through Feature Space Transformation and Multi-Frame Fusion

Zhisheng Zhang, Peng Zhang, Fengxiang Wang, Liangli Ma, Fuchun Sun

机构 * College of Electronic Engineering, Naval University of Engineering(电子工程学院,海军工程大学) College of Meteorology and Oceanography, National University of Defense Technology(气象海洋学院,国防科技大学) College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05214 2025-05-30 eess.IV cs.CV 79%

Gaussian Random Fields as an Abstract Representation of Patient Metadata for Multimodal Medical Image Segmentation

Bill Cassidy, Christian McBride, Connah Kendrick, Neil D. Reeves, Joseph M. Pappachan, Shaghayegh Raad, Moi Hoon Yap

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20904 2025-05-29 cs.CV 79%

HTMNet: A Hybrid Network with Transformer-Mamba Bottleneck Multimodal Fusion for Transparent and Reflective Objects Depth Completion

Guanghu Xie, Yonglong Zhang, Zhiduo Jiang, Yang Liu, Zongwu Xie, Baoshi Cao, Hong Liu

机构 * State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.02183 2025-05-29 cs.AI cs.HC cs.LG eess.SP 79%

Multimodal sensor fusion in the latent representation space

Robert J. Piechocki, Xiaoyang Wang, Mohammud J. Bocus

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments Under review for Nature Scientific Reports

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19507 2025-05-27 cs.CV cs.LG 79%

Multimodal Machine Translation with Visual Scene Graph Pruning

Chenyu Lu, Shiliang Sun, Jing Zhao, Nan Zhang, Tengfei Song, Hao Yang

机构 * East China Normal University(东华师范大学) Shanghai Jiao Tong University(上海交通大学) Wenzhou University(温州大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11514 2025-05-27 cs.CL 79%

Investigating Inference-time Scaling for Chain of Multi-modal Thought: A Preliminary Study

Yujie Lin, Ante Wang, Moye Chen, Jingyao Liu, Hao Liu, Jinsong Su, Xinyan Xiao

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Baidu Inc., Beijing, China(百度公司) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02810 2025-05-27 cs.LG cs.AI physics.chem-ph q-bio.BM 79%

Mol-LLM: Multimodal Generalist Molecular LLM with Improved Graph Utilization

Chanhui Lee, Hanbum Ko, Yuheon Song, YongJun Jeong, Rodrigo Hormazabal, Sehui Han, Kyunghoon Bae, Sungbin Lim, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Department of Artificial Intelligence, UNIST(UNIST人工智能系) Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院) LG AI Research(LG人工智能研究) Department of Statistics, Korea University(韩国大学统计系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18178 2025-05-27 cs.LG cs.AI 79%

Less is More: Multimodal Region Representation via Pairwise Inter-view Learning

Min Namgung, Yijun Lin, JangHyeon Lee, Yao-Yi Chiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏