arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-16 至 2026-02-16 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2509.25889 2026-02-16 cs.CV cs.CL 84%

Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI

多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答

Arvind Murari Vepa, Yannan Yu, Jingru Gan, Anthony Cuturrufo, Michael F. Romano, Weikai Li, Fabien Scalzo, Wei Wang, Yizhou Sun

机构 * UCLA Computer Science(UCLA计算机科学系) UCSF Radiology(UCSF放射学) UCLA Medicine(UCLA医学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12618 2026-02-16 cs.CV cs.AI cs.CL 82%

Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models

通过注意力驱动的自我压缩进行视觉标记减少以提高高效多模态大语言模型的效率

Omer Faruk Deniz, Ruiyu Mao, Ruochen Li, Yapeng Tian, Latifur Khan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 通过注意力驱动的自我压缩方法,有效减少多模态大语言模型中的视觉标记,提升计算效率并保持模型性能。

Comments 2025 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03262 2026-02-16 cs.CV cs.AI 81%

Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders

探究多模态大语言模型中多个视觉编码器的冗余性

Yizhou Wang, Song Mao, Yang Chen, Yufan Shen, Yinqiao Yan, Pinlong Cai, Ding Wang, Guohang Yan, Zhi Yu, Xuming Hu, Botian Shi

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型中多个视觉编码器的冗余性,通过分析发现编码器的专业化、冗余性和有害性,并提出了量化冗余的指标,为更高效的多模态架构设计提供依据。

Comments accepted by ICLR2026, project website: https://github.com/MaoSong2022/Encoder-Redundancy

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02467 2026-02-16 cs.CV cs.AI 81%

Timing Is Everything: Finding the Optimal Fusion Points in Multimodal Medical Imaging

时机至关重要:在多模态医学影像中寻找最佳融合点

Valerio Guarrasi, Klara Mogensen, Sara Tassinari, Sara Qvarlander, Paolo Soda

机构 * Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入系,生物医学工程与放射物理,乌梅大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种顺序前进搜索算法,用于高效确定多模态医学影像中最佳融合时机,提升诊断准确性并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08567 2026-02-16 cs.CL cs.AI 81%

CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference

CATP:用于保持准确性的多模态模型推理中的交叉注意力标记修剪

Ruqi Liao, Chuqing Zhao, Jin Li, Weiqi Feng, Yi Lyu, Bingxian Chen, Haochen Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 CATP通过交叉注意力层优化标记修剪,显著提升多模态模型推理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12108 2026-02-16 cs.SI cs.AI cs.CY cs.HC cs.LG 79%

Multimodal Coordinated Online Behavior: Trade-offs and Strategies

多模态协调在线行为:权衡与策略

Lorenzo Mannocci, Stefano Cresci, Matteo Magnani, Anna Monreale, Maurizio Tesconi

机构 * University of Pisa(比萨大学) Institute for Informatics and Telematics, National Research Council (IIT-CNR)(信息学与电信学研究院,国家研究理事会(IIT-CNR)) InfoLab, Department of Information Technology, Uppsala University(信息实验室,信息科技系,乌普萨拉大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究探讨多模态协调在线行为的权衡与策略,通过比较不同方法揭示多模态分析在捕捉协调行为结构方面的优势。

Comments Postprint of the article published in the Information Sciences journal. Please, cite accordingly

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04884 2026-02-16 cs.CL cs.CV cs.LG 73%

Reinforced Attention Learning

强化注意力学习

Bangzheng Li, Jianmo Ni, Chen Qu, Ian Miao, Liu Yang, Xingyu Fu, Muhao Chen, Derek Zhiyuan Cheng

机构 * UC Davis(加州大学戴维斯分校) Google(谷歌) DeepMind(深Mind) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 强化注意力学习通过优化内部注意力分布提升多模态模型的感知能力,实验显示其在多模态后期训练中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12441 2026-02-16 cs.CV 70%

Prototype-driven fusion of pathology and spatial transcriptomics for interpretable survival prediction

基于病理学和空间转录组的原型驱动融合用于可解释的生存预测

Lihe Liu, Xiaoxi Pan, Yinyin Yuan, Lulu Shang

机构 * Department of Biostatistics, MD Anderson Cancer Center(生物统计学系,MD安德森癌症中心) Department of Translational Molecular Pathology, MD Anderson Cancer Center(转化分子病理学系,MD安德森癌症中心) The Institute for Data Science in Oncology (IDSO), MD Anderson Cancer Center(肿瘤学数据科学研究所(IDSO),MD安德森癌症中心)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 PathoSpatial通过整合病理学和空间转录组数据,实现可解释的生存预测,提升多模态学习的可解释性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17822 2026-02-16 cs.CV 57%

Easy-Poly: An Easy Polyhedral Framework For 3D Multi-Object Tracking

Easy-Poly: 一种易于使用的多目标跟踪三维多目标跟踪框架

Peng Zhang, Xin Li, Xin Lin, Liang He

机构 * East China Normal University(东华师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 Easy-Poly提出了一种基于过滤的三维多目标跟踪框架,通过四个创新方法提升小目标检测和跟踪精度,实现实时高性能表现。

Comments 8 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12532 2026-02-16 cs.RO 50%

CRAFT: Adapting VLA Models to Contact-rich Manipulation via Force-aware Curriculum Fine-tuning

CRAFT: 通过力感知的课程微调适应接触密集的操纵

Yike Zhang, Yaonan Wang, Xinxin Sun, Kaizhen Huang, Zhiyuan Xu, Junjie Ji, Zhengping Che, Jian Tang, Jingtao Sun

机构 * National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 CRAFT通过力感知课程微调提升机器人在接触密集任务中的表现,实现稳健且可推广的操纵能力。

详情

展开后加载摘要…

URL PDF HTML 收藏