arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-16 至 2026-02-16 共收录 51 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 12 篇

2505.23381 2026-02-16 cs.AI 83%

AutoGPS: Automated Geometry Problem Solving via Multimodal Formalization and Deductive Reasoning

AutoGPS: 通过多模态形式化和演绎推理实现自动几何问题求解

Bowen Ping, Minnan Luo, Zhuohang Dang, Chenxi Wang, Chengyou Jia

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 AutoGPS通过多模态形式化和演绎推理解决几何问题,提供可靠且可解释的解决方案

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19176 2026-02-16 eess.IV cs.AI cs.CV 81%

Augmented Intelligence for Multimodal Virtual Biopsy in Breast Cancer Using Generative Artificial Intelligence

增强智能用于乳腺癌多模态虚拟活检的生成式人工智能

Aurora Rofena, Claudia Lucia Piccolo, Bruno Beomonte Zobel, Paolo Soda, Valerio Guarrasi

机构 * Department of Radiology, Fondazione Policlinico Campus Bio-Medico(放射学系,政策临床医学院) Department of Radiology, Università Campus Bio-Medico di Roma(放射学系,罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅拉大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于生成式人工智能的多模态虚拟活检方法,整合FFDM和CESM模态以提高乳腺病变分类准确性,并公开数据集促进研究进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12877 2026-02-16 cs.CV 79%

RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads

RoadscapesQA: 一个用于印度道路视觉问答的多任务、多模态数据集

Vijayasri Iyer, Maahin Rathinagiriswaran, Jyothikamalesh S

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 RoadscapesQA数据集通过多任务多模态方法,为印度道路场景的视觉问答提供支持,包含9000张图像及手动标注的边界框,用于提升无结构环境下的视觉场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10374 2026-02-16 cs.CV 79%

Class Balancing Diversity Multimodal Ensemble for Alzheimer's Disease Diagnosis and Early Detection

类平衡多样性多模态集成用于阿尔茨海默病诊断和早期检测

Arianna Francesconi, Lazzaro di Biase, Donato Cappetta, Fabio Rebecchi, Paolo Soda, Rosa Sicilia, Valerio Guarrasi

机构 * Unit of Computer Systems and Bioinformatics, Department of Engineering, Università Campus Bio-Medico di Roma(计算机系统与生物信息学单位,工程系,罗马生物医学大学) Operative Research Unit of Neurology, Fondazione Policlinico Universitario Campus Bio-Medico(神经学操作研究单位,大学医学研究院生物医学 Campus) Eustema S.p.A., Research and Development Centre(Eustema 公司,研发中心) Department of Diagnostic and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入部门,辐射物理,生物医学工程,乌梅大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出IMBALMED方法,通过多模态数据和类平衡技术提升阿尔茨海默病的诊断和早期检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12919 2026-02-16 cs.CV cs.AI cs.NE 73%

EPRBench: A High-Quality Benchmark Dataset for Event Stream Based Visual Place Recognition

EPRBench: 一种高质量的基于事件流的视觉位置识别基准数据集

Xiao Wang, Xingxing Xiong, Jinfeng Gao, Xufeng Lou, Bo Jiang, Si-bao Chen, Yaowei Wang, Yonghong Tian

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) School of Computer Science, Peking University(北京大学计算机科学学院) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 EPRBench提出了一种高质量的基于事件流的视觉位置识别基准数据集,结合LLM生成场景描述与多模态融合方法,提升位置识别的准确性和模型透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10168 2026-02-16 q-bio.QM cs.AI cs.LG 70%

EVA: Towards a universal model of the immune system

EVA:朝着免疫系统通用模型迈进

Scienta Team, Ethan Bandasack, Vincent Bouget, Apolline Bruley, Yannis Cattan, Charlotte Claye, Matthew Corney, Julien Duquesne, Karim El Kanbi, Aziz Fouché, Pierre Marschall, Francesco Strozzi

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 EVA是首个跨物种多模态免疫学基础模型,通过整合转录组和组织学数据,提升免疫疾病研究的转化应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12395 2026-02-16 cs.CV cs.AI 62%

What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis

强化学习在视觉推理中提升了什么?一种弗兰肯斯坦式分析

Xirui Li, Ming Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过弗兰肯斯坦式分析框架,揭示强化学习在视觉推理中通过中到晚期变压器计算的系统性细化,改进了视觉到推理的对齐和推理性能,而非单纯的视觉感知增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12533 2026-02-16 cs.LG 50%

AMPS: Adaptive Modality Preference Steering via Functional Entropy

AMPS: 通过功能熵实现自适应模态偏好引导

Zihan Huang, Xintong Li, Rohan Surana, Tong Yu, Rui Wang, Julian McAuley, Jingbo Shang, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究)

专题命中 多模态评测 :multimodal(abstract)

AI总结 AMPS通过实例感知的诊断度量和可学习模块,实现对多模态大语言模型模态偏好的自适应引导,有效调节偏好并降低生成错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 1 篇

2602.12565 2026-02-16 cs.HC 50%

GatheringSense: AI-Generated Imagery and Embodied Experiences for Understanding Literati Gatherings

GatheringSense: 基于人工智能生成影像与具身体验的文人聚会理解

You Zhou, Bingyuan Wang, Hongcheng Guo, Rui Cao, Zeyu Wang

专题命中 多模态Agent :multimodal(abstract)

AI总结 GatheringSense通过AI生成影像与具身体验相结合,探索文人聚会的文化理解与共鸣,提出双路径框架并提供设计启示。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 10 篇

2509.25889 2026-02-16 cs.CV cs.CL 84%

Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI

多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答

Arvind Murari Vepa, Yannan Yu, Jingru Gan, Anthony Cuturrufo, Michael F. Romano, Weikai Li, Fabien Scalzo, Wei Wang, Yizhou Sun

机构 * UCLA Computer Science(UCLA计算机科学系) UCSF Radiology(UCSF放射学) UCLA Medicine(UCLA医学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12618 2026-02-16 cs.CV cs.AI cs.CL 82%

Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models

通过注意力驱动的自我压缩进行视觉标记减少以提高高效多模态大语言模型的效率

Omer Faruk Deniz, Ruiyu Mao, Ruochen Li, Yapeng Tian, Latifur Khan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 通过注意力驱动的自我压缩方法,有效减少多模态大语言模型中的视觉标记,提升计算效率并保持模型性能。

Comments 2025 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03262 2026-02-16 cs.CV cs.AI 81%

Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders

探究多模态大语言模型中多个视觉编码器的冗余性

Yizhou Wang, Song Mao, Yang Chen, Yufan Shen, Yinqiao Yan, Pinlong Cai, Ding Wang, Guohang Yan, Zhi Yu, Xuming Hu, Botian Shi

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型中多个视觉编码器的冗余性,通过分析发现编码器的专业化、冗余性和有害性,并提出了量化冗余的指标,为更高效的多模态架构设计提供依据。

Comments accepted by ICLR2026, project website: https://github.com/MaoSong2022/Encoder-Redundancy

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02467 2026-02-16 cs.CV cs.AI 81%

Timing Is Everything: Finding the Optimal Fusion Points in Multimodal Medical Imaging

时机至关重要:在多模态医学影像中寻找最佳融合点

Valerio Guarrasi, Klara Mogensen, Sara Tassinari, Sara Qvarlander, Paolo Soda

机构 * Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入系,生物医学工程与放射物理,乌梅大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种顺序前进搜索算法,用于高效确定多模态医学影像中最佳融合时机,提升诊断准确性并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08567 2026-02-16 cs.CL cs.AI 81%

CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference

CATP:用于保持准确性的多模态模型推理中的交叉注意力标记修剪

Ruqi Liao, Chuqing Zhao, Jin Li, Weiqi Feng, Yi Lyu, Bingxian Chen, Haochen Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 CATP通过交叉注意力层优化标记修剪,显著提升多模态模型推理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12108 2026-02-16 cs.SI cs.AI cs.CY cs.HC cs.LG 79%

Multimodal Coordinated Online Behavior: Trade-offs and Strategies

多模态协调在线行为:权衡与策略

Lorenzo Mannocci, Stefano Cresci, Matteo Magnani, Anna Monreale, Maurizio Tesconi

机构 * University of Pisa(比萨大学) Institute for Informatics and Telematics, National Research Council (IIT-CNR)(信息学与电信学研究院,国家研究理事会(IIT-CNR)) InfoLab, Department of Information Technology, Uppsala University(信息实验室,信息科技系,乌普萨拉大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究探讨多模态协调在线行为的权衡与策略,通过比较不同方法揭示多模态分析在捕捉协调行为结构方面的优势。

Comments Postprint of the article published in the Information Sciences journal. Please, cite accordingly

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04884 2026-02-16 cs.CL cs.CV cs.LG 73%

Reinforced Attention Learning

强化注意力学习

Bangzheng Li, Jianmo Ni, Chen Qu, Ian Miao, Liu Yang, Xingyu Fu, Muhao Chen, Derek Zhiyuan Cheng

机构 * UC Davis(加州大学戴维斯分校) Google(谷歌) DeepMind(深Mind) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 强化注意力学习通过优化内部注意力分布提升多模态模型的感知能力,实验显示其在多模态后期训练中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12441 2026-02-16 cs.CV 70%

Prototype-driven fusion of pathology and spatial transcriptomics for interpretable survival prediction

基于病理学和空间转录组的原型驱动融合用于可解释的生存预测

Lihe Liu, Xiaoxi Pan, Yinyin Yuan, Lulu Shang

机构 * Department of Biostatistics, MD Anderson Cancer Center(生物统计学系,MD安德森癌症中心) Department of Translational Molecular Pathology, MD Anderson Cancer Center(转化分子病理学系,MD安德森癌症中心) The Institute for Data Science in Oncology (IDSO), MD Anderson Cancer Center(肿瘤学数据科学研究所(IDSO),MD安德森癌症中心)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 PathoSpatial通过整合病理学和空间转录组数据,实现可解释的生存预测,提升多模态学习的可解释性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17822 2026-02-16 cs.CV 57%

Easy-Poly: An Easy Polyhedral Framework For 3D Multi-Object Tracking

Easy-Poly: 一种易于使用的多目标跟踪三维多目标跟踪框架

Peng Zhang, Xin Li, Xin Lin, Liang He

机构 * East China Normal University(东华师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 Easy-Poly提出了一种基于过滤的三维多目标跟踪框架,通过四个创新方法提升小目标检测和跟踪精度,实现实时高性能表现。

Comments 8 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12532 2026-02-16 cs.RO 50%

CRAFT: Adapting VLA Models to Contact-rich Manipulation via Force-aware Curriculum Fine-tuning

CRAFT: 通过力感知的课程微调适应接触密集的操纵

Yike Zhang, Yaonan Wang, Xinxin Sun, Kaizhen Huang, Zhiyuan Xu, Junjie Ji, Zhengping Che, Jian Tang, Jingtao Sun

机构 * National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 CRAFT通过力感知课程微调提升机器人在接触密集任务中的表现,实现稳健且可推广的操纵能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 2 篇

2602.05687 2026-02-16 cs.HC cs.AI 57%

Exploring AI-Augmented Sensemaking of Patient-Generated Health Data: A Mixed-Method Study with Healthcare Professionals in Cardiac Risk Reduction

探索人工智能增强的患者生成健康数据理解:一项结合定性与定量方法的医疗专业人员研究,用于心脏风险降低

Pavithren V S Pakianathan, Rania Islambouli, Diogo Branco, Albrecht Schmidt, Tiago Guerreiro, Jan David Smeddinck

机构 * Ludwig Boltzmann Institute for Digital Health and Prevention(数字健康与预防路德维希·玻尔兹曼研究所)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型如何通过自动摘要和对话界面支持医疗专业人员理解患者生成的健康数据,以提高心脏疾病风险降低的临床决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12923 2026-02-16 stat.ML cs.LG 50%

Annealing in variational inference mitigates mode collapse: A theoretical study on Gaussian mixtures

变分推断中的退火缓解模式崩溃:关于高斯混合物的理论研究

Luigi Fogliani, Bruno Loureiro, Marylou Gabrié

机构 * Departement d’Informatique, École Normale Supérieure, Université PSL, CNRS(信息学院,巴黎高等师范学院,巴黎理工大学,CNRS) Laboratoire de Physique de l’École Normale Supérieure, Université PSL, CNRS(巴黎高等师范学院物理实验室,巴黎理工大学,CNRS)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文通过理论分析证明退火策略能有效缓解变分推断中的模式崩溃问题,并验证其在神经网络模型中的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏