arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-27 至 2026-08-27 共收录 84 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 3 篇

2608.25039 2026-08-27 cs.AI 新提交 57%

LifePlanner: Evaluating LLM Agents for Geo-spatial Planning with Social Media Data

LifePlanner:利用社交媒体数据评估LLM智能体的地理空间规划能力

Zhen Dong, Yuning Peng, Yutao Shi, Lei Zhong, Yongsen Mao, Yuan Liu, Haiping Wang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 该研究推出LifePlanner基准测试,结合社交媒体数据评估LLM智能体的地理空间规划能力,发现前沿LLM在简单检索中表现好但复杂规划通过率仅40.2%,失败源于证据获取、工具使用及约束整合问题,需改进实际规划能力而非单纯扩大模型规模。

Comments 25 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 16 篇

2608.25493 2026-08-27 cs.CV 新提交 90%

SMART: MLLM-guided Temporal Alignment for Unifying Sign Language Recognition and Spotting

SMART:用于统一手语识别与定位的多模态大语言模型(MLLM)引导的时间对齐框架

Eunjee Choi, JungHoon Sung, Seongwhan Cho, Chu Xin, Younggeun Choi

机构 * Dankook University(檀国大学)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);分类 cs.CV

AI总结 本研究提出 MLLM 引导的 SMART 框架,整合多尺度时间适配器与 CSFormer 模块,在四个手语基准数据集上实现了手语识别与定位任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26095 2026-08-27 cs.CV cs.AI 新提交 86%

A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training

面向多模态无监督持续后训练的视觉依赖感知框架

Kaichen Li, Zhilin Zhu, Jianhao Huang, Zhengqin Lai, Baochen Xiong, Zibo Shao, Yaguang Song, Linhui Xiao, Xiaoshan Yang, Changsheng Xu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态无监督持续后训练中现有方法忽略视觉依赖的问题,提出含VC-OT和VMA组件的VDA框架,可同时维持旧任务稳定性与新任务可塑性,经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25140 2026-08-27 cs.CV cs.CL 新提交 85%

RefLAM: A Reference-Grounded Line Annotation Pipeline for Historical Arabic Manuscripts

RefLAM:一种用于历史阿拉伯文手稿的参考依据型行标注流水线

Mohamed Guechaoui, Mohamed Diaa Zellagui, Souleyman Chaib, Sahraoui Dhelim

机构 * Higher School of Computer Science (ESI-SBA)(高等计算机科学学院(ESI-SBA))

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 RefLAM是用于历史阿拉伯文手稿的参考依据型行标注流水线,结合深度学习、MLLM与模糊对齐引擎,可高效生成标注数据,吞吐量较手动标注提升75倍,发布的AraMS-28k可用于HTR模型微调。

Comments 11 pages, 6 figures, 3 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24947 2026-08-27 cs.LG cs.AI 新提交 83%

CAT-GS: Balanced Multimodal Learning via Calibrated Gating and Fusion Surgery

CAT-GS:通过校准门控与融合操作实现平衡多模态学习

Mahir Shahriar Tamim, Sharjil Khan, Md. Samiul Alim, Tanvir Ahmed Khan, Shafin Rahman, Nabeel Mohammed

机构 * North South University(北南大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 CAT-GS是一种无需修改模型的优化控制器,通过校准门控与融合操作解决多模态学习的三种失效模式,在多类基准上提升或匹配多模态准确率,且门控更平稳、融合冲突更少。

Comments This article is accepted with minor revision in Neurocomputing Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24937 2026-08-27 cs.LG cs.AI 新提交 83%

Multi-Modal Anomaly Detection: A Survey

多模态异常检测:一项综述

Xudong Mou, Zexin Wu, Chuan Luo, Shiru Chen, Xudong Liu, Chunming Hu, Renyu Yang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Shandong Inspur Intelligent Production Technology Co., Ltd(山东浪潮智能生产技术有限公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 该综述从假设驱动视角梳理多模态异常检测(MMAD),划分两种互补方法范式,探讨基础模型对MMAD的重塑,汇总基准与评估协议并指出未来方向。

Comments Accepted for publication in IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26326 2026-08-27 cs.CV 版本更新 83%

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

视觉还是认知?多模态大语言模型的视觉上下文敏感性

Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

机构 * University of Copenhagen(哥本哈根大学) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Clemson University(克莱姆森大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10679 2026-08-27 cs.CV 版本更新 83%

Synergistic Modality-and-Slice Memory Framework for Cross-Modal 3D Brain Tumor Segmentation

用于跨模态3D脑肿瘤分割的协同模态与切片记忆框架

Yuxiang Luo, Qing Xu, Hai Huang, Yuqi Ouyang, Xiangjian He, Zhen Chen, Wenting Duan, Jiebo Luo

机构 * Graduate School of Information, Production and Systems, Waseda University, Japan(信息、生产与系统研究生院,早稻田大学,日本) School of Computer Science, University of Lincoln, UK(林肯大学计算机科学学院,英国) University of Nottingham, UK(诺丁汉大学,英国) University of Nottingham Ningbo China, China(宁波诺丁汉大学,中国) College of Electrical Engineering and Information, Northeast Agricultural University, Harbin, China(电气工程与信息学院,东北农业大学,中国) College of Computer Science, Sichuan University, Chengdu, China(计算机科学学院,四川大学,中国) Yale University, New Haven, CT 06510, USA(耶鲁大学,美国) School of Engineering and Physical Science, University of Lincoln, Lincoln LN6 7TS, UK(工程与物理科学学院,林肯大学,英国)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 针对现有跨模态3D脑肿瘤分割方法忽略跨模态相关性、依赖特定类别提示的问题,提出MSM-Seg框架,通过MSMA、MCP-Encoder和MF-Decoder实现精准分割,性能优于现有方法。

Comments Accepted by TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25970 2026-08-27 cs.CV cs.AI 新提交 81%

PANDA - Prototype-Anchored Alignment for Partially Unpaired Multimodal Learning, with Applications to Alzheimers MRI and TCGA Pathology

PANDA——面向部分配对多模态学习的原型锚定对齐方法,及其在阿尔茨海默病MRI与TCGA病理中的应用

Sheethal Bhat, Mahfuzur Rahman Chowdhury, Paula Andrea Perez-Toro, Stephan Wunderlich, Rose Dawn Bharat, Siming Bayer, Andreas Maier

机构 * Friedrich-Alexander-Universität(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学) Klinikum Nürnberg, Paracelsus Medical University(帕拉塞尔苏斯医科大学纽伦堡医院) Ludwig-Maximilians-Universität München(慕尼黑大学) National Institute of Mental Health and Neurosciences (NIMHANS)(国家精神卫生与神经科学研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出PANDA框架,可在推理阶段无辅助输入时将不完整辅助模态的信息迁移至主模态模型,在阿尔茨海默病分类与TCGA生存预测任务中均取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25737 2026-08-27 cs.IR cs.MM 新提交 79%

D3ER: Supporting Multi-Modal Recommendation via Disentangle and Distillation-based Dynamic Ensemble

D3ER:基于解耦与蒸馏的动态集成多模态推荐方法

Bingnan Wang, Yi Li, Xiongxin Tang, Fanjiang Xu, Jiangmeng Li

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.MM

AI总结 该研究针对多模态推荐中同质性与异质性判别信息联合学习的缺陷,提出D3ER方法,引入梯度提升并结合知识蒸馏与全局校正正则化,在真实数据集上验证了其优越性。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25128 2026-08-27 cs.LG cs.AI stat.AP 新提交 79%

When Does Context Routing Help? A Systematic Study of Multi-Modal Fusion in Time Series Forecasting

上下文路由何时有用?时间序列预测中多模态融合的系统研究

Ruizhe Zhou, Gaoyuan Du, Xiaoyang Liu, Haoqi Yao, Deepayan Chakrabarti, Jiating Lin, Yixuan Shen

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校) WorkMagic University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 该研究明确了多模态时间序列预测中辅助上下文有效的两个数据集条件,通过实验证实仅当两条件满足时,文本条件专家调制可显著降低均方误差,且确立了因果关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01990 2026-08-27 cs.LG cs.AI 版本更新 79%

SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning

SAME: 用于多模态持续指令调优的稳定混合专家模型

Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态持续指令调优中专家路由漂移和专家漂移问题,提出稳定混合专家模型(SAME),通过正交子空间分解路由动态和曲率感知缩放更新专家,实现无重放的状态最优性能。

Comments Accepted to ICML 2026. Code is available at https://github.com/LAMDA-CL/Prism

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25773 2026-08-27 cs.LG 新提交 78%

Drift-Aware Multimodal User Representation Learning via Multi-Scale Temporal Modeling and Sparse Mixture-of-Experts

基于多尺度时序建模与稀疏专家混合的感知漂移多模态用户表示学习

Ziqing Qian, Haohang Chen, Shengqi Dang, Yuhan Xiong, Canyu Shen, Jiaying Lei, Nan Cao

机构 * Shanghai Innovation Institute(上海创新研究院) Tongji University(同济大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对社交媒体用户兴趣漂移问题,提出DUMoE框架,通过时序动态感知骨干与稀疏MoE兴趣适配器实现多模态用户表示学习,在两类预测任务上优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26000 2026-08-27 eess.SP cs.LG q-bio.QM 新提交 71%

CardioFusion-AI: Robust ECG--PPG Fusion for Multimodal Physiological Monitoring Under Signal Degradation

CardioFusion-AI:信号退化下用于多模态生理监测的鲁棒心电图-光电容积脉搏波融合方法

Navaneetha Krishnan Kamalakannan, Janakiraman Kamalakannan

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 本研究提出 CardioFusion-AI 框架,通过信号处理前端与自适应融合策略,在多模态生理信号退化场景下实现鲁棒监测,验证了其在不同退化条件下的性能表现。

Comments 7 pages, 4 figures. Under review at IEEE Journal of Biomedical and Health Informatics. Code: https://github.com/ka-cyber/CardioFusion-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25251 2026-08-27 cs.CV cs.AI 新提交 62%

What Do Medical Vision-Language Models Learn in Radiology? Transfer, Alignment, and Source-Proxy Leakage Under Distribution Shift

医学视觉-语言模型在放射学中学到了什么?分布偏移下的迁移、对齐与源代理泄露

Ayoub Louaye Bouaziz, Lokmane Chebouba, Yassine Himeur

机构 * University of Constantine(康斯坦丁大学) University of Dubai(迪拜大学) University of Western Brittany(西布列塔尼大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对医学视觉-语言模型在分布偏移下的失效问题,探究其跨数据集迁移、多模态对齐及源代理泄露特性,发现表观能力掩盖相关失效模式,推动对该类模型的压力测试评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25741 2026-08-27 cs.LG cs.CL 新提交 57%

Why Does Graph Learning Fail to Fully Benefit from a Text Teacher?

为何图学习无法充分受益于文本教师?

Fumiaki Kimino, Ryoma Sato

机构 * SOKENDAI(总研究大学院大学) National Institute of Informatics(情报学研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 该研究针对结合自监督GNN与交替优化语言模型的多模态图学习模型未充分提升性能的问题,分析了六个关键影响因素并通过分阶段实验验证。

Comments 21 pages, 1 figure, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24978 2026-08-27 cs.LG 新提交 50%

MSR-IVA: Masked Structural Residual Independent Vector Analysis for State-Aware Fusion of Structural MRI and Dynamic Functional Network Connectivity

MSR-IVA:用于结构MRI与动态功能连接状态感知融合的 masked 结构残差独立向量分析

Victor Solomon, Zening Fu, Rafal Angryk, Vince D. Calhoun, Jingyu Liu

机构 * Georgia State University(佐治亚州立大学) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 该研究针对sMRI与dFNC融合时IVA方法的缺陷,提出MSR-IVA框架,在ADNI队列实验中提升匹配源耦合、降低非匹配依赖,实现受控结构共享以适配状态差异。

Comments Accepted at the 2026 IEEE International Workshop on Machine Learning for Signal Processing (MLSP 2026), Atlanta, GA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 7 篇

2606.17118 2026-08-27 cs.LG cs.AI 版本更新 83%

MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化

Yuanteng Chen, Nanxin Zeng, Peisong Wang, Zhilei Liu, Yuantian Shao, Shiqiang Lang, Tao Liu, Chuangyi Li, Qinghao Hu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对MoE多模态大语言模型在专家重要性估计中存在的跨模态和视觉内偏差,提出模态分解的专家级混合精度量化框架MODE,通过分解选择频率、过滤冗余视觉令牌并评估模态敏感性,在给定预算下分配比特宽度,在W3A16下平均性能损失控制在2.9%以内。

Comments 19 pages, 8 figures

Journal ref The 2026 Conference on Empirical Methods in Natural Language Processing, Main Conference (EMNLP 2026 Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18359 2026-08-27 cs.CV 版本更新 83%

RAVE: Re-Allocating Visual Attention in Large Multimodal Models

RAVE: 重新分配大型多模态模型中的视觉注意力

Xi Leng, Xinhong Ma, Ziqiang Dong, Feng Zhang, Xiaoying Tang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴文勤业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing Institute of Technology(北京理工大学)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对大型多模态模型中标准注意力机制存在的跨模态误分配和视觉内不平衡问题,提出轻量级成对门控机制RAVE,通过学习查询-键偏置重新分配视觉注意力,在多个多模态基准上平均提升3个百分点,尤其对感知密集型任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25261 2026-08-27 cs.AI cs.CV 新提交 81%

Hierarchical MoE for Multi-Modal ILD Diagnosis

用于多模态间质性肺疾病诊断的分层混合专家模型

Alec K. Peltekian, Gorkem Durak, Halil Ertugrul Aktas, Carrie Lynn Richardson, Mary Carns, Kathleen Aren, GR Scott Budinger, Anthony J. Esposito, Alexander Misharin, Alok Nidhi Choudhary, Ankit Agrawal, Ulas Bagci

机构 * Northwestern University(西北大学) Northwestern University Feinberg School of Medicine(西北大学费恩伯格医学院) Simpson Querrey Lung Institute for Translational Science(辛普森奎雷转化科学肺研究所)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出分层多模态MoE模型,融合预训练影像专家与EHR,在ILD分类患者级交叉验证中AUC达0.8750±0.0443,优于REN和SwinUNETR,且提升了可解释性。

Comments 11 pages, 2 figures

Journal ref MICCAI Machine Learning in Medical Imaging (MLMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25467 2026-08-27 cs.LG 新提交 78%

Resolving Multi-Modal Regression by Difference-Quotient-Based Clustering:Fast Coarse Conditional-Label Assignment

基于差商聚类的多模态回归解决方法:快速粗粒度条件标签分配

Huang Weiquan

机构 * Guangdong Polytechnic Normal University(广东技术师范大学)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract)

AI总结 针对多模态回归的均值崩溃问题,提出差商聚类(DQC)方法,通过最小化簇内差异分配标签,在合成基准上取得优于随机标签和均值崩溃的最小平方误差,为后续生成优化减轻负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25883 2026-08-27 nucl-th nucl-ex 新提交 50%

Evidence for Quartet Binding of Valence Neutrons in $^8$He

^8He价中子四体重合的证据

Young-Ho Song, Yuan-Zhuo Ma, Dean Lee

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究通过Daejeon16无芯壳模型计算的分波分析和密度累积量,证实^8He的四个价中子存在四体重合,其结合源于^1S_0配对与^3P_2吸引的协同作用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26016 2026-08-27 cond-mat.mtrl-sci 新提交 50%

Bayesian Optimization for Self-Driving Materials Laboratories: From Algorithms to Physics-Informed Workflows

面向自主材料实验室的贝叶斯优化:从算法到物理信息驱动的工作流程

Yuki K. Wakabayashi, Takuma Otsuka

专题命中 其他多模态 :multimodal(abstract)

AI总结 该综述针对材料自主实验室的实际挑战,介绍贝叶斯优化算法及物理信息驱动的贝叶斯优化,总结其在多类材料领域的应用成果,并展望其未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13048 2026-08-27 cs.RO 版本更新 50%

Multi-Touch and Bending Sensing Using Electrical Impedance Tomography for Robotics

面向机器人的基于电阻抗断层成像(EIT)的多点触控与弯曲感知

Haofeng Chen, Bedrich Himmel, Bin Li, Xiaojie Wang, Matej Hoffmann

机构 * Department of Cybernetics, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克技术大学布拉格分校电子学系) Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(合肥物理科学研究院智能机器研究所)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文针对机器人EIT触觉传感器弯曲时信号解读复杂的问题,提出集成深度神经网络与动态自适应参考策略的感知框架,实现了精准的弯曲角度估计与触控状态区分,为柔性EIT机器人皮肤奠定基础。

Journal ref Chen, H.; Himmel, B.; Li, B.; Wang, X. & Hoffmann, M. (2026), 'Multi-Touch and Bending Sensing Using Electrical Impedance Tomography for Robotics', IEEE Robotics and Automation Letters 11(8), 9851-9858

详情

展开后加载摘要…

URL PDF HTML 收藏