arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-18 至 2026-02-18 共收录 45 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 4 篇

2602.15460 2026-02-18 cs.LG cs.CV 74%

On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks

在简单视觉规划任务中多模态大语言模型推理的分布外泛化

Yannic Neuhaus, Nicolas Flammarion, Matthias Hein, Francesco Croce

机构 * Tübingen AI Center -- University of Tübingen(图宾根人工智能中心 -- 图宾根大学) EPFL(瑞士联邦理工学院) ELLIS Institute Finland -- Aalto University(芬兰ELLIS研究所 -- 阿尔托大学)

专题命中 多模态Agent :multimodal(title);分类 cs.CV

AI总结 研究多模态大语言模型在简单视觉规划任务中推理能力的分布外泛化,发现结合多种文本格式的推理方法效果最佳,纯文本模型表现优于图像输入模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15767 2026-02-18 cs.RO cs.AI cs.HC 57%

Robot-Assisted Social Dining as a White Glove Service

机器人辅助社交用餐作为白手套服务

Atharva S Kashyap, Ugne Aleksandra Morkute, Patricia Alves-Oliveira

机构 * University of Michigan(密歇根大学) Leiden University(莱顿大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究通过参与设计和AI工具,提出机器人辅助社交用餐的白手套服务理念,强调多模态输入、情境敏感行为及角色扩展,以提升残疾人在野外社交用餐中的独立性和尊严。

Comments 20 pages, 9 figures. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15294 2026-02-18 cs.AI 57%

EAA: Automating materials characterization with vision language model agents

EAA: 用视觉语言模型代理自动化材料表征

Ming Du, Yanqi Luo, Srutarshi Banerjee, Michael Wojcik, Jelena Popovic, Mathew J. Cherukara

机构 * Argonne National Laboratory(阿贡国家实验室) Advanced Photon Source(先进光子源) Data Science and Learning Division(数据科学与学习 division) Department of Radiation Oncology(放射肿瘤学系) Northwestern University(西北大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 EAA利用视觉语言模型代理自动化材料表征,通过多模态推理和工具增强操作提升显微镜实验效率,减少操作负担并降低用户专业门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 6 篇

2602.15740 2026-02-18 cs.LG cs.AI q-bio.QM 79%

MRC-GAT: A Meta-Relational Copula-Based Graph Attention Network for Interpretable Multimodal Alzheimer's Disease Diagnosis

MRC-GAT:一种基于元关系耦合的图注意力网络用于可解释的多模态阿尔茨海默病诊断

Fatemeh Khalvandi, Saadat Izadi, Abdolah Chalechale

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 MRC-GAT通过元关系耦合和多关系注意力机制,实现多模态阿尔茨海默病诊断的高精度与可解释性。

Comments 27 pages, 10 figures, 10 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00168 2026-02-18 cs.CV 79%

SSL4EO-S12 v1.1: A Multimodal, Multiseasonal Dataset for Pretraining, Updated

SSL4EO-S12 v1.1:一种用于预训练的多模态、多季节数据集,更新版

Benedikt Blumenstiel, Nassim Ait Ali Braham, Conrad M Albrecht, Stefano Maurogiovanni, Paolo Fraccaro

机构 * IBM Research Europe(IBM欧洲研究中心) German Aerospace Center(德国航空航天中心) Julich Supercomputing Centre University of Iceland(朱利奇超级计算中心爱沙尼亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 SSL4EO-S12 v1.1通过增加多模态数据和改进数据结构,为预训练大规模基础模型提供了更高效、更全面的地球观测数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15461 2026-02-18 cs.CV 79%

Emergent Morphing Attack Detection in Open Multi-modal Large Language Models

开放多模态大语言模型中的涌现形变攻击检测

Marija Ivanovska, Vitomir Štruc

机构 * Faculty of Electrical Engineering, University of Ljubljana(卢布尔雅那大学电气工程学院)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出利用开源多模态大语言模型进行零样本人脸形变攻击检测,通过实验表明其在无微调情况下具备优异的判别能力,性能超越传统基线23%。

Comments This manuscript is currently under review at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15346 2026-02-18 cs.CV 79%

Effective and Robust Multimodal Medical Image Analysis

高效且鲁棒的多模态医学图像分析

Joy Dhar, Nayyar Zaidi, Maryam Haghighat

机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔分校) Deakin University(德克萨斯大学) Queensland University of Technology(昆士兰理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MAIL网络,通过高效残差学习和多模态交叉注意力模块,提升多模态医学图像分析的效率与鲁棒性,实现实验性能提升9.34%并降低计算成本78.3%。

Comments Accepted at Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15368 2026-02-18 cs.CV cs.AI cs.LG eess.IV 73%

GMAIL: Generative Modality Alignment for generated Image Learning

GMAIL: 生成模态对齐用于生成图像学习

Shentong Mo, Sukmin Yun

机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系) Department of Machine Learning, MBZUAI, UAE(马斯克大学人工智能研究所) Department of Artificial Intelligence, Hanyang University ERICA, South Korea(翰阳大学ERICA人工智能系)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 GMAIL通过多模态学习方法对齐生成图像与真实图像,提升视觉-语言任务中的生成图像学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14492 2026-02-18 cs.CL cs.IR 57%

Query as Anchor: Scenario-Adaptive User Representation via Large Language Model

查询作为锚点:通过大语言模型实现场景自适应的用户表示

Jiahao Yuan, Yike Xu, Jinyong Wen, Baokun Wang, Ziyi Gao, Xiaotong Lin, Yun Liu, Xing Fu, Yu Cheng, Yongchao Liu, Weiqiang Wang, Zhongle Xie

机构 * Ant Group(蚂蚁集团) East China Normal University(东华大学) Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 通过Query-as-Anchor框架,利用大语言模型实现动态查询感知的用户表示,提升工业级用户建模的场景适应性和性能表现。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 6 篇

2602.15580 2026-02-18 cs.AI 83%

How Vision Becomes Language: A Layer-wise Information-Theoretic Analysis of Multimodal Reasoning

视觉如何转化为语言:多模态推理的逐层信息论分析

Hongxuan Wu, Yukun Zhang, Xueqing Zhou

机构 * Duke kunshan University, Duke University(杜克昆山大学、杜克大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Fudan University, Shanghai, China(复旦大学)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本研究通过逐层信息论分析揭示多模态Transformer中视觉信息如何转化为语言,发现视觉独特信息早期峰值,语言独特信息在晚期层主导预测,跨模态协同较低,且任务依赖性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15769 2026-02-18 cs.CL 79%

ViTaB-A: Evaluating Multimodal Large Language Models on Visual Table Attribution

ViTaB-A:在视觉表格归因上评估多模态大语言模型

Yahia Alqurnawi, Preetom Biswas, Anmol Rao, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 ViTaB-A研究了多模态大语言模型在视觉表格归因中的表现,发现其在证据归因方面存在显著缺陷,影响透明性和可追溯性应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00287 2026-02-18 cs.AI cs.CY 79%

SIGMUS: Semantic Integration for Knowledge Graphs in Multimodal Urban Spaces

SIGMUS:多模态城市空间中知识图谱的语义整合

Brian Wang, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 SIGMUS通过大型语言模型实现多模态城市数据的自动语义整合,构建知识图谱以连接不同数据源与事件关系。

Comments 9 pages, accepted at UrbComp 2025 KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15351 2026-02-18 cs.RO 78%

Feasibility-aware Imitation Learning from Observation with Multimodal Feedback

基于可行性意识的观察模仿学习与多模态反馈

Kei Takahashi, Hikaru Sasaki, Takamitsu Matsubara

机构 * Division of Information Science, Graduate School of Science and Technology, Nara Institute of Science and Technology (NAIST)(信息科学系,科学技术研究生院,科学与技术国立研究所(NAIST))

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 FABCO通过整合基于观察的行为克隆与可行性估计,提升模仿学习性能,使机器人能稳定执行策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19401 2026-02-18 eess.SY cs.SY math.OC 78%

Joint Optimization of Multimodal Transit Frequency and Shared Autonomous Vehicle Fleet Size with Hybrid Metaheuristic and Nonlinear Programming

多模式公共交通频次与混合自动驾驶车队规模的联合优化:混合元启发式与非线性规划

Max T. M. Ng, Hani S. Mahmassani, Draco Tong, Omer Verbas, Taner Cokyasar

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出一种混合优化方法,通过联合优化多模式公共交通频次与SAV车队规模,提升公共交通乘客量33.3%。

Comments 26 pages, 5 figures, accepted for publication in Transportation Research Part C: Emerging Technologies. An earlier version was presented at the Conference on Advanced Systems in Public Transport and TransitData 2025 in Kyoto, Japan on 1 - 4 July 2025

Journal ref Transportation Research Part C: Emerging Technologies, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15303 2026-02-18 cs.IT math.IT math.ST stat.TH 50%

On the Entropy of General Mixture Distributions

一般混合分布熵的研究

Namyoon Lee

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出了一种确定性闭合形式工具包,用于界和准确近似混合熵,通过信息论信道观点将混合熵分解为组件内不确定性与重叠项,并通过成对重叠积分和偏移量修正系统偏差,最终通过裁剪确保估计符合信息论界限。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏