arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-26 至 2026-01-26 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2509.23927 2026-01-26 cs.CV 88%

FUSAR-KLIP: Towards Multimodal Foundation Models for Remote Sensing

FUSAR-KLIP:迈向遥感多模态基础模型

Yi Yang, Xiaokun Zhang, Qingchen Fang, Jing Liu, Ziqi Ye, Rui Li, Li Liu, Haipeng Wang

机构 * Key Laboratory for Information Science of Electromagnetic Waves (MoE), Fudan University(电磁波信息科学重点实验室(MoE),复旦大学) Institute of Zhejiang Laboratory(浙江实验室研究院) College of Electronic Science and Technology, NUDT(电子科学与技术学院,南大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);cross-modal(abstract);分类 cs.CV

AI总结 FUSAR-KLIP是首个针对SAR图像的多模态基础模型,通过构建大规模数据集、生成结构化文本、设计自洽优化机制和建立统一评估基准,解决遥感图像与通用视觉表示之间的认知不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09867 2026-01-26 cs.CV cs.AI cs.CL 85%

Hierarchy-Aware Multimodal Unlearning for Medical AI

层次感知的多模态反遗忘用于医疗AI

Fengli Wu, Vaidehi Patil, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MedForget提出一个层次感知的多模态反遗忘基准和CHIP方法,有效解决医疗数据中层次结构的遗忘问题,同时保持下游效用。

Comments Dataset and Code: https://github.com/fengli-wu/MedForget

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16520 2026-01-26 cs.CV cs.AI cs.CL 82%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16348 2026-01-26 cs.CV 79%

Coarse-to-Fine Non-rigid Multi-modal Image Registration for Historical Panel Paintings based on Crack Structures

基于裂缝结构的粗到细非刚性多模态图像配准用于历史面板绘画

Aline Sindel, Andreas Maier, Vincent Christlein

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃朗根-纽伦堡大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于裂缝结构的粗到细非刚性多模态图像配准方法,利用稀疏关键点和薄板样条实现高精度的历史面板绘画图像配准。

Comments Preprint, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13680 2026-01-26 cs.CL cs.LG 79%

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

VMMU:一个多任务多模态理解和推理基准

Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

机构 * KAIST(韩国科学技术院) MBZUAI(慕布扎伊大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 VMMU是一个评估视觉语言模型在非英语环境下多模态理解和推理能力的基准,通过2500个多模态问题测试模型对视觉和文本信息的整合与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16811 2026-01-26 cs.CV cs.AI 76%

Incorporating Eye-Tracking Signals Into Multimodal Deep Visual Models For Predicting User Aesthetic Experience In Residential Interiors

将眼动信号纳入多模态深度视觉模型以预测住宅内部空间的用户审美体验

Chen-Ying Chien, Po-Chih Kuo

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本研究提出双分支CNN-LSTM模型,融合眼动信号与视觉数据,提升对住宅室内空间审美体验的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11139 2026-01-26 cs.LG cs.AI cs.SC 74%

ViSymRe: Vision Multimodal Symbolic Regression

ViSymRe:视觉多模态符号回归

Da Li, Junping Yin, Jin Xu, Xinxin Li, Juan Zhang

机构 * Academy for Advanced Interdisciplinary Studies, Northeast Normal University(先进跨学科研究院,东北师范大学) Institute of Artificial Intelligence, Beihang University(人工智能研究院,北航) Institute of Applied Physics and Computational Mathematics(应用物理与计算数学研究院) National Key Laboratory of Computational Physics(计算物理国家重点实验室) School of Mathematical Sciences, East China Normal University(数学科学学院,华东师范大学) Shanghai Zhangjiang Institute of Mathematics(上海张江数学研究所)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 ViSymRe通过引入视觉模态提升基于Transformer的符号回归性能,采用多视图随机切片技术解决高维场景下的训练难题,实现高效且稳定的模型收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04744 2026-01-26 cs.SD cs.CL eess.AS 62%

WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning

WildScore: 多模态符号音乐推理在现实中的基准测试

Gagan Mundada, Yash Vishe, Amit Namburi, Xin Xu, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 WildScore是首个用于评估多模态大语言模型在现实世界中符号音乐推理能力的基准测试,通过真实音乐作品和用户生成问题,系统性评估模型在音乐学分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16970 2026-01-26 math.OC cs.AI 57%

BONO-Bench: A Comprehensive Test Suite for Bi-objective Numerical Optimization with Traceable Pareto Sets

BONO-Bench:面向双目标数值优化的综合性测试套件及其可追溯的帕累托集

Lennart Schäpermeier, Pascal Kerschke

机构 * University of Münster(穆斯特大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 BONO-Bench通过生成双目标数值优化问题,提供可追溯的帕累托集,支持可配置的测试问题属性,促进多目标优化的可重复基准测试。

Comments Accepted for publication in the Special Issue on Benchmarking in Multi-Criteria Optimization at ACM TELO

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16549 2026-01-26 cs.AI 57%

LLM is Not All You Need: A Systematic Evaluation of ML vs. Foundation Models for text and image based Medical Classification

LLM并非万能:对ML与基础模型在文本和图像医学分类中的系统评估

Meet Raval, Tejul Pandit, Dhvani Upadhyay

机构 * University of Southern California Los Angeles, USA(美国南加州大学) Dhirubhani Ambani University Gandhinagar, India(印度达尔布哈尼·阿班尼大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文系统评估了ML与基础模型在医学分类中的表现,发现传统ML模型在多数任务中表现优异,而PEFT方法的效果依赖于适应策略。

Comments 9 pages, 5 figures, 3 tables, paper accepted in AAIML'26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16295 2026-01-26 stat.CO 50%

Understanding uncertainty in Bayesian cluster analysis

理解贝叶斯聚类分析中的不确定性

Cecilia Balocchi, Sara Wade

专题命中 多模态评测 :multimodal(abstract)

AI总结 WASABI通过多聚类估计近似后验分布,提升贝叶斯聚类分析中对不确定性的理解,尤其在聚类不明显或模型不恰当时表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏