arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-27 至 2026-01-27 共收录 21 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 21 篇

2601.17814 2026-01-27 cs.AI 83%

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11178 2026-01-27 cs.CV cs.CY 83%

BLEnD-Vis: Benchmarking Multimodal Cultural Understanding in Vision Language Models

BLEnD-Vis: 评估视觉语言模型在多模态文化理解中的基准测试

Bryan Chen Zhengyu Tan, Zheng Weihua, Zhengyuan Liu, Nancy F. Chen, Hwaran Lee, Kenny Tsu Wei Choo, Roy Ka-Wei Lee

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 BLEnD-Vis通过多模态文化基准测试评估视觉语言模型在语言重述和视觉模态下的文化理解稳健性,揭示当前模型在文化知识上的脆弱性,并指导更文化胜任的模型发展。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09327 2026-01-27 cs.CV 83%

MSSDF: Modality-Shared Self-supervised Distillation for High-Resolution Multi-modal Remote Sensing Image Learning

MSSDF:多模态自监督蒸馏用于高分辨率遥感图像学习

Tong Wang, Guanzhou Chen, Xiaodong Zhang, Chenxi Liu, Jiaqi Wang, Xiaoliang Tan, Wenchao Guo, Qingyuan Yang, Kaiqi Zhang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学) Electronic Information School, Wuhan University(电子信息学院,武汉大学)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MSSDF通过多模态自监督学习提升高分辨率遥感图像的预训练效果,优于现有方法,尤其在语义分割和深度估计任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14019 2026-01-27 cs.CV eess.SP stat.AP 83%

A Multimodal Feature Distillation with Mamba-Transformer Network for Brain Tumor Segmentation with Incomplete Modalities

一种结合Mamba-Transformer网络的多模态特征蒸馏用于缺失模态的脑肿瘤分割

Ming Kang, Fung Fung Ting, Shier Nee Saw, Raphaël C. -W. Phan, Zongyuan Ge, Chee-Ming Ting

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种结合Mamba-Transformer网络的多模态特征蒸馏方法,用于在缺失模态情况下实现更准确的脑肿瘤分割。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15552 2026-01-27 cs.CL cs.AI cs.CV 82%

Multimodal Evaluation of Russian-language Architectures

多模态评估框架MERA Multi对俄语架构的评估

Artem Chervyakov, Ulyana Isaeva, Anton Emelyanov, Artem Safin, Maria Tikhonova, Alexander Kharitonov, Yulia Lyakh, Petr Surovtsev, Denis Shevelev, Vildan Saburov, Vasily Konovalov, Elisei Rykov, Ivan Sviridov, Amina Miftakhova, Ilseyar Alimova, Alexander Panchenko, Alexander Kapitanov, Alena Fenogenova

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MERA Multi框架,用于评估俄语多模态架构,包含18个新任务和统一的评估方法,旨在解决俄语多模态基准缺失的问题。

Comments EACL main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20298 2026-01-27 cs.CL cs.AI cs.CV 82%

MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding

MangaVQA和MangaLMM:多模态漫画理解的基准和专用模型

Jeonghun Baek, Kazuki Egashira, Shota Onohara, Atsuyuki Miyai, Yuki Imajuku, Hikaru Ikuta, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MangaVQA和MangaLMM,用于多模态漫画理解的基准和专用模型,通过视觉问答和文本识别任务提升漫画叙事理解能力。

Comments EACL 2026 Findings. Project page: https://manga109.github.io/MangaVQA_LMM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13968 2026-01-27 cs.CV cs.AI cs.CL 82%

RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation

RotBench: 对多模态大语言模型识别图像旋转能力的评估

Tianyi Niu, Jaemin Cho, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学夏洛特分校) Allen Institute for Artificial Intelligence(人工智能研究院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 RotBench评估了多模态大语言模型在识别图像旋转角度方面的性能,发现大多数模型难以区分90°和270°旋转,但能识别0°和180°图像,揭示了模型空间推理能力与人类的差距。

Comments EACL 2026 Camera-Ready. Code and data: https://github.com/tianyiniu/RotBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18464 2026-01-27 cs.CV cs.AI 81%

Fair-Eye Net: A Fair, Trustworthy, Multimodal Integrated Glaucoma Full Chain AI System

Fair-Eye Net:一种公平、可信的多模态集成青光眼全流程人工智能系统

Wenbin Wei, Suyuan Yao, Cheng Huang, Xiangyu Gao

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Fair-Eye Net通过多模态融合和公平性优化,实现青光眼全流程AI系统,提升诊断准确性与公平性,助力全球眼科健康公平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18250 2026-01-27 cs.CV cs.AI 81%

A multimodal vision foundation model for generalizable knee pathology

一种用于通用膝部病理的多模态视觉基础模型

Kang Yu, Dingyu Wang, Zimu Yuan, Nan Zhou, Jiajun Liu, Jiaxin Liu, Shanggui Liu, Yaoyan Zheng, Huishu Yuan, Di Huang, Dong Jiang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 OrthoFoundation是一种多模态视觉基础模型,通过自监督学习在膝关节影像上实现高泛化能力,提升骨科影像诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08235 2026-01-27 cs.AI cs.CL 81%

MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents

MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准

Shouju Wang, Haopeng Zhang

机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18493 2026-01-27 cs.CV 79%

DisasterInsight: A Multimodal Benchmark for Function-Aware and Grounded Disaster Assessment

DisasterInsight: 一种多模态基准,用于功能感知和基于事实的灾害评估

Sara Tehrani, Yonghao Xu, Leif Haglund, Amanda Berg, Michael Felsberg

机构 * Computer Vision Laboratory, Linköping University, Sweden(林奈大学计算机视觉实验室) Vantor, Linköping, Sweden(林奈瑞典)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DisasterInsight提出一种多模态基准,用于评估视觉-语言模型在灾害分析任务中的性能,通过DI-Chat模型在损害识别和报告生成方面取得显著提升。

Comments Under review at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18346 2026-01-27 cs.CV 79%

Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception

Q-Bench-Portrait:多模态大语言模型在肖像图像质量感知上的基准测试

Sijing Wu, Yunhao Li, Zicheng Zhang, Qi Jia, Xinyue Li, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Q-Bench-Portrait首次提出用于评估多模态大语言模型在肖像图像质量感知上的能力,包含2765个三元组,涵盖多种图像来源和质量维度,评估20个模型后发现其表现有限,与人类判断存在差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17571 2026-01-27 eess.SP cs.CV cs.LG 79%

ME-WARD: A multimodal ergonomic analysis tool for musculoskeletal risk assessment from inertial and video data in working plac

ME-WARD:一种多模态人体工学分析工具,用于从惯性与视频数据中评估肌肉骨骼风险

Javier González-Alonso, Paula Martín-Tapia, David González-Ortega, Míriam Antón-Rodríguez, Francisco Javier Díaz-Pernas, Mario Martínez-Zarzuela

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ME-WARD是一种多模态工具,利用惯性和视频数据评估人体工学风险,通过整合多种运动捕捉技术提供可靠且经济的解决方案。

Comments 19 pages

Journal ref Expert Systems With Applications 278 (2025) 127212

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17916 2026-01-27 cs.LG 78%

UniPACT: A Multimodal Framework for Prognostic Question Answering on Raw ECG and Structured EHR

UniPACT:一种多模态框架,用于基于原始ECG和结构化EHR的预后问题回答

Jialu Tang, Tong Xia, Yuan Lu, Aaqib Saeed

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 UniPACT通过多模态融合和结构化提示机制,实现对ECG和EHR的预后问题回答,取得优异的AUROC性能。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17102 2026-01-27 q-bio.QM 78%

Domain-Aware Geometric Multimodal Learning for Multi-Domain Protein-Ligand Affinity Prediction

领域感知的几何多模态学习用于多领域蛋白质-配体亲和力预测

Shuo Zhang, Jian K. Liu

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 DAGML通过领域感知的几何多模态学习框架,有效提升多领域蛋白质-配体亲和力预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17191 2026-01-27 cs.CV cs.CL 76%

VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery

VaseVQA: 古代希腊陶器的多模态代理与基准

Jinchao Ge, Tengfei Cheng, Biao Wu, Zeyu Zhang, Shiya Huang, Judith Bishop, Gillian Shepherd, Meng Fang, Ling Chen, Yang Zhao

机构 * University of Adelaide(阿德莱德大学) University of Liverpool(利物浦大学) University of Technology Sydney(悉尼技术大学) The Australian National University(澳大利亚国立大学) La Trobe University(拉特罗布大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

AI总结 VaseVQA通过引入VaseVL强化学习方法,提升对古代希腊陶器的多模态推理能力,尤其在复杂推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04192 2026-01-27 cs.CV 70%

PixFoundation: Are We Heading in the Right Direction with Pixel-level Vision Foundation Models?

PixFoundation: 我们在像素级视觉基础模型的方向正确吗?

Mennatullah Siam

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 PixFoundation提出新的基准测试,揭示像素级基础模型在视觉问答中的不足,并提出可解释性工具分析接地机制。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17489 2026-01-27 cs.LG cs.CL cs.CV 62%

SpatialMath: Spatial Comprehension-Infused Symbolic Reasoning for Mathematical Problem-Solving

SpatialMath: 基于空间认知的符号推理框架用于数学问题解决

Ashutosh Bajpai, Akshat Bhandari, Akshay Nambi, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里) Indian Institute of Technology Abu Dhabi(印度理工学院阿布扎克) Microsoft Research(微软研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 SpatialMath通过整合空间表示到结构化符号推理链中,提升多模态模型在视觉密集型数学问题中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17722 2026-01-27 cs.AI 57%

EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents

EntWorld: 一个综合环境和基准,用于可验证的企业GUI代理

Ying Mo, Yu Bai, Dapeng Sun, Yuqian Shi, Yukai Miao, Li Chen, Dan Li

机构 * Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 EntWorld是一个综合的企业GUI代理基准,通过基于模式的任务生成和SQL验证机制,评估代理在企业环境中的表现,揭示当前代理能力的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17697 2026-01-27 cs.CV 57%

StyleDecoupler: Generalizable Artistic Style Disentanglement

StyleDecoupler: 可泛化艺术风格解耦

Zexi Jia, Jinchao Zhang, Jie Zhou

机构 * Wechat AI, Tencent, China(腾讯微信AI,腾讯,中国)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 StyleDecoupler通过信息论方法分离多模态视觉模型中的纯风格特征,实现艺术风格的可泛化解耦,并在大规模艺术数据集上展示出强大的风格检索和生成模型评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10098 2026-01-27 cs.RO cs.LG 50%

Estimating the Joint Probability of Scenario Parameters with Gaussian Mixture Copula Models

基于高斯混合Copula模型的场景参数联合概率估计

Christian Reichenbächer, Philipp Rank, Jochen Hipp, Oliver Bringmann

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Department of Computer Science, University of Tübingen(图宾根大学计算机科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出利用高斯混合Copula模型对自动驾驶场景参数进行联合概率估计,通过实验证明其在安全验证中的有效性。

Comments 9 pages, 4 figures; This work has been submitted to the IEEE for possible publication; Code available at: https://codeocean.com/capsule/1003615/tree

详情

展开后加载摘要…

URL PDF HTML 收藏