arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-09 至 2025-12-09 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 17 篇

2512.06921 2025-12-09 cs.CV cs.AI cs.CL 85%

NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification

NeuroABench: 一种多模态评估基准,用于神经外科解剖识别

Ziyang Song, Zelin Zang, Xiaofan Ye, Boqiang Xu, Long Bai, Jinlin Wu, Hongliang Ren, Hongbin Liu, Jiebo Luo, Zhen Lei

机构 * Hong Kong Institute of Science and Innovation(香港科学与创新研究院) The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 NeuroABench是首个用于评估神经外科领域解剖理解的多模态基准,通过实验揭示了MLLMs在解剖识别任务中的局限性,并展示了人类表现与模型之间的差距。

Comments Accepted by IEEE ICIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18991 2025-12-09 cs.CL 84%

Surveying the MLLM Landscape: A Meta-Review of Current Surveys

测绘MLLM景观:当前调研的元综述

Ming Li, Keyu Chen, Ziqian Bi, Ming Liu, Xinyuan Song, Zekun Jiang, Tianyang Wang, Benji Peng, Qian Niu, Junyu Liu, Jinlang Wang, Sen Zhang, Xuanhe Pan, Jiawei Xu, Pohsun Feng

机构 * Georgia Institute of Technology(佐治亚理工学院) Indiana University(印第安纳大学) Purdue University(普渡大学) Emory University(埃默里大学) Sichuan University(四川大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) AppCubic Kyoto University(京都大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Rutgers University(罗格斯大学) National Taiwan Normal University(台湾师范大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract,comments);分类 cs.CL

AI总结 本文通过系统回顾现有调研,全面分析MLLMs的评估方法、挑战与趋势,为研究者提供当前评估现状的深入理解。

Comments The article consists of 22 pages, including 2 figures and 108 references. The paper provides a meta-review of surveys on Multimodal Large Language Models (MLLMs), categorizing findings into key areas such as evaluation, applications, security, and future directions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17397 2025-12-09 cs.CV 83%

MCMoE: Completing Missing Modalities with Mixture of Experts for Incomplete Multimodal Action Quality Assessment

MCMoE:基于专家混合的缺失模态补全用于不完整多模态动作质量评估

Huangbiao Xu, Huanqi Wu, Xiao Ke, Junyi Wu, Rui Xu, Jinglin Xu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MCMoE通过专家混合方法解决多模态动作质量评估中缺失模态的问题,实现单阶段训练下的多模态学习和生成。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07136 2025-12-09 cs.CV cs.AI 81%

A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning

大规模多模态数据集与基准用于人类活动场景理解和推理

Siyang Jiang, Mu Yuan, Xiang Ji, Bufang Yang, Zeyu Liu, Lilin Xu, Yang Li, Yuting He, Liran Dong, Wenrui Lu, Zhenyu Yan, Xiaofan Jiang, Wei Gao, Hongkai Chen, Guoliang Xing

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of Pittsburgh(匹兹堡大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 CUHK-X是一个大规模多模态数据集和基准,用于人类活动场景理解和推理,通过生成逻辑一致的活动序列提升描述一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06814 2025-12-09 cs.CL cs.AI 81%

CAuSE: Decoding Multimodal Classifiers using Faithful Natural Language Explanation

CAuSE:利用忠实的自然语言解释解码多模态分类器

Dibyanayan Bandyopadhyay, Soham Bhattacharjee, Mohammed Hasanuzzaman, Asif Ekbal

机构 * Indian Institute of Technology Patna(印度理工学院帕纳瓦分校) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 CAuSE提出了一种生成多模态分类器忠实自然语言解释的新框架,通过因果抽象和交换干预提升解释的因果忠实性,并在多模态设置中验证其有效性。

Comments Accepted at Transactions of the Association for Computational Linguistics (TACL). Pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06999 2025-12-09 cs.SD cs.AI 79%

Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model

基于多模态大基础模型的歌唱音色受欢迎程度评估

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Berkeley(加州大学伯克利分校) University of Manchester(曼彻斯特大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于多模态大基础模型的歌唱音色受欢迎程度评估方法,通过引入Sing-MD数据集、VocalVerse架构和H-TPR基准,实现无参考、多维度的歌唱评估。

Comments Accepted to ACMMM 2025 oral

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12227-12236

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06589 2025-12-09 cs.CR cs.CV 79%

OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation

OmniSafeBench-MM:多模态 jailbreak 攻击-防御评估的统一基准和工具箱

Xiaojun Jia, Jie Liao, Qi Guo, Teng Ma, Simeng Qin, Ranjie Duan, Tianlin Li, Yihao Huang, Zhitao Zeng, Dongxian Wu, Yiming Li, Wenqi Ren, Xiaochun Cao, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学) BraneMatrix AI, China(BraneMatrix AI) Chongqing University, China(重庆大学) Xi’an Jiaotong University, China(西安交通大学) Northeastern University, China(东北大学) Sun Yat-sen University, China(中山大学) Alibaba, China(阿里巴巴) National University of Singapore, Singapore(新加坡国立大学) ByteDance, China(字节跳动)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 OmniSafeBench-MM提供一个多模态jailbreak攻击-防御评估的统一基准和工具箱,整合13种攻击方法、15种防御策略及广泛数据集,通过三维评估协议深入分析安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07186 2025-12-09 cs.CV cs.AI 73%

START: Spatial and Textual Learning for Chart Understanding

START: 空间与文本学习用于图表理解

Zhuoming Liu, Xiaofeng Gao, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊人工智能实验室) MIT(麻省理工学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 START通过空间与文本学习提升图表理解能力,引入图表元素定位和图表到代码生成,增强多模态大语言模型对图表结构和数据细节的理解。

Comments WACV2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07385 2025-12-09 cs.CV 72%

How Far are Modern Trackers from UAV-Anti-UAV? A Million-Scale Benchmark and New Baseline

现代追踪器距离无人机-反无人机还有多远?一个百万级基准和新基线

Chunhui Zhang, Li Liu, Zhipeng Zhang, Yong Wang, Hao Wen, Xi Zhou, Shiming Ge, Yanfeng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) CloudWalk Technology Co., Ltd(云walk科技有限公司) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Aeronautics and Astronautics, Sun Yat-sen University(中山大学航空宇航学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 多模态评测 :multimodal(abstract,comments);multi-modal(abstract);分类 cs.CV

AI总结 本文提出UAV-Anti-UAV多模态追踪任务及MambaSTS基线方法,通过百万级数据集验证了现有追踪算法在无人机反无人机领域的改进空间。

Comments https://github.com/983632847/Awesome-Multimodal-Object-Tracking

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07738 2025-12-09 cs.CV 57%

HLTCOE Evaluation Team at TREC 2025: VQA Track

TREC 2025 VQA 轨道中 HLTCOE 评估团队:视觉问答任务

Dengjia Zhang, Charles Weng, Katherine Guerrerio, Yi Lu, Kenton Murray, Alexander Martin, Reno Kriz, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人文语言技术卓越中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 HLTCOE 评估团队在 TREC 2025 VQA 轨道中提出了一种列表学习框架,通过结合生成模型与判别排名,提升答案生成的语义精度和排名一致性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07666 2025-12-09 cs.CL cs.SE 57%

Bridging Code Graphs and Large Language Models for Better Code Understanding

连接代码图与大型语言模型以实现更好的代码理解

Zeqi Chen, Zhaoyang Chu, Yi Gui, Feng Guo, Yao Wan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CL

AI总结 CGBridge通过引入外部Bridge模块,提升LLMs对代码结构语义的理解,显著提高代码生成和翻译任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06862 2025-12-09 cs.CV 57%

Omni-Referring Image Segmentation

多模态指引用图像分割

Qiancheng Zheng, Yunhang Shen, Gen Luo, Baiyang Song, Xing Sun, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Youtu Lab, Tencent, P.R. China(腾讯视频实验室,中国) OpenGVLab, Shanghai AI Laboratory(上海AI实验室)

专题命中 多模态评测 :omni-modal(abstract);分类 cs.CV

AI总结 本文提出多模态指引用图像分割任务,通过OmniRIS框架实现高度通用的图像分割,结合文本和视觉模态,构建了OmniRef数据集和OmniSegNet基线模型,验证了其在多模态提示下的分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06134 2025-12-09 cs.LG cs.AI q-bio.NC q-bio.QM 57%

Physics-Informed Neural Koopman Machine for Interpretable Longitudinal Personalized Alzheimer's Disease Forecasting

具有物理信息的神经Koopman机用于可解释的纵向个性化阿尔茨海默病预测

Georgi Hrusanov, Duy-Thanh Vu, Duy-Cat Can, Sophie Tascedda, Margaret Ryan, Julien Bodelet, Katarzyna Koscielska, Carsten Magnus, Oliver Y. Chén

机构 * Platform of Bioinformatics (PBI), University Lausanne Hospital (CHUV) and Faculty of Biology and Medicine (FBM), University of Lausanne (UNIL)(生物信息平台(PBI)、日内瓦大学医院(CHUV)和生物医学学院(FBM)、日内瓦大学(UNIL)) PBI, CHUV and FBM, UNIL(PBI、CHUV和FBM、UNIL) Department of Biomedical Engineering, University of Basel(生物医学工程系、巴塞尔大学) Roche Diagnostics International Ltd.(罗氏诊断国际有限公司) F. Hoffmann - La Roche Ltd., Roche Information Solutions(F. Hoffmann-La Roche有限公司、罗氏信息解决方案)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出神经Koopman机,通过整合多模态数据和生物学知识,实现阿尔茨海默病认知下降的可解释性预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06014 2025-12-09 cs.CV 57%

Benchmarking CXR Foundation Models With Publicly Available MIMIC-CXR and NIH-CXR14 Datasets

基于公开的MIMIC-CXR和NIH-CXR14数据集评估CXR基础模型

Jiho Shin, Dominic Marshall, Matthieu Komorowski

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文评估了两种CXR基础模型在不同数据集上的性能,发现MedImageInsight在多数任务表现更优,而CXR-Foundation具有良好的跨数据集稳定性,强调了标准化评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20745 2025-12-09 cs.CV 57%

Math Blind: Failures in Diagram Understanding Undermine Reasoning in MLLMs

数学视觉盲:图示理解的失败削弱了多模态大语言模型的推理能力

Yanpeng Sun, Shan Zhang, Wei Tang, Aotian Chen, Piotr Koniusz, Kai Zou, Yuan Xue, Anton van den Hengel

机构 * Ohio State University(俄亥俄州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究发现多模态大语言模型在图示理解上的缺陷导致推理能力下降,通过改进图示感知可显著提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22920 2025-12-09 q-bio.QM 50%

Beyond the Clinic: A Large-Scale Evaluation of Augmenting EHR with Wearable Data for Diverse Health Prediction

超越临床:一种大规模评估EHR与可穿戴数据融合用于多样化健康预测的框架

Will Ke Wang, Rui Yang, Chao Pang, Karthik Natarajan, Nan Liu, Daniel McDuff, David J Slotwiner, Fei Wang, Matthew B. A. McDermott, Xuhai "Orson" Xu

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出了一种整合EHR和可穿戴数据的多模态预测框架,通过大规模评估发现可穿戴数据显著提升了健康预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06099 2025-12-09 eess.SP 50%

Why Nonlinear Models Matter: Unified Analysis of Cognitive Load, Stress, and Exercise Using Wearable Physiological Signals

非线性模型的重要性:利用可穿戴生理信号统一分析认知负荷、压力和运动

Khondakar Ashik Shahriar

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究通过非线性模型统一分析认知负荷、压力和运动,证明生理状态识别的本质非线性,并建立了统一的基准以指导更稳健的可穿戴健康监测系统发展。

Comments 28 pages, 8 tables, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏