arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-17 至 2025-11-17 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 14 篇

2511.11407 2025-11-17 cs.CV 85%

MicroVQA++: High-Quality Microscopy Reasoning Dataset with Weakly Supervised Graphs for Multimodal Large Language Model

Manyu Li, Ruian He, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Fudan University(复旦大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11503 2025-11-17 eess.SP 82%

SynthSoM-Twin: A Multi-Modal Sensing-Communication Digital-Twin Dataset for Sim2Real Transfer via Synesthesia of Machines

Junlong Chen, Ziwei Huang, Xuesong Cai, Xiang Cheng, Liuqing Yang

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11299 2025-11-17 cs.CV cs.AI 81%

AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models

Haokun Chen, Jianing Li, Yao Zhang, Jinhe Bi, Yan Xia, Jindong Gu, Volker Tresp

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

Comments AAAI 2026. Code: https://github.com/HaokunChen245/AUVIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10521 2025-11-17 cs.AI cs.CL 81%

Scientists' First Exam: Probing Cognitive Abilities of MLLM via Perception, Understanding, and Reasoning

Yuhao Zhou, Yiheng Wang, Xuming He, Ao Shen, Ruoyao Xiao, Zhiwei Li, Qiantai Feng, Zijie Guo, Yuejin Yang, Hao Wu, Wenxuan Huang, Jiaqi Wei, Dan Si, Xiuqi Yao, Jia Bu, Haiwen Huang, Manning Wang, Tianfan Fu, Shixiang Tang, Ben Fei, Dongzhan Zhou, Fenghua Ling, Yan Lu, Siqi Sun, Chenhui Li, Guanjie Zheng, Jiancheng Lv, Wenlong Zhang, Lei Bai

机构 * PrismaX Team Shanghai Artificial Intelligence Laboratory(普斯玛X团队上海人工智能实验室)

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CL、cs.AI

Comments 82 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11034 2025-11-17 cs.CV cs.AI 81%

CrossMed: A Multimodal Cross-Task Benchmark for Compositional Generalization in Medical Imaging

Pooja Singh, Siddhant Ujjain, Tapan Kumar Gandhi, Sandeep Kumar

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10690 2025-11-17 cs.CL cs.AI 81%

Saying the Unsaid: Revealing the Hidden Language of Multimodal Systems Through Telephone Games

Juntu Zhao, Jialing Zhang, Chongxuan Li, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025 MTI-LLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16926 2025-11-17 cs.CV cs.CL 81%

Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input

Chenxu Li, Zhicai Wang, Yuan Sheng, Xingyu Zhu, Yanbin Hao, Xiang Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00060 2025-11-17 cs.CV cs.AI 81%

MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image

Shezheng Song, Chengxiang He, Shan Zhao, Chengyu Wang, Qian Wan, Tianwei Yan, Meng Wang

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) School of Computer and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) CCNU(中国地质大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11486 2025-11-17 cs.CV q-bio.QM 79%

Multimodal Posterior Sampling-based Uncertainty in PD-L1 Segmentation from H&E Images

Roman Kinakh, Gonzalo R. Ríos-Muñoz, Arrate Muñoz-Barrutia

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Preprint (pre-review). Accepted for publication in Lecture Notes in Bioinformatics (Springer, 2025). The final authenticated version will be available on SpringerLink once published

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11438 2025-11-17 cs.CV 79%

VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models

Mingjie Xu, Jinpeng Chen, Yuzhi Zhao, Jason Chun Lok Li, Yue Qiu, Zekang Du, Mengyang Wu, Pingping Zhang, Kun Li, Hongzheng Yang, Wenao Ma, Jiaheng Wei, Qinbin Li, Kangcheng Liu, Wenqiang Lei

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments This is the extended version of the paper accepted at AAAI 2026, which includes all technical appendices and additional experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11410 2025-11-17 cs.CV 79%

Q-Doc: Benchmarking Document Image Quality Assessment Capabilities in Multi-modal Large Language Models

Jiaxi Huang, Dongxu Wu, Hanwei Zhu, Lingyu Zhu, Jun Xing, Xu Wang, Baoliang Chen

机构 * South China Normal University(华南师范大学) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Shenzhen Academy of Inspection and Quarantine(深圳检验检疫局) Shenzhen University(深圳大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09914 2025-11-17 cs.AI 79%

OIDA-QA: A Multimodal Benchmark for Analyzing the Opioid Industry Documents Archive

Xuan Shen, Brian Wingenroth, Zichao Wang, Jason Kuen, Wanrong Zhu, Ruiyi Zhang, Yiwei Wang, Lichun Ma, Anqi Liu, Hongfu Liu, Tong Sun, Kevin S. Hawkins, Kate Tasker, G. Caleb Alexander, Jiuxiang Gu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments Accepted by AAAI 2026 Artificial Intelligence for Social Impact Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15846 2025-11-17 cs.CL 79%

CyPortQA: Benchmarking Multimodal Large Language Models for Cyclone Preparedness in Port Operation

Chenchen Kuai, Chenhao Wu, Yang Zhou, Xiubin Bruce Wang, Tianbao Yang, Zhengzhong Tu, Zihao Li, Yunlong Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25434 2025-11-17 cs.CL 57%

A Critical Study of Automatic Evaluation in Sign Language Translation

Shakib Yazdani, Yasser Hamidullah, Cristina España-Bonet, Eleftherios Avramidis, Josef van Genabith

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

Comments Submitted to the LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏