arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-03 至 2025-10-03 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2510.01576 2025-10-03 cs.CV cs.AI cs.HC 84%

Guiding Multimodal Large Language Models with Blind and Low Vision People Visual Questions for Proactive Visual Interpretations

Ricardo Gonzalez Penuela, Felipe Arias-Russi, Victor Capriles

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 7 pages, 2 figure, 2 tables, CV4A11y Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01659 2025-10-03 cs.CL cs.AI 81%

MDSEval: A Meta-Evaluation Benchmark for Multimodal Dialogue Summarization

Yinhong Liu, Jianfeng He, Hang Su, Ruixue Lian, Yi Nian, Jake Vincent, Srikanth Vishnubhotla, Robinson Piramuthu, Saab Mansour

机构 * AWS AI Labs(AWS人工智能实验室) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01904 2025-10-03 cs.CV cs.AI 81%

What are You Looking at? Modality Contribution in Multimodal Medical Deep Learning

Christian Gapp, Elias Tappeiner, Martin Welk, Karl Fritscher, Elke Ruth Gizewski, Rainer Schubert

机构 * Institute of Biomedical Image Analysis UMIT TIROL -- Private University for Health Sciences(生物医学影像分析研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Contribution to Conference for Computer Assisted Radiology and Surgery (CARS 2025)

Journal ref Int J CARS (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01582 2025-10-03 cs.CV cs.LG 79%

ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models

Krishna Teja Chitty-Venkata, Murali Emani

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22959 2025-10-03 physics.app-ph cond-mat.mtrl-sci 78%

A modular framework for collaborative human-AI, multi-modal and multi-beamline synchrotron experiments

Adam A. Corrao, Phillip M. Maffettone, Bruce Ravel, Thomas A. Caswell, Stuart I. Campbell, Howie Joress, Stuart Wilkins, Daniel Olds

专题命中 多模态评测 :multi-modal(title,abstract)

Comments 39 pages, 13 figures, Supporting Information available in SI.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15596 2025-10-03 cs.CV 70%

EyePCR: A Comprehensive Benchmark for Fine-Grained Perception, Knowledge Comprehension and Clinical Reasoning in Ophthalmic Surgery

Gui Wang, Yang Wennuo, Xusen Ma, Zehao Zhong, Zhuoru Wu, Ende Wu, Rong Qu, Wooi Ping Cheah, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波校区计算机科学学院) Wenzhou Medical University(温州医科大学) School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Strong accept by NeurIPS2025 Reviewers and AC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01296 2025-10-03 cs.LG cs.AI cs.CV 62%

From 2D to 3D, Deep Learning-based Shape Reconstruction in Magnetic Resonance Imaging: A Review

Emma McMillian, Abhirup Banerjee, Alfonso Bueno-Orovio

机构 * University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01247 2025-10-03 cs.CL cs.AI 62%

Let's Play Across Cultures: A Large Multilingual, Multicultural Benchmark for Assessing Language Models' Understanding of Sports

Punit Kumar Singh, Nishant Kumar, Akash Ghosh, Kunal Pasad, Khushi Soni, Manisha Jaishwal, Sriparna Saha, Syukron Abu Ishaq Alfarozi, Asres Temam Abagissa, Kitsuchart Pasupa, Haiqin Yang, Jose G Moreno

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) Sardar Patel Institute of Technology(萨达尔·帕特尔技术学院) Universitas Gadjah Mada(加查马大学) King Mongkut’s Institute of Technology Ladkrabang(拉差班国王技术学院) Shenzhen Technology University(深圳技术大学) Université de Toulouse(图卢兹大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 52 pages, 56 figures; appearing at EMNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01691 2025-10-03 cs.CV 57%

MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs

Jiyao Liu, Jinjie Wei, Wanying Qu, Chenglong Ma, Junzhi Ning, Yunheng Li, Ying Chen, Xinzhe Luo, Pengcheng Chen, Xin Gao, Ming Hu, Huihui Xu, Xin Wang, Shujian Gao, Dingkang Yang, Zhongying Deng, Jin Ye, Lihao Liu, Junjun He, Ningsheng Xu

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) University of Cambridge(剑桥大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

Comments 26 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏