arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-15 至 2025-10-15 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 5 篇

2510.12267 2025-10-15 cs.CV 83%

SpineBench: Benchmarking Multimodal LLMs for Spinal Pathology Analysis

Chenghanyu Zhang, Zekun Li, Peipei Li, Xing Cui, Shuhan Xia, Weixiang Yan, Yiqiao Zhang, Qianyu Zhuang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Peking Union Medical College Hospital(北京佑安医学大学医院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments Proceedings of the 33rd ACM International Conference on Multimedia,ACMMM 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10367 2025-10-15 cs.CV 79%

Contrast Sensitivity in Multimodal Large Language Models: A Psychophysics-Inspired Evaluation

Pablo Hernández-Cámara, Alexandra Gomez-Villa, Jose Manuel Jaén-Lorites, Jorge Vila-Tomás, Valero Laparra, Jesus Malo

机构 * Image Processing Lab, Universitat de València, Spain(瓦伦西亚大学图像处理实验室) Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学) Center for Biomaterials and Tissue Engineering, Universitat Politecnica de Valencia, Spain(瓦伦西亚理工大学生物材料与组织工程中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12383 2025-10-15 cs.LG 78%

Towards Cross-Modal Error Detection with Tables and Images

Olga Ovcharenko, Sebastian Schelter

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 多模态评测 :cross-modal(title,abstract)

Journal ref DataWorld Workshop at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12750 2025-10-15 cs.CV cs.AI cs.LG 62%

VQArt-Bench: A semantically rich VQA Benchmark for Art and Cultural Heritage

A. Alfarano, L. Venturoli, D. Negueruela del Castillo

机构 * University of Zurich, Max Planck Society(苏黎世大学、马克斯·普朗克研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06486 2025-10-15 cs.CV 57%

Mind the (Data) Gap: Evaluating Vision Systems in Small Data Applications

Samuel Stevens, S M Rayeed, Jenna Kline

机构 * The Ohio State University(俄亥俄州立大学) Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

Comments 5 pages (main text), 3 figures. Accepted at the Imageomics Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏