arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-17 至 2025-09-17 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 12 篇

2509.12060 2025-09-17 cs.AI 89%

When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models

Wei Cai, Shujuan Liu, Jian Zhao, Ziyan Shi, Yusheng Zhao, Yuchen Yuan, Tianle Zhang, Chi Zhang, Xuelong Li

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13234 2025-09-17 cs.AI cs.CV cs.HC 84%

Simulating Clinical AI Assistance using Multimodal LLMs: A Case Study in Diabetic Retinopathy

Nadim Barakat, William Lotter

机构 * Dana-Farber Cancer Institute & Tufts University School of Medicine(达纳-法伯癌症研究所及塔夫茨大学医学院) Dana-Farber Cancer Institute Brigham and Women’s Hospital & Harvard Medical School(达纳-法伯癌症研究所布里特妇女医院及哈佛医学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13289 2025-09-17 cs.CV eess.IV 79%

Image Realness Assessment and Localization with Multimodal Features

Lovish Kaushik, Agnij Biswas, Somdyuti Paul

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克哈拉格普)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12963 2025-09-17 cs.CV cs.LG 79%

MMMS: Multi-Modal Multi-Surface Interactive Segmentation

Robin Schön, Julian Lorenz, Katja Ludwig, Daniel Kienzle, Rainer Lienhart

机构 * Fakultät für Angewandte Informatik University of Augsburg(应用信息学院乌尔姆大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

Comments 19 pages, 11 figures, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12750 2025-09-17 cs.CV 79%

What Makes a Good Generated Image? Investigating Human and Multimodal LLM Image Preference Alignment

Rishab Parthasarathy, Jasmine Collins, Cory Stephenson

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments 7 pages, 9 figures, 3 tables; appendix 16 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12287 2025-09-17 eess.IV cs.CV cs.LG 79%

Enhancing Radiographic Disease Detection with MetaCheX, a Context-Aware Multimodal Model

Nathan He, Cody Chen

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments All authors contributed equally, 5 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19075 2025-09-17 cs.CV 79%

HoloDx: Knowledge- and Data-Driven Multimodal Diagnosis of Alzheimer's Disease

Qiuhui Chen, Jintao Wang, Gang Wang, Yi Hong

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Department of Neurology, Renji Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属仁济医院神经内科)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Medical Imaging (TMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12540 2025-09-17 cs.LG 78%

Cross-Modal Deep Metric Learning for Time Series Anomaly Detection

Wei Li, Zheze Yang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :cross-modal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12243 2025-09-17 math.NA cs.NA 78%

Bi-fidelity Interpolative Decomposition for Multimodal Data

Murray Cutforth, Tiffany Fan, Tony Zahtila, Alireza Doostan, Eric Darve

专题命中 多模态评测 :multimodal(title);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05066 2025-09-17 cs.CL cs.AI 62%

ToM-SSI: Evaluating Theory of Mind in Situated Social Interactions

Matteo Bortoletto, Constantin Ruhdorfer, Andreas Bulling

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07825 2025-09-17 cs.CV 57%

3DSRBench: A Comprehensive 3D Spatial Reasoning Benchmark

Wufei Ma, Haoyu Chen, Guofeng Zhang, Yu-Cheng Chou, Jieneng Chen, Celso M de Melo, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

Comments ICCV 2025. Project page: https://3dsrbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12816 2025-09-17 cs.HC cs.AI cs.CV cs.LG 54%

Gesture Evaluation in Virtual Reality

Axel Wiebe Werner, Jonas Beskow, Anna Deichler

机构 * Division of Speech, Music and Hearing, KTH Royal Institute of Technology(语音、音乐与听觉系,皇家理工学院)

专题命中 多模态评测 :multimodal(comments,journal_ref);分类 cs.CV、cs.AI

Comments Published in Proceedings of the 26th International Conference on Multimodal Interaction (ICMI '24), ACM. Copyright 2024 ACM. Licensed under CC BY

Journal ref Proceedings of the 26th International Conference on Multimodal Interaction (ICMI '24), ACM, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏