arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-13 至 2025-08-13 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 6 篇

2506.14805 2025-08-13 cs.CV cs.AI cs.CL cs.LG cs.MM 83%

Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?

Yang Yao, Lingyu Li, Jiaxin Song, Chiyu Chen, Zhenqi He, Yixu Wang, Xin Wang, Tianle Gu, Jie Li, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02141 2025-08-13 cs.CV cs.CL 81%

WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image

Yuci Liang, Xinheng Lyu, Wenting Chen, Meidan Ding, Jipeng Zhang, Xiangjian He, Song Wu, Xiaohan Xing, Sen Yang, Xiyue Wang, Linlin Shen

机构 * Shenzhen University(深圳大学) University of Nottingham Ningbo China(诺丁汉大学宁波分校) City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.CL

Comments ICCV 2025, 38 pages, 22 figures, 35 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01306 2025-08-13 cs.LG cs.CV 79%

ICC: Quantifying Image Caption Concreteness for Multimodal Dataset Curation

Moran Yanuka, Morris Alper, Hadar Averbuch-Elor, Raja Giryes

机构 * Tel-Aviv University(特拉维夫大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted to ACL 2024 (Finding). For Project webpage, see https://moranyanuka.github.io/icc/

Journal ref Findings of the Association for Computational Linguistics: ACL 2024, pages 11048-11064, Bangkok, Thailand, August 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08774 2025-08-13 cs.AI cs.CL 62%

Designing Memory-Augmented AR Agents for Spatiotemporal Reasoning in Personalized Task Assistance

Dongwook Choi, Taeyoon Kwon, Dongil Yang, Hyojun Kim, Jinyoung Yeo

机构 * Language & AGI Lab(语言与人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08685 2025-08-13 cs.CV 57%

PADReg: Physics-Aware Deformable Registration Guided by Contact Force for Ultrasound Sequences

Yimeng Geng, Mingyang Zhao, Fan Xu, Guanglin Cao, Gaofeng Meng, Hongbin Liu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Center for Artificial Intelligence and Robotics, HK Institute of Science & Innovation, Chinese Academy of Sciences(人工智能与机器人中心,香港创新科学院,中国科学院) School of Biomedical Engineering and Imaging Sciences, King’s College London(生物医学工程与影像科学学院,伦敦国王学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08769 2025-08-13 cs.LG 50%

Differentiated Information Mining: A Semi-supervised Learning Framework for GNNs

Long Wang, Kai Liu

专题命中 多模态评测 :multimodal(abstract)

Comments 13 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏