arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-27 至 2025-08-27 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 8 篇

2508.18740 2025-08-27 cs.CL cs.AI 81%

M3HG: Multimodal, Multi-scale, and Multi-type Node Heterogeneous Graph for Emotion Cause Triplet Extraction in Conversations

Qiao Liang, Ying Shen, Tiantian Chen, Lin Zhang

机构 * Tongji University(同济大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 16 pages, 8 figures. Accepted to Findings of ACL 2025

Journal ref Findings of ACL 2025 (2025) 11416-11431

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18608 2025-08-27 cs.AI 79%

eSkinHealth: A Multimodal Dataset for Neglected Tropical Skin Diseases

Janet Wang, Xin Hu, Yunbei Zhang, Diabate Almamy, Vagamon Bamba, Konan Amos Sébastien Koffi, Yao Koffi Aubin, Zhengming Ding, Jihun Hamm, Rie R. Yotsu

机构 * Tulane University(Tulane大学) Bakke Graduate University(Bakke研究生大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18506 2025-08-27 cs.CV 79%

DoGFlow: Self-Supervised LiDAR Scene Flow via Cross-Modal Doppler Guidance

Ajinkya Khoche, Qingwen Zhang, Yixi Cai, Sina Sharif Mansouri, Patric Jensfelt

机构 * KTH Royal Institute of Technology(皇家理工学院) Autonomous Transport Solutions Lab, Scania Group(自主运输解决方案实验室,斯堪尼亚集团)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00152 2025-08-27 cs.CL 79%

Table Understanding and (Multimodal) LLMs: A Cross-Domain Case Study on Scientific vs. Non-Scientific Data

Ekaterina Borisova, Fabio Barth, Nils Feldhus, Raia Abu Ahmad, Malte Ostendorff, Pedro Ortiz Suarez, Georg Rehm, Sebastian Möller

机构 * Deutsches Forschungszentrum für Künstliche Intelligenz GmbH (DFKI)(德国人工智能研究中心有限公司) Technische Universität Berlin(柏林技术大学) BIFOLD Deutsche Telekom(德国电信) Common Crawl Foundation(Common Crawl基金会) Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Comments TRL@ACL 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18372 2025-08-27 cs.CV 79%

OpenEvents V1: Large-Scale Benchmark Dataset for Multimodal Event Grounding

Hieu Nguyen, Phuc-Tan Nguyen, Thien-Phuc Tran, Minh-Quang Nguyen, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science(科学大学) University of Dayton(戴维森大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07155 2025-08-27 cs.CV 79%

Meta-Learned Modality-Weighted Knowledge Distillation for Robust Multi-Modal Learning with Missing Data

Hu Wang, Salma Hassan, Yuyuan Liu, Congbo Ma, Yuanhong Chen, Qing Li, Jiahui Geng, Bingjie Wang, Yu Tian, Yutong Xie, Jodie Avery, Louise Hull, Ian Reid, Mohammad Yaqub, Gustavo Carneiro

机构 * University of Adelaide, Australia(澳大利亚阿德莱德大学) New York University Abu Dhabi, UAE(阿联酋纽约大学阿布扎克分校) University of Surrey, UK(英国萨里大学) Boai hospital of Zhongshan, China(中国中山博爱医院) University of Central Florida, USA(美国佛罗里达大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18430 2025-08-27 cs.CV cs.AI 62%

CLARIFY: A Specialist-Generalist Framework for Accurate and Lightweight Dermatological Visual Question Answering

Aranya Saha, Tanvir Ahmed Khan, Ismam Nur Swapnil, Mohammad Ariful Haque

机构 * Aranya Saha ∗ , Tanvir Ahmed Khan ∗ , Ismam Nur Swapnil ∗ , and Mohammad Ariful Haque ∗(无明确机构)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 8 figures, Prepared for submission to IEEE Transactions on Human-Machine Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14137 2025-08-27 cs.CV cs.CL 62%

VAGUE: Visual Contexts Clarify Ambiguous Expressions

Heejeong Nam, Jinwoo Ahn, Keummin Ka, Jiwan Chung, Youngjae Yu

机构 * Brown University(布朗大学) UC Berkeley(加州大学伯克利分校) Yonsei University(延世大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

Comments ICCV 2025, 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏