arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-28 至 2026-08-28 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 5 篇

2509.08897 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新 85%

Recurrence Meets Transformers for Universal Multimodal Retrieval

循环机制与Transformer结合的通用多模态检索模型

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * Department of Education and Humanities, University of Modena and Reggio Emilia(教育与人文学院, Modena and Reggio Emilia大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出结合循环机制与Transformer的统一多模态检索模型ReT-2,其支持多模态查询,在M2KR等基准上达最优性能,推理更快、内存占用更低,还可提升下游任务表现。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27121 2026-08-28 cs.MM cs.CV cs.LG 新提交 84%

How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space

AI如何体验艺术:自监督多模态嵌入空间中的涌现审美结构

Corey D.C. Heath

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 该研究提出自监督多模态嵌入框架,在无显式标签的情况下发现AI的审美结构,探讨其与人类情感标签的差异,可应用于RAG媒体组织与自动标注等场景。

Comments Accepted at ICMI Companion '26 (Companion Publication of the 28th ACM International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy. 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26414 2026-08-28 cs.CL cs.IR 新提交 79%

Case2Flow: Bridging Patient Cases and Guideline Flowcharts through Multimodal Retrieval

Case2Flow:通过多模态检索连接患者病例与指南流程图

Jiale Wei, Yufan Chen, Alexander Jaus, Zdravko Marinov, Julian Friedrich, Simon Reiß, Jens Kleesiek, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University Hospital Essen(埃森大学医院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究提出Case2Flow任务,构建含202份流程图的FlowAtlas语料库,提出无需训练的CRISP方法优化多模态检索,提升Recall@1达18.71个百分点,为病例匹配指南流程图提供可行方案。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26964 2026-08-28 cs.LG 新提交 78%

Graph-Based Pseudo-multimodal Contrastive Learning for 12-Lead ECG Representations

基于图的伪多模态对比学习用于12导联心电图表征

Mengyu Wang, Kozo Okada, Takafumi Goto, Natsuko Jinba, Hiroki Yamaya, Kiyoshi Hibi, Tomoki Hamagami

机构 * Yokohama National University(横滨国立大学) Yokohama City University Medical Center(横滨市立大学医学中心) Fukuda Denshi Co.,Ltd(福田电子株式会社)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对现有12导联ECG分析方法难以捕捉导联间依赖与全局模式的问题,提出Graph-CMMC框架,通过将ECG波形转换为GADF图像构建伪多模态表征,结合图关系模块建模导联间依赖,在冠状动脉闭塞分类任务上取得了有竞争力的性能。

Comments 7 pages, 7 figures. Presented at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22642 2026-08-28 cs.LG cs.AI 版本更新 74%

Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

Mol-JEPA:用于分子的多模态联合嵌入预测架构

Florian Rottach, Sebastian Schieferdecker, William Rudman, Randall Balestriero, Carsten Eickhoff

机构 * University of Tübingen(蒂宾根大学) Boehringer Ingelheim(勃林格殷格翰) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 跨模态检索 :multimodal(title);分类 cs.AI

AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏