arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-05 至 2026-02-05 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 5 篇

2602.04116 2026-02-05 cs.LG cs.AI cs.SI 83%

Toward Effective Multimodal Graph Foundation Model: A Divide-and-Conquer Based Approach

迈向有效的多模态图基础模型:基于分而治之的方法

Sicheng Liu, Xunkai Li, Daohan Su, Ru Zhang, Hongchao Qin, Ronghua Li, Guoren Wang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 PLANET提出了一种基于分而治之的方法,通过解耦模态交互和对齐,提升多模态图基础模型的性能。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20347 2026-02-05 cs.CV 83%

MMSF: Multitask and Multimodal Supervised Framework for WSI Classification and Survival Analysis

MMSF:多任务和多模态监督框架用于WSI分类和生存分析

Chengying She, Chengwei Chen, Xinran Zhang, Ben Wang, Lizhuang Liu, Chengwei Shao, Yun Bian

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Advanced Research Institute, Chinese Academy of Sciences(中国科学院上海先进研究院) Department of Radiology, Changhai Hospital(昌海医院放射科)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MMSF通过多任务和多模态监督框架,结合组织拓扑和临床数据,提升全滑片图像分类和生存分析的准确性和预后预测能力。

Comments Submitted to "Biomedical Signal Processing and Control"

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04021 2026-02-05 cs.LG q-bio.QM stat.ML 82%

Group Contrastive Learning for Weakly Paired Multimodal Data

用于弱配对多模态数据的组对比学习

Aditya Gorla, Hugues Van Assel, Jan-Christian Huetter, Heming Yao, Kyunghyun Cho, Aviv Regev, Russell Littman

机构 * Research and Early Development (gRED), Genentech(Genentech 研究与早期发展部门) UCLA(加州大学洛杉矶分校) Biology Research | AI Development (BRAID), Genentech(Genentech 生物研究 | 人工智能开发部门) Genentech Computational Sciences NYU(Genentech 计算科学与纽约大学)

专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);cross-modal(abstract)

AI总结 GROOVE通过组级对比学习方法,有效处理弱配对多模态数据,提升跨模态匹配与填补任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04263 2026-02-05 cs.IR 78%

LILaC: Late Interacting in Layered Component Graph for Open-domain Multimodal Multihop Retrieval

LILaC:基于分层组件图的开放域多模态多跳检索中的后期交互

Joohyung Yun, Doyup Lee, Wook-Shin Han

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 LILaC通过分层组件图和后期交互子图检索方法,提升开放域多模态多跳检索的精度与效率。

Comments Project page: https://lilac-emnlp2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21904 2026-02-05 cs.CV 57%

Beyond Global Alignment: Fine-Grained Motion-Language Retrieval via Pyramidal Shapley-Taylor Learning

超越全局对齐:通过金字塔Shapley-Taylor学习实现细粒度动语言检索

Hanmo Chen, Guangtao Lyu, Chenghao Xu, Jiexi Yan, Xu Yang, Cheng Deng

机构 * Hangzhou Institute of Technology, Xidian University, Hangzhou, China(杭州理工大学、西安电子科技大学、杭州,中国) Xidian University, Xi'an, China(西安电子科技大学、西安,中国) Hohai University, Nanjing, China(河海大学、南京,中国)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于金字塔Shapley-Taylor学习的细粒度动语言检索方法,通过分层对齐捕捉局部细节与层次结构,提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏