arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3475 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3475 篇

2607.24875 2026-07-29 cs.LG 新提交 78%

FinAbstain: Uncertainty-Calibrated Multimodal RAG for Selective Financial Forecasting

FinAbstain:用于选择性金融预测的不确定性校准多模态检索增强生成模型

Dorothy Torres, Wei Cheng, Henan Huang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究针对大语言模型在金融预测中证据不足时高置信度的问题,提出FinAbstain框架,通过多模态检索增强生成及选择性预测,经多种不确定性评估方法和指标评估,贡献了时间安全架构、复合不确定性公式和可重复评估蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20517 2026-07-24 cs.LG 新提交 78%

Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs

多模态CoLRAG-TF:复杂PDF的三重过滤检索

Takato Yasuno

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究针对异构PDF集合检索增强生成的挑战,提出多模态CoLRAG-TF四轴融合架构,集成多种技术。构建多模态索引,经贝叶斯优化确定融合权重。实验显示其检索召回率高,多跳答案相似性提升显著,还适用于视觉输入,提供通用框架。

Comments 18 pages, 8 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20797 2026-07-24 astro-ph.CO astro-ph.GA 新提交 78%

A Multimodal Approach to Star--Galaxy Separation using SPHEREx Spectrophotometry and DESI Legacy Survey Imaging

一种使用SPHEREx分光光度法和DESI遗产调查成像的恒星-星系分离多模态方法

Kendrick Nguyen, Richard M. Feder, Sean Bruton, Uroš Seljak

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究利用多模态模型,结合光学宽带成像与SPHEREx近红外分光光度法,通过对比学习分离恒星和星系。经实验,变换表示训练的分类器效果更好,能将恒星污染控制在百分之一以下,凸显多模态方法对现代星系调查的实用价值。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20358 2026-07-23 cs.ET cs.AR 新提交 78%

PolySim: Deterministic Polynomial Surrogates for Cross-Modal Retrieval on CiM

PolySim:用于CiM上跨模态检索的确定性多项式代理

Xinzhao Li, Charles Power, Pengyu Ren, Jongun Won, Likai Pei, Yuting Hu, Jinjun Xiong, Alptekin Vardar, Ningyuan Cao, Xiaobo Sharon Hu, Thomas Kämpfe, Kai Ni, Ruiyang Qin

专题命中 跨模态检索 :cross-modal(title,abstract)

AI总结 研究边缘设备跨模态检索在CiM硬件部署问题,提出PolySim框架,将概率检索转为确定性管道,用低阶多项式基近似高斯嵌入维度,经实验其提升R@1,减少推理计算,是首个在CiM硬件实现概率跨模态检索的方法。

Comments Accepted by ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14995 2026-07-17 cs.LG q-bio.QM 新提交 78%

Multimodal Semantic-Aware Contrastive Learning For False Negative Mitigation in 3D Medical Imaging

用于减轻 3D 医学成像中假阴性的多模态语义感知对比学习

Sara Ketabi, Matthias W. Wagner, Cynthia Hawkins, Uri Tabori, Birgit Betina Ertl-Wagner, Farzad Khalvati

机构 * University of Toronto(多伦多大学) The Hospital for Sick Children(病童医院) Vector Institute(向量研究所) University Hospital Augsburg(奥格斯堡大学医院)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究针对3D医学成像中假阴性问题,提出多模态语义感知对比学习框架MseaCL,通过纳入放射学报告语义相似性作指导信号,经实验验证该框架用于预训练可提升下游任务表现,如儿科脑肿瘤分子分类AUC至少增22.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10909 2026-07-14 cs.IR 新提交 78%

Stream-aware Side Adaptation for Large Pre-trained Multimodal Embedding Models in Sequential Recommendation

用于序列推荐中大型预训练多模态嵌入模型的流感知侧适应

Junchen Fu, Kaiwen Zheng, Ioannis Arapakis, Wenhao Deng, Xin Xin, Joemon M. Jose, Xuri Ge

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对大型预训练多模态嵌入模型用于序列推荐时因域不对准性能不佳的问题,提出Stresa框架,通过流感知隐藏适配器融合和残差流适配器,有效解锁模型潜力,实验证明其性能优于标准侧适配器和基线。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14926 2026-07-13 stat.ML cs.LG 版本更新 78%

Contrastive Learning on Multimodal Analysis of Electronic Health Records

电子健康记录多模态分析中的对比学习

Tianxi Cai, Feiqing Huang, Ryumei Nakada, Linjun Zhang, Doudou Zhou

机构 * Harvard T.H. Chan School of Public Health(哈佛T.H. 柏林公共卫生学院) Harvard Medical School(哈佛医学院) Rutgers University(罗格斯大学) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究针对电子健康记录多模态数据传统分析方法不足,提出多模态特征嵌入生成模型及对比损失来学习特征表示,经理论分析、模拟研究和真实数据验证,该方法有效且具隐私保护特性,展现了多模态学习优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08698 2026-07-10 cs.HC 新提交 78%

How YouTube Frames ChatGPT Use in Education: An Epistemic Network Analysis with Supporting Multimodal Metadata

YouTube如何构建教育领域中ChatGPT的使用:基于支持多模态元数据的认知网络分析

Shayla Sharmin, Mohammad Al-Ratrout, Mohammad Fahim Abrar, Roghayeh Leila Barmaki

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究通过多模态元数据分析教育类YouTube视频中ChatGPT的使用,识别出三个话语组,发现不同组在构建方式、观众反应和平台影响力上有差异,揭示了自主AI学习中优先快速输出与促进深度参与内容的差距及相关问题。

Comments This paper has been accepted in ICMI 2026 and will be presented in October

Journal ref In Proceedings of the 28th ACM International Conference on Multimodal Interaction (ICMI '26), Napoli, Italy, October 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08470 2026-07-10 cs.LG 新提交 78%

MatBind: A Shared Embedding Space for Multimodal Materials Characterization

MatBind:用于多模态材料表征的共享嵌入空间

Le Yang, Anoop K. Chandran, Jona Östreicher, Evgenii Sovetkin, Adrian Mirza, Sebastien Bompas, Bashir Kazimi, Pascal Friederich, Stefan Kesselheim, Kevin Maik Jablonka, Stefan Sandfeld

专题命中 跨模态检索 :multimodal(title);cross-modal(abstract)

AI总结 研究旨在整合异构材料数据以全面表征晶体材料。提出MatBind对比学习框架,以晶体结构为锚点将四种模态对齐到统一空间,实现零样本跨模态检索,且学习空间能依物理属性组织材料,组合模态可提升检索性能。

Comments 24 pages, 12 figures, submitted to npj computational material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04820 2026-07-07 cs.LG 新提交 78%

KinEMbed: Decoding Kinematics from Electromyography via Cross-Modal Contrastive Learning

KinEMbed:通过跨模态对比学习从肌电图中解码运动学

Sofia Gilardini, Chenfei Ma, Kianoush Nazarpour

机构 * Department of Statistics, University of Oxford(牛津大学统计学系) School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 跨模态检索 :cross-modal(title,abstract)

AI总结 研究从表面肌电图解码手部运动学这一挑战,提出跨模态对比学习框架KinEMbed训练双编码器,用于手部运动学回归,在NinaPro DB8数据集上优于基线方法。

Comments ICML 2026 Workshop on Structured Data for Health, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20167 2026-06-19 cs.LG 新提交 78%

Multi-Modal Contrastive Learning for Implicit Earth Embeddings via Location Tying

多模态对比学习用于基于位置绑定的隐式地球嵌入

Jonathan Hecht, Lukas Arzoumanidis, Ziyue Li, Youness Dehbi

机构 * Computational Methods Lab, HafenCity University Hamburg(汉堡港城大学计算方法实验室) Dept. of Operations & Technology, Technical University of Munich(慕尼黑工业大学运营与技术系;海尔布隆数据科学中心;慕尼黑数据科学研究所) Heilbronn Data Science Center(波恩大学大地测量与地理信息研究所) Munich Data Science Institute Institute of Geodesy and Geoinformation, University of Bonn

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract)

AI总结 提出两种多模态对比学习架构MELT和SALT,通过位置绑定整合未配对地理数据,在四个下游任务中匹配最强双模态基线SATCLIP,但增加模态数未持续提升性能,表明位置编码器是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15838 2026-06-16 cs.IR 新提交 78%

Intelligent Multimodal Retrieval and Reasoning for Geospatial Knowledge Discovery on the I-GUIDE Platform

面向I-GUIDE平台地理空间知识发现的智能多模态检索与推理

Yunfan Kang, Erick Li, Furqan Baig, Wei Hu, Alexander Michels, Anand Padmanabhan, Shaowen Wang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出I-GUIDE Smart Search系统,结合多模态索引与知识图谱的迭代RAG管道,实现地理空间异构数据的语义检索、图谱溯源和对话合成,在单A100部署下支持约100并发用户,提升检索覆盖与答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22530 2026-06-16 cs.LG 78%

Multimodal Training to Unimodal Deployment: Leveraging Unstructured Data During Training to Optimize Structured Data Only Deployment

多模态训练到单模态部署:利用训练中的无结构数据优化仅结构化数据的部署

Zigui Wang, Minghui Sun, Jiang Shu, Matthew M. Engelhard, Lauren Franz, Benjamin A. Goldstein

机构 * Department of Biostatistics and Bioinformatics, Duke University School of Medicine(生物统计学与生物信息学系,杜克大学医学中心) Department of Pediatrics, Duke University School of Medicine(儿科学系,杜克大学医学中心) Duke Center for Autism and Brain Development, Duke University School of Medicine(杜克大学自主与脑发展中心,杜克大学医学中心) Department of Psychiatry and Behavioral Sciences, Durham, NC, USA(精神病学与行为科学系,新伯尔尼,NC,美国)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出一种多模态学习框架,利用训练中的无结构EHR数据提升模型对结构化数据的识别能力,通过对比学习和知识蒸馏损失联合训练,实现仅结构化数据部署的高效分类模型。

Comments 10 pages,3 figures

Journal ref Proceedings of the AMIA 2026 Annual Symposium, American Medical Informatics Association (AMIA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08979 2026-06-09 cs.IR 新提交 78%

EviProp: Seeded Relevance Diffusion on Chunk-Page Graphs for Long Multimodal Document Retrieval

EviProp: 基于种子相关性扩散的块-页图用于长多模态文档检索

Hongwei Zhang, Xiaoman Wang, Zehui Ling, Ruicheng Zhu, Yue Zhang, Pinlong Cai, Fuke Shen, Botian Shi, Tongquan Wei, Guohang Yan

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出EviProp方法,通过构建多模态块-页图并利用个性化PageRank扩散相关性,解决长文档中证据页检索的独立匹配局限,提升检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07252 2026-06-09 cs.IR 新提交 78%

Constrained Dominant Sets for Multimodal Document Question Answering

约束主导集用于多模态文档问答

Ambuj Mehrish, Sebastiano Vascon

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出基于查询增强亲和图的约束主导集检索方法,通过谱边界自动平衡相关性与冗余性,利用复制动态实现全局均衡,无需训练,在多模态文档问答中取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07235 2026-06-09 cs.IR cs.LG 版本更新 78%

FLOWREADER: Min-Cost Flow Optimization for Multi-Modal Long Document Q&A

FLOWREADER: 多模态长文档问答的最小成本流优化

Ambuj Mehrish, Sebastiano Vascon

机构 * Ca’ Foscari University of Venice(威尼斯卡布里亚大学)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract)

AI总结 提出FLOWREADER,将多模态长文档中的证据组装建模为最小成本流问题,通过统一评分向量控制源选择、汇选择和边成本,在碎片化证据场景下优于top-k检索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29956 2026-05-29 cs.IR 78%

Uncertainty Quantification for Multimodal Retrieval Augmented Generation

多模态检索增强生成的不确定性量化

Simon Binz, Heydar Soudani, Faegheh Hasibi

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出 LeMUQ 方法,通过多模态和检索感知的概率信号建模不确定性,提升多模态 RAG 系统的可靠性,AUROC 平均提升 3.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18835 2026-05-20 cs.LG 78%

StampFormer: A Physics-Guided Material-Geometry-Coupled Multimodal Model for Rapid Prediction of Physical Fields in Sheet Metal Stamping

StampFormer: 一种基于物理的材料-几何耦合多模态模型,用于快速预测冲压板料的物理场

Jiajie Luo, Mohamed Mohamed, Osama Hassan, Haosu Zhou, Yingxue Zhao, Haoran Li, Xinrun Li, Zhutao Shao, Yang Long, Nan Li, Jichun Li

机构 * Dyson School of Design Engineering, Imperial College London(帝国理工学院设计工程学院) School of Computing, Newcastle University(新castle大学计算机学院) Department of Computing, Imperial College London(帝国理工学院计算系) Multi-X Solution Limited(Multi-X解决方案有限公司) Department of Computer Science, Durham University(达勒姆大学计算机科学系) Department of Mechanical Engineering, Faculty of Engineering, Helwan University(Helwan大学工程学院机械工程系)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出StampFormer模型,通过结合材料和几何信息,实现对冲压板料物理场的快速准确预测,从而提高设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11010 2026-05-20 cs.IR cs.DL 78%

GovScape: A Public Multimodal Search System for 70 Million Pages of Government PDFs

GovScape:一个公共的多模态搜索系统,用于7000万页的政府PDF文件

Ying-Hsiang Huang, Claire Gong, Shreya Shaji, Alison Yan, Leslie Harka, Albert Du, Anjali Gopal, Samuel J Klein, Shannon Zejiang Shen, Mark Phillips, Trevor Owens, Kyle Deeds, Benjamin Charles Germain Lee

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出GovScape,一个支持多模态搜索的公共系统,用于搜索7000万页的政府PDF文件,展示了其在大规模PDF数据处理中的高效性和可扩展性。

Comments 11 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16999 2026-05-19 cs.LG 78%

Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

基于排名的校准:可靠多模态强化学习

Peng Cui, Boyao Yang, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学-博世联合机器学习中心,THBI实验室,清华大学,北京) Dept. of Automation, Tsinghua University, Beijing(自动化系,清华大学,北京)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出Ranking-Aware Calibration方法,通过利用组内强化学习自然产生的比较信号,提升多模态强化学习的校准能力,从而提高任务准确性和校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14113 2026-05-15 cs.CR cs.IR 78%

Adversarial Hubness in Multi-Modal Retrieval

多模态检索中的对抗性Hub现象

Tingwei Zhang, Fnu Suya, Rishi Jha, Collin Zhang, Vitaly Shmatikov

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本文研究了攻击者如何利用Hub现象在多模态检索系统中生成对抗性Hub,通过实验展示对抗性Hub在大量查询中的高召回率,并发现传统缓解自然Hub的方法对对抗性Hub无效。

Comments in IEEE S&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14156 2026-05-15 cs.LG 78%

Uncovering Trajectory and Topological Signatures in Multimodal Pediatric Sleep Embeddings

揭示多模态儿童睡眠嵌入中的轨迹和拓扑特征

Scott Ye, Harlin Lee

机构 * Department of Radiology(放射科) University of California San Francisco(加州大学旧金山分校) UNC–Chapel Hill(北卡罗来纳大学教堂山分校) UNC School of Data Science and Society(北卡罗来纳大学教堂山分校数据科学与社会学院)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文研究多模态掩码自编码器生成的儿童睡眠嵌入中包含的会话级诊断信息,通过结合PHATE坐标、持久同调和EHR数据,发现几何、拓扑和临床特征互补提升预测性能,尤其在极端不平衡情况下提升校准和鲁棒性。

Comments Accepted to ML4H 2025, 20 pages, 6 figures

Journal ref Proceedings of the Fifth Machine Learning for Health Symposium, PMLR 297:1392-1411, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05955 2026-05-12 cs.DC 78%

Multi-Modal Style Transfer-based Prompt Tuning for Efficient Federated Domain Generalization

基于多模态风格迁移的提示微调的高效联邦领域泛化

Yuliang Chen, Xi Lin, Jun Wu, Xiangrui Cai, Qiaolun Zhang, Xichun Fan, Jiapeng Xu, Xiu Su

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本文提出FaST-PT框架,通过多模态风格迁移和双提示模块实现高效联邦领域泛化,提升跨领域适应能力。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(25): 20427-20435, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00670 2026-05-04 cs.IR cs.SI 78%

Robust Multimodal Recommendation via Graph Retrieval-Enhanced Modality Completion

通过图检索增强的模态完成实现鲁棒的多模态推荐

Yuan Li, Jun Hu, Jiaxin Jiang, Bryan Hooi, Bingsheng He

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出GRE-MC框架,通过图检索增强模态完成,解决多模态数据不完整问题,提升推荐系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19176 2026-04-23 cs.LG cs.IR 78%

From Raw Features to Effective Embeddings: A Three-Stage Approach for Multimodal Recipe Recommendation

从原始特征到有效嵌入:一种多模态食谱推荐的三阶段方法

Jeeho Shin, Kyungho Kim, Kijung Shin

机构 * KAIST(韩国科学技术院)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出TESMR三阶段框架,通过内容、关系和学习增强多模态特征,提升食谱推荐性能,实验表明其在Recall@10上比现有方法高7-15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19267 2026-04-22 cs.RO 78%

Multimodal embodiment-aware navigation transformer

多模态具身感知导航Transformer

Louis Dezons, Quentin Picard, Rémi Marsal, François Goulette, David Filliat

机构 * LARIAD

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出ViLiNT,通过融合多模态数据提升机器人导航鲁棒性,利用Transformer和扩散模型生成可导航路径,实现在不同环境中导航成功率提升166%。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18965 2026-04-22 eess.SY cs.SY 78%

Transformer Architecture with Minimal Inference Latency for Multi-Modal Wireless Networks

具有最小推理延迟的多模无线网络变压器架构

Minsu Kim, Walid Saad, Kui Wang, Zongdian Li, Tao Yu, Kei Sakaguchi

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本文提出一种快速多模变压器推理框架,通过仅处理重要令牌来支持无线通信任务,减少推理延迟和内存消耗,同时保持任务精度。

Comments Under minor revision, IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07079 2026-04-09 cs.IR 78%

MARVEL: Multimodal Adaptive Reasoning-intensiVe Expand-rerank and retrievaL

MARVEL:多模态自适应推理-增强扩展-排序和检索

Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Mahmoud Abdalla, Abdelrahman Abdallah, Hyun-Soo Kang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出MARVEL框架,通过统一的扩展-检索-排序流程,结合LLM驱动的查询扩展、增强推理的密集检索器和基于GPT-4o的逐步推理排序,提升了多模态检索性能,在MM-BRIGHT基准上实现了37.9nDCG@10的高分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07220 2026-04-09 cs.IR 78%

HIVE: Query, Hypothesize, Verify An LLM Framework for Multimodal Reasoning-Intensive Retrieval

HIVE:一种用于多模态推理密集检索的LLM框架

Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Abdelrahman Abdallah, Hyun-Soo Kang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 HIVE通过引入LLM进行显式视觉-文本推理,提升多模态检索效果,达到41.7的nDCG@10,优于现有文本和多模态模型。

Comments accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05462 2026-04-08 stat.ML cs.LG math.ST stat.TH 78%

Hierarchical Contrastive Learning for Multimodal Data

多模态数据的层次对比学习

Huichao Li, Junhan Yu, Doudou Zhou

机构 * University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出层次对比学习框架,通过统一模型学习全局共享、部分共享和模态特定的表示,解决多模态数据中部分共享因素的建模问题,提升预测性能。

Comments 34 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏