Expressivity In Multimodal Contrastive Learning
多模态对比学习中的表达能力
专题命中 跨模态检索 :multimodal(title)
AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
多模态对比学习中的表达能力
专题命中 跨模态检索 :multimodal(title)
AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。
NMIRacle:从红外和核磁共振谱进行多模生成分子解析
机构 * Federico Ottomano ; Yingzhen Li ; Alex M. Ganose
专题命中 跨模态检索 :multi-modal(title)
AI总结 NMIRacle通过两阶段生成框架,利用红外和核磁共振光谱数据实现分子结构的高精度解析,优于现有方法并保持复杂性下的鲁棒性。
强化学习引导的软融合检索用于缺失模态下的鲁棒多模态模仿学习
机构 * Bournemouth University(伯恩茅斯大学)
专题命中 跨模态检索 :multimodal(title)
AI总结 提出RL4IL方法,利用强化学习策略从训练库中检索最相关专家演示,并通过软交叉注意力融合生成动作,有效处理传感器缺失问题,在LIBERO基准上超越现有方法。
GLACIER:用于分子性质预测的多模态师生基础模型
机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) ; Department of Quantitative and Computational Biology, University of Southern California(南加州大学定量与计算生物学系) ; Amazon(亚马逊) ; Department of Medical Biochemistry and Biophysics, Science for Life Laboratory, Karolinska Institutet(卡罗林斯卡学院医学生物化学与生物物理系,生命科学实验室)
专题命中 跨模态检索 :multimodal(title)
AI总结 提出GLACIER师生框架,通过融合分子图、SMILES和物理化学描述符三种模态,并利用大模型蒸馏,实现高效准确的分子性质预测。
SEM-RAG:结构保持的多模态图编译与熵引导检索用于电信标准
专题命中 跨模态检索 :multimodal(title)
AI总结 本文提出SEM-RAG框架,通过结构保持编译和熵引导检索提升电信标准文档检索性能,实验显示其在表格和公式密集型问题上表现优异,准确率高达94.1%。
AVP-Pro: 一种自适应多模态融合与对比学习方法用于全面两阶段抗病毒肽鉴定
专题命中 跨模态检索 :multi-modal(title)
AI总结 AVP-Pro通过自适应多模态融合和对比学习方法,实现了抗病毒肽的高效两阶段鉴定,提升了模型判别能力和小样本下的分类精度。
Comments arXiv admin note: substantial text overlap with arXiv:2512.21544
AVP-Fusion:适应性多模态融合与对比学习用于两阶段抗病毒肽识别
专题命中 跨模态检索 :multi-modal(title)
AI总结 AVP-Fusion通过自适应多模态融合与对比学习,实现了抗病毒肽的两阶段高效识别,显著提升准确率和决策边界。
机构 * Department of Electrical and Electronic Engineering Imperial College London(帝国理工学院电子与电气工程系) ; Department of Civil and Environmental Engineering Imperial College London(帝国理工学院土木与环境工程系) ; Institute of Biomedical Engineering Department of Engineering Science University of Oxford(牛津大学生物医学工程研究所)
专题命中 跨模态检索 :multimodal(title)
Comments 4 pages, 2 figures. Accepted for oral presentation at the 52nd international Computing in Cardiology Conference (CinC2025)
专题命中 跨模态检索 :multimodal(title)
专题命中 跨模态检索 :multimodal(title)
专题命中 跨模态检索 :multimodal(title)
Comments EMNLP2024 main
专题命中 跨模态检索 :multi-modal(title)
Comments 7 pages, 3 figures
专题命中 跨模态检索 :multimodal(title)
Comments MLHC 2024
专题命中 跨模态检索 :cross-modal(title)
Comments 6 pages, CogSci proceedings
专题命中 跨模态检索 :cross-modal(title)
专题命中 跨模态检索 :multimodal(title)
Comments Accepted for presentation at the Midwest Machine Learning Symposium (MMLS 2023), Chicago, IL, USA
专题命中 跨模态检索 :multi-modal(title)
专题命中 跨模态检索 :multi-modal(title)
Journal ref International Journal of Multimedia Information Retrieval (2022): 1-13
专题命中 跨模态检索 :cross-modal(title)
专题命中 跨模态检索 :multimodal(title)
Comments 10 pages, IEEE International Conference on Big Data 2019 (IEEE Big Data 2019)
专题命中 跨模态检索 :multimodal(title)
Comments Paper for Invited Talk at 2015 Conference on Intelligent Computer Mathematics (July, Washington DC)
DSPrompt:针对M-RAG污染的动态软提示防御
专题命中 跨模态检索 :multimodal(abstract,abstract_cn);分类 cs.CL
AI总结 本文针对M-RAG面临的对抗攻击问题,提出DSPrompt动态软提示防御框架,通过在冻结检索器编码器插入可学习软提示,以低开销实现了优于现有方法的防御效果,同时维持检索与生成性能。
FusionBERT: 多视角图像-3D检索 via 跨注意力视觉融合与正常感知3D编码器
机构 * IROOTECH TECHNOLOGY ; Wolf 1069 b Lab, Sany Group(三一集团Wolf 1069 b实验室) ; Zhejiang University(浙江大学) ; School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) ; BPIT, Sany Group(三一集团BPIT)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 FusionBERT通过跨注意力视觉融合和正常感知3D编码器,实现多视角图像-3D多模态检索,提升跨模态检索性能。
Comments 9 pages, 5 figures, 3 tables
解耦共享表示可改进形态-转录组整合
机构 * ESPCI Paris, PSL University(巴黎高等物理化工学院,PSL大学) ; Sorbonne Université(索邦大学) ; CNRS(法国国家科学研究中心) ; Inserm(法国国家健康与医学研究院) ; AP-HP(巴黎公共医疗集团) ; Inria(法国国家信息与自动化研究所) ; Paris Brain Institute – ICM(巴黎脑研究所 – ICM)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本研究针对空间转录组学的多模态表示学习问题,对比不同模型的标准与解耦变体,发现解耦共享与模态特有信息可提升相关指标,为多模态学习提供评估框架。
监督之前的感知:来自反事实盲区的自包含视觉蒸馏
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Aalto University(阿尔托大学)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。
Comments BMVC 2026
DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。
基于结构保留的细胞表型分子表示学习
机构 * Xiangtan University(湘潭大学) ; Hunan University(湖南大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Southeast University(东南大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出结构保留的PhenMol框架,通过解耦分子与细胞表示实现表型引导对齐,在多类任务上提升性能,为药物发现整合细胞表型与化学知识提供了有效途径。
MetaHGNIE:异构知识图谱中的元路径诱导超图对比学习
机构 * Jiangsu Key Laboratory of Networked Collective Intelligence, School of Mathematics, Southeast University(江苏网络集体智能重点实验室,数学学院,东南大学) ; Jiangsu Key Laboratory of Networked Collective Intelligence, School of Cyber Science and Engineering, Southeast University(江苏网络集体智能重点实验室,网络科学与工程学院,东南大学) ; State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 研究异构知识图谱中节点重要性估计问题,提出DualHNIE框架,通过构建高阶知识图谱、引入互补编码器及对比对齐机制进行显式高阶建模和解缠双通道表示学习,实验验证其优于现有方法。
Comments Accepted by IEEE Transactions on Artificial Intelligence
ClinRAG-GRAPH: 基于临床先验的检索增强图模型与领域对抗学习用于乳腺癌pCR预测
机构 * Department of Medical Imaging, Radboud University Medical Center, Nijmegen, The Netherlands(拉德堡德大学医学中心医学影像科,奈梅亨,荷兰) ; The Netherlands Cancer Institute, Amsterdam, The Netherlands(荷兰癌症研究所,阿姆斯特丹,荷兰) ; Faculty of Applied Sciences, Macao Polytechnic University, Macau, China(澳门理工大学应用科学学院,澳门,中国) ; Boston Children’s Hospital, Harvard Medical School, Boston, USA(波士顿儿童医院,哈佛医学院,波士顿,美国) ; Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong, China(中国科学院香港创新研究院人工智能与机器人创新中心,香港,中国) ; Imaging Division, University Medical Center Utrecht, Utrecht, The Netherlands(乌得勒支大学医学中心影像部,乌得勒支,荷兰) ; Department of Radiology, Fuzhou University Affiliated Provincial Hospital, Fuzhou, China(福州大学附属省立医院放射科,福州,中国) ; Department of Radiology, Yantai Yuhuangding Hospital, Shandong, China(烟台毓璜顶医院放射科,山东,中国)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出ClinRAG-GRAPH框架,通过构建患者内临床先验图、双分支领域对抗学习和大语言模型驱动的子图检索增强模块,实现术前pCR预测,在内部和外部测试集上取得良好性能。
Comments 11 pages, 5 figures
学习组合:重新审视零样本组合图像检索的代理任务设计
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出FoCo模型,通过文本锚定的视觉聚合和上下文条件语义补全两个代理任务联合学习组合函数,在零样本组合图像检索中取得最优性能。
Comments Accepted by ECCV 2026