RRM: Experience-Driven Reflective Retrieval Memory for Long-Horizon Multimodal Reasoning
RRM:用于长周期多模态推理的经验驱动反思式检索记忆
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 该研究针对现有多模态长期智能体检索机制不足的问题,提出RRM框架,通过反思式经验记忆提炼跨任务检索策略,在多个多模态推理数据集上取得优于现有方法的性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
RRM:用于长周期多模态推理的经验驱动反思式检索记忆
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 该研究针对现有多模态长期智能体检索机制不足的问题,提出RRM框架,通过反思式经验记忆提炼跨任务检索策略,在多个多模态推理数据集上取得优于现有方法的性能。
使用开源语言模型进行科学文档理解的多模态混合检索增强生成
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 针对科学文档理解中大型语言模型的问题,提出多模态混合检索增强生成系统。利用开源视觉语言模型生成摘要,结合多种检索方法并优化,采用查询压缩器确保连贯性。经评估,该系统提高了检索质量,验证了开源模型与先进策略结合的竞争力。
Comments 7 pages, 1 figure, 4 tables
DICA:多模态大语言模型中的双指标引导对比对齐
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。
用于源感知多模态错误信息检测的验证笔记本学习
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 针对多模态错误信息检测,提出验证笔记本学习框架VNL,通过构建包含决策原则等的笔记本,在推理时指导验证新示例,实验显示其性能优于基线,能提高源归因且紧凑可解释,无需模型训练积累知识。
使用小型多模态语言模型进行伤口分类的上下文学习
机构 * Jönköping University(延雪平大学) ; Halmstad University(哈尔姆斯塔德大学) ; Mölnlycke Health Care(墨尼克医疗保健公司) ; Centre for Reliable Machine Learning, Royal Holloway, University of London(伦敦大学皇家霍洛威学院可靠机器学习中心)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 研究评估小型多模态语言模型能否通过基于检索的上下文学习为伤口分类提供免训练替代方案,使用两个数据集和多种方法实验,结果显示查询条件下的上下文学习效果较好,Qwen 3.5 27B搭配kNN+MMR表现最佳,该方法可实现适应性伤口图像分类。
Eddy-VL 1.9B:用于边缘可部署多模态嵌入的结构剪枝与分层蒸馏
机构 * Urock-AI Lab(Urock人工智能实验室)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 介绍用于边缘可部署视觉语言检索的Eddy-VL 1.9B模型,采用探针驱动结构剪枝和分层知识蒸馏压缩,参数减少约9.5%,在MMEB-V2等评估中保留教师模型大部分性能,降低延迟,证明其在受限边缘部署下多模态检索的有效性。
Comments 11pages,4figures,Model weights and inference code are available on Hugging Face
在6GB 2011 GPU上的现代多模态助手:针对费米架构的阶段验证、全GPU CUDA推理
机构 * Department of Physics, University of Puerto Rico(物理系,波多黎各大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 研究在6GB 2011费米GPU上部署MiniCPM-V-4.6多模态助手,通过构建全GPU引擎、移植验证视觉部分、优化长上下文处理等方法,实现了高效的推理,能在1.7秒内端到端回答图像问题。
用于自动驾驶的多模态场景相似性搜索
机构 * aiMotive(爱莫提夫)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 研究自动驾驶场景相似性搜索,提出多模态框架结合视觉与轨迹表示,对比两种基于轨迹的方法与视觉基线,实验表明轨迹表示在运动事件中性能强,视觉嵌入在外观线索丰富时出色,结合二者可提升检索质量。
2026年EXIST竞赛中的AI奇才:用于表情包中多模态性别歧视识别的分层软标签学习
机构 * EXIST Lab(EXIST实验室) ; CLEF(信息检索评价论坛) ; Swiss Data Science Center, ETH Zürich(瑞士苏黎世联邦理工学院瑞士数据科学中心) ; Everest Systems GmbH(珠穆朗玛峰系统有限公司) ; Villanova.ai S.P.A(维拉诺瓦人工智能股份公司)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 针对表情包多模态性别歧视识别,将任务分层建模为基于经验注释者分布的条件软标签预测,用轻量级门控MLP映射视觉语言表征,在竞赛中取得好成绩。
ELVA:探索排序驱动的通用多模态检索
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) ; Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) ; MiLM Plus ; Xiaomi Inc(小米公司) ; Zhongguancun Academy(中关村学院) ; Beijing, China(北京市)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 提出ELVA框架,通过基于规则的强化学习缓解对比学习中的粒度盲视问题,在通用多模态检索中实现排序优化,并在新基准MRBench上提升13.1%。
Comments Accepted by ECCV 2026
InduceKV: 通过诱导KV记忆实现多模态大语言模型的固定足迹持续适应
机构 * Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 提出InduceKV方法,通过检索将训练前缀存储为注意力就绪的记忆条目,在固定内存预算下实现多模态大语言模型的持续适应,无需更新骨干模型。
MKG-RAG-Bench:多模态知识图谱增强生成中的检索基准
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Michigan State University(密歇根州立大学) ; Dalian University of Technology(大连理工大学) ; Stony Brook University(石溪大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 提出MKG-RAG-Bench基准,通过构建跨领域多模态知识图谱和问答数据集,系统评估多模态知识图谱增强生成中的检索性能,揭示检索质量对生成结果的决定性作用。
Comments Accepted by KDD'26
探索多模态大语言模型与两阶段微调在时尚图像检索中的应用
机构 * University of Science, VNU-HCM(胡志明市国家大学下属理科大学) ; Vietnam National University, Ho Chi Minh(胡志明市国家大学)
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV
AI总结 提出融合多模态大语言模型(LLaVA)生成属性感知三元组,并采用两阶段微调策略增强对比学习,以解决时尚图像检索中标注数据稀缺和负采样简单的问题。
Comments SOICT 2025
G2IA: 几何引导的实例感知跨模态地点识别检索与精炼
机构 * Shanghai Jiao Tong University(上海交通大学) ; National University of Defense Technology(国防科技大学)
专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV
AI总结 提出G2IA框架,通过几何引导的实例感知检索和跨模态局部形状与空间布局验证,解决图像到点云地点识别中的模态差异和感知混淆问题。
GRIP:面向大型多模态模型的反馈引导提示检索
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Bonn(波恩大学) ; Microsoft(微软)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 提出GRIP,一种可学习的视觉检索框架,利用多模态模型反馈识别真正提升上下文学习性能的示例,在分类、描述和VQA任务上优于基于相似度的检索。
一种使用多模态生理监督的鲁棒PPG基础模型
机构 * Dolby Laboratories(杜比实验室)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 提出一种PPG基础模型,利用ICU数据集中的心电和呼吸信号选择对比样本,无需高质量或场域数据预训练,在15个下游任务中14个取得性能提升。
SARLO-80:全球斜距SAR语言光学数据集80cm
机构 * DEMR-ONERA – The French Aerospace Lab, Université Paris-Saclay(法国航空航天实验室DEMR-ONERA,巴黎-萨克雷大学) ; DTIS-ONERA – The French Aerospace Lab, Université Paris-Saclay(法国航空航天实验室DTIS-ONERA,巴黎-萨克雷大学) ; Hugging Face
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
AI总结 为解决高分辨率SAR与光学图像及文本对齐的数据稀缺问题,基于Umbra SLC数据构建了80cm斜距网格的SAR-光学-文本三元组数据集,支持跨模态检索与生成任务。
Mr.Dec:用于30天再入院预测的日尺度纵向多模态建模
机构 * Yeji X
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 本研究提出Mr.Dec模型,通过Transformer解码器整合每日EHR与CXR数据,结合疾病特异性监督对比学习,在MIMIC-IV等数据集上实现30天再入院预测的SOTA性能,还可识别住院关键天数提供临床解释。
Comments MICCAI 2026 MultiTab Workshop Oral
电商中产品媒体排序的序列多模态证据优化
机构 * Amazon.com Inc.(亚马逊公司)
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 针对电商产品媒体排序问题,本文提出SMEO框架,通过轨迹效用模型和生存加权自回归策略优化,提升转化率并减少消费者划动次数。
Comments Proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026), Rome, Italy
FiGuRO:面向多模态数据的本征维度估计
专题命中 跨模态检索 :multi-modal(title,abstract)
AI总结 本研究提出FiGuRO框架,用于在模型容量与超参数约束下估计单/多模态数据的本征维度,可实现共享与私有信息解耦,性能优于现有技术且可应用于单模态预训练模型。
DocMemo:面向多模态文档理解的概率记忆引导检索动态证据发现框架
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中 跨模态检索 :multi-modal(title);分类 cs.CL、cs.AI、cs.MM
AI总结 针对长文档理解的静态检索与跨轮记忆局限,提出记忆引导框架DocMemo,通过三层记忆与多轮优化实现动态证据发现,在3个基准上取得SOTA性能。
Comments DocMemo is a memory-guided framework for long-document reasoning that uses tri-level memory and dynamic Bayesian belief updating to overcome static retrieval limits and improve evidence tracking. 16 pages, 4 figures, 14 tables
个性化模态加权真的是个性化的吗?多模态推荐器中每用户加权声明的受控审计
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 该研究审计多模态推荐器的每用户模态加权是否真正个性化,发现单一全局模态权重已提供几乎全部内容增益,每用户加权无一致效用,建议将real-GM与real-shuf作为个性化声明的最低证据标准。
贝叶斯数据重加权改进基于知识的视觉问答的多模态检索
机构 * University at Buffalo(布法罗大学) ; NEC Laboratories America(美国 NEC 实验室) ; Adobe Research(奥多比研究院) ; Iowa State University(爱荷华州立大学) ; New York University(纽约大学)
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。
面向语义物联网数字孪生平台中三维相似度搜索的多模态嵌入
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 本文针对语义物联网数字孪生平台缺乏三维相似度搜索能力的问题,提出多模态嵌入框架,在Thing'in平台实现后经S3DIS验证,可支持混合本体-向量查询,满足相关领域的三维相似度搜索需求。
Journal ref 4th International Workshop on the Semantic WEb of EveryThing (SWEET 2026), co-located with ICWE 2026, Jun 2026, Lyon, France
FinAbstain:用于选择性金融预测的不确定性校准多模态检索增强生成模型
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 研究针对大语言模型在金融预测中证据不足时高置信度的问题,提出FinAbstain框架,通过多模态检索增强生成及选择性预测,经多种不确定性评估方法和指标评估,贡献了时间安全架构、复合不确定性公式和可重复评估蓝图。
多模态CoLRAG-TF:复杂PDF的三重过滤检索
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 研究针对异构PDF集合检索增强生成的挑战,提出多模态CoLRAG-TF四轴融合架构,集成多种技术。构建多模态索引,经贝叶斯优化确定融合权重。实验显示其检索召回率高,多跳答案相似性提升显著,还适用于视觉输入,提供通用框架。
Comments 18 pages, 8 tables, 9 figures
一种使用SPHEREx分光光度法和DESI遗产调查成像的恒星-星系分离多模态方法
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 研究利用多模态模型,结合光学宽带成像与SPHEREx近红外分光光度法,通过对比学习分离恒星和星系。经实验,变换表示训练的分类器效果更好,能将恒星污染控制在百分之一以下,凸显多模态方法对现代星系调查的实用价值。
Comments 22 pages, 14 figures
PolySim:用于CiM上跨模态检索的确定性多项式代理
专题命中 跨模态检索 :cross-modal(title,abstract)
AI总结 研究边缘设备跨模态检索在CiM硬件部署问题,提出PolySim框架,将概率检索转为确定性管道,用低阶多项式基近似高斯嵌入维度,经实验其提升R@1,减少推理计算,是首个在CiM硬件实现概率跨模态检索的方法。
Comments Accepted by ICCAD 2026
用于减轻 3D 医学成像中假阴性的多模态语义感知对比学习
机构 * University of Toronto(多伦多大学) ; The Hospital for Sick Children(病童医院) ; Vector Institute(向量研究所) ; University Hospital Augsburg(奥格斯堡大学医院)
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 研究针对3D医学成像中假阴性问题,提出多模态语义感知对比学习框架MseaCL,通过纳入放射学报告语义相似性作指导信号,经实验验证该框架用于预训练可提升下游任务表现,如儿科脑肿瘤分子分类AUC至少增22.6%。
用于序列推荐中大型预训练多模态嵌入模型的流感知侧适应
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 针对大型预训练多模态嵌入模型用于序列推荐时因域不对准性能不佳的问题,提出Stresa框架,通过流感知隐藏适配器融合和残差流适配器,有效解锁模型潜力,实验证明其性能优于标准侧适配器和基线。
Comments Accepted by ACM MM2026