Multimodal Mixture-of-Experts with Retrieval Augmentation for Protein Active Site Identification
多模态专家混合模型与检索增强用于蛋白质活性位点识别
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 MERA通过检索增强和可靠性引导的多专家模型,实现了蛋白质活性位点识别的高精度预测和性能提升。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
多模态专家混合模型与检索增强用于蛋白质活性位点识别
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 MERA通过检索增强和可靠性引导的多专家模型,实现了蛋白质活性位点识别的高精度预测和性能提升。
NaiLIA:基于密集意图描述和调色板查询的多模态美甲设计检索
机构 * Keio University(庆应大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 NaiLIA通过密集意图描述和调色板查询实现美甲设计图像的多模态检索,提升检索精度。
Comments Accepted to CVPR 2026 Findings
TRACE:面向通用多模态检索的任务自适应推理与表征学习
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 TRACE通过结合生成推理与判别表征学习,实现通用多模态检索中的任务自适应推理,提升检索准确率与推理效率,同时具备强零样本迁移能力。
NICO-RAG:多模态超图检索增强生成用于理解尼古丁公共卫生危机
机构 * University of Arkansas(亚拉巴马大学) ; University of Arkansas for Medical Sciences(亚拉巴马大学医学科学分校)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 NICO-RAG通过多模态超图检索增强生成,解决尼古丁公共卫生危机中的信息检索与生成问题。
多模态自适应检索增强生成通过内部表示学习
机构 * Shanghaitech University School of Information Science(上海科技大学信息科学学院) ; Chinese Academy of Sciences Institute of Automation(中国科学院自动化研究所)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出MMA-RAG,通过动态评估模型内部知识置信度,提升视觉问答系统在多模态场景下的检索增强生成性能。
Comments 8 pages, 6 figures
基于FAME的公平电子健康记录预测:具有公平性的多模态嵌入
机构 * Department of Computer Science(计算机科学系)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 FAME通过公平性意识的多模态嵌入框架,在电子健康记录预测中实现性能与公平性的双重优化。
Comments 21 pages, 3 figures
Journal ref Proceedings of Machine Learning Research 2025 (Machine Learning for Healthcare, ML4H)
在RAG-as-a-Service环境中保护多模态知识版权
机构 * ShanghaiTech University(上海科技大学) ; Sun Yat-sen University(中山大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 AQUA是一种用于多模态RAG系统中图像知识保护的首个水印框架,通过嵌入语义信号实现高效、隐蔽的版权追溯。
RAGdb: 一种无依赖、可嵌入的多模态检索增强生成边缘计算架构
机构 * SKAS IT
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 RAGdb通过单文件SQLite容器实现多模态检索增强生成,无需GPU推理,提升边缘计算效率与数据主权
Comments 6 pages, 2 tables
E-MMKGR:面向电子商务应用的统一多模态知识图谱框架
机构 * UNIST(全南国立科学技术院)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 E-MMKGR提出了一种统一多模态知识图谱框架,通过GNN和图谱优化学习统一物品表示,提升电子商务推荐和搜索性能。
VGGT-MPR:基于VGGT的多模态地点识别在自动驾驶环境中的应用
机构 * Shanghai Jiao Tong University(上海交通大学) ; Beijing Institute of Technology(北京理工大学) ; National University of Defense Technology(国防科技大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 VGGT-MPR通过视觉几何基础的Transformer实现多模态地点识别,在自动驾驶中表现出强鲁棒性。
基于MLLM的弱监督类无关物体计数
机构 * College of Electronic and Information Engineering, Tongji University(电子信息工程学院,同济大学) ; College of Computer Science, Wuhan University(计算机科学学院,武汉大学) ; College of Computer Science, Tongji University(计算机科学学院,同济大学) ; State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)
专题命中 跨模态检索 :MLLM(title,abstract);分类 cs.CV
AI总结 本文提出 WS-COC,基于 MLLM 的弱监督框架,通过三种策略提升类无关物体计数性能,有效降低标注成本。
Comments Accepted at ICLR 2026
视觉概念排名揭示大型多模态模型使用的医学捷径
机构 * Stanford University(斯坦福大学) ; University of California Berkeley(加州大学伯克利分校)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出视觉概念排名方法,用于揭示大型多模态模型在医疗任务中表现的潜在视觉特征依赖性。
STaR:可扩展的任务条件检索用于长时多模态机器人记忆
机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究所) ; University of Toronto Robotics Institute(多伦多大学机器人研究所) ; Department of Earth and Space Science(地球与空间科学系) ; Lassonde School of Engineering(拉索nde工程学院) ; York University(约克大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 STaR通过任务条件检索算法提升机器人长时多模态记忆的可扩展性和上下文推理能力
MEVER:基于图的证据检索的多模态和可解释性声明验证
机构 * University of Sheffield(谢菲尔德大学) ; University of Science and Technology Beijing(北京科技大学) ; University of California San Diego(加州大学圣地亚哥分校) ; The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CL
AI总结 MEVER通过多模态图检索和解释生成,实现了准确且可解释的声明验证,同时创建了AI领域的科学数据集AIChartClaim。
Comments Accepted to EACL-26
ARK:一个双轴多模态检索基准,沿推理与知识
机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院) ; National Key Laboratory of Fundamental Algorithms and Models for Engineering Simulation, Sichuan University, China(四川省工程仿真基础算法与模型国家重点实验室)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 ARK基准通过双轴视角评估多模态检索,揭示知识密集型与推理密集型检索间的差距,发现细粒度视觉推理是主要瓶颈。
从行到推理:一种增强检索的多模态框架用于电子表格理解
机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers U.S.(普华永道美国商业技术与创新办公室)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 FRTR提出了一种多模态检索增强生成框架,通过分解电子表格为细粒度嵌入并整合多模态信息,提升了对复杂电子表格的推理能力,在基准测试中实现了显著的准确率提升。
基于多模态大语言模型的高效表格检索与理解
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; AWS(亚马逊网络服务)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 TabRAG通过多模态大语言模型实现高效表格检索与理解,显著提升检索召回率和答案准确率。
Comments Published at EACL 2026 Findings
序列作为节点的对比多模态图推荐
机构 * University of Surrey(萨里大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 MuSICRec通过多视图图方法结合协同、序列和多模态信号,提升推荐系统在冷启动和数据稀疏问题上的性能。
具有分阶段预训练的多模态生成检索模型用于美团外卖
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出一种具有分阶段预训练的多模态生成检索模型,通过分阶段任务优化和语义ID利用,提升美团外卖检索性能与商业收益。
WorldVQA:评估多模态大语言模型的原子视觉世界知识
机构 * Moonshot AI
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 WorldVQA通过评估多模态大语言模型的原子视觉知识,建立衡量其事实性和百科全书广度的基准测试。
UV-M3TL: 一种统一且多功能的多模态多任务学习框架用于辅助驾驶感知
机构 * Energy and Transportation Domain, Beijing Institute of Technology(能源与交通领域,北京理工大学) ; State Key Laboratory of Intelligent Technology and Systems and Department of Computer Science and Technology, Tsinghua University(智能技术与系统国家重点实验室和清华大学计算机科学与技术系) ; School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学) ; School of Transportation Science and Engineering and the State Key Lab of Intelligent Transportation System, Beihang University(交通运输科学与工程学院和智能交通系统国家重点实验室,北京航空航天大学) ; Beijing University of Chemical Technology(北京化工大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 UV-M3TL通过双分支结构和自适应损失机制,实现多模态多任务学习,提升辅助驾驶感知的性能与多样性。
局部-全局多模态对比学习用于分子性质预测
机构 * School of Mathematical Sciences(数学科学学院) ; University of Electronic Science and Technology of China(电子科技大学) ; Department of Computer Science and Engineer(计算机科学与工程系) ; Oakland University(奥克兰大学) ; Department of Electrical and Computer Engineering(电气与计算机工程系) ; College of Management Science(管理科学学院) ; Chengdu University of Technology(成都理工大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 LGM-CL通过局部-全局多模态对比学习框架,整合分子结构和化学语义信息,提升分子性质预测的准确性与性能。
Comments 16 pages, 9 figures. Submitted to Briefings in Bioinformatics
结构化频谱推理用于频率自适应多模态推荐
机构 * Kuaishou Technology(快手科技) ; Renmin University of China(中国人民大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出结构化频谱推理框架,通过频谱分解、可靠性调节、超光谱融合和对比正则化,提升多模态推荐的鲁棒性和泛化能力。
ExDR:基于解释的动态检索增强多模态虚假新闻检测
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; WeChat AI, Tencent(微信AI,腾讯)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 ExDR通过基于解释的动态检索增强生成框架,提升多模态虚假新闻检测的准确性和泛化能力。
Comments 11 pages, 3 figures, 7 tables
面向低功耗边缘平台的实时多模态嵌入视觉框架:用于目标检测、面部情绪识别和生物识别
机构 * 1,2Department of Mechatronics Engineering, Rajshahi University of Engineering \& Technology 3 ,4,5Department of Internet of Things ; Robotics Engineering, University of Frontier Technology, Bangladesh 6Department of Computer Science ; Engineering, Varendra University, Rajshahi, Bangladesh 7Department of Robotics, Robo Tech Valley, Dhaka, Bangladesh Emails: , , 3
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV
AI总结 本文提出了一种面向低功耗边缘平台的实时多模态视觉框架,通过自适应调度机制整合目标检测、面部识别和情绪检测,提升边缘设备上的智能感知效率与隐私保护。
GRCF: 用于多模态情感分析的两阶段组内排序与校准框架
机构 * South China Normal University(华南师范大学) ; Sun Yat-sen University(中山大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 GRCF通过两阶段组内排序与校准框架,解决多模态情感分析中点对点回归的不足,提升预测稳定性和相关性对齐。
一种基于RAG的强化学习课程学习方法:用于多模态问答
机构 * Meituan(美团)
专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);分类 cs.AI
AI总结 本文提出了一种结合课程学习与强化学习的方法,用于多模态问答任务,通过检索增强生成系统在挑战中取得优异成绩。
M$^3$Searcher: 模块化多模态信息检索代理与检索导向推理
机构 * Huawei Cloud BU(华为云业务单元)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 M$^3$Searcher是一种模块化多模态信息检索代理,通过检索导向的多目标奖励机制,提升多模态任务中的事实准确性、推理合理性和检索忠实度。
通过多模态提示调优对开放词汇目标检测器进行后门攻击
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV
AI总结 TrAP通过多模态提示调优对开放词汇目标检测器实施后门攻击,利用轻量级提示标记植入恶意行为,提升攻击成功率并改进下游任务性能。
Comments Accepted to AAAI 2026
ArtCognition:一种多模态AI框架,用于从视觉和运动学绘画线索中感知情绪状态
机构 * Department of Electrical and Computer Engineering, University of Tehran(电信工程系,德黑兰理工大学) ; Tehran Institute for Advanced Studies, Khatam University(德黑兰高级研究院,凯塔姆大学) ; Department of Psychology, Allameh Tabataba’i University(心理学系,阿勒梅·塔巴塔比大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 ArtCognition通过融合视觉和运动学绘画线索,提供非侵入性情绪状态评估的新方法,验证了其在心理测量中的潜力。
Comments 12 pages, 7 figures