Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
Comments Code is available at https://github.com/cnzzx/VSA
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
Comments Code is available at https://github.com/cnzzx/VSA
专题命中 多模态RAG :retrieval augmented generation(abstract);分类 cs.CL、cs.AI
专题命中 多模态RAG :retriever(abstract);分类 cs.AI、cs.DB
Comments Governance, Understanding and Integration of Data for Effective and Responsible AI (GUIDE-AI '24), June 14, 2024, Santiago, AA, Chile
专题命中 多模态RAG :vector search(abstract);分类 cs.IR、cs.DB
Comments This paper has been accepted by ICDE 2024
专题命中 多模态RAG :retriever(abstract);分类 cs.CL、cs.AI
Comments CVPR 2023
专题命中 多模态RAG :RAG(abstract);分类 cs.CL、cs.AI
Comments Accepted to EMNLP 2022 main conference
专题命中 多模态RAG :retriever(abstract);分类 cs.CL、cs.AI
Comments Accepted by ACL 2021 main conference
是看不见还是不知道?归因视觉语言模型中的错误
机构 * MBZUAI The University of Melbourne(MBZUAI墨尔本大学)
专题命中 多模态RAG :knowledge retrieval(abstract);分类 cs.CL
AI总结 研究视觉语言模型在回答需额外知识问题时的错误,提出统一框架分离失败模式,探讨预生成信号能否预测错误源,发现可在解码前预测,能据此进行针对性干预。
通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉
机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。
Comments 29 pages, 9 figures
显著知识路径:用于高效知识密集型多模态问答的稀疏跨模态路由
专题命中 多模态RAG :dense retrieval(abstract);分类 cs.AI
AI总结 研究知识密集型多模态问答,提出SKIP架构,通过问题引导视觉令牌修剪等方法,沿稀疏路径计算路由,结合自适应预算控制器,在五个基准测试中,以更少计算量和更低延迟达到或超越密集基线准确性。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026) Workshop on Efficient Multimodal Question Answering (EMM-QA), Seoul, South Korea. Copyright 2026 by the author(s). (Archival)
ViMax: 智能体视频生成
机构 * The University of Hong Kong(香港大学) ; South China University of Technology(华南理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出ViMax框架,通过多智能体协作实现长视频生成,利用分层叙事引擎和视觉一致性机制,保证叙事连贯性和视觉一致性。
Comments 20 pages, 13 figures
MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准
机构 * Tsinghua University(清华大学)
专题命中 多模态RAG :retriever(abstract);分类 cs.AI
AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。
ManimAgent: 用于视觉教育的自进化多模态智能体
机构 * University of Alberta(阿尔伯塔大学) ; Southeast University(东南大学) ; Virginia Tech(弗吉尼亚理工学院) ; Xidian University(西安电子科技大学) ; Vivavia Inc(Vivavia公司)
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出ManimAgent,通过双通道情节记忆库跨任务传递反思经验,无需权重更新或人工种子,在代码生成任务中提升通过率并减少反思轮次。
Comments Project page: https://manimagent.github.io/. Code: https://github.com/jwj1342/Paper2Manim
阅读,而非思考:理解并弥合多模态大语言模型中文本变为像素时的模态差距
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Amazon(亚马逊) ; New York University(纽约大学) ; Texas A&M University(德克萨斯大学)
专题命中 多模态RAG :knowledge retrieval(abstract);分类 cs.CL
AI总结 本文系统诊断多模态大语言模型在处理图像文本时的模态差距,发现其源于模型推理意愿不足而非感知失败,并提出一种轻量级自蒸馏方法有效弥合该差距。
WISE:一种用于视觉场景、音频、物体、人脸、语音和元数据的多模态搜索引擎
机构 * Engineering Science University of Oxford(工程科学大学牛津)
专题命中 多模态RAG :vector search(abstract);分类 cs.IR
AI总结 提出WISE开源多模态搜索引擎,整合场景级和物体级的自然语言与反向图像查询、人脸搜索、音频事件检索、语音转录搜索及元数据过滤,支持跨模态组合查询,采用向量搜索实现高效扩展,可本地部署。
Comments Software: https://www.robots.ox.ac.uk/~vgg/software/wise/ , Online demos: https://www.robots.ox.ac.uk/~vgg/software/wise/demo/ , Example Queries: https://www.robots.ox.ac.uk/~vgg/software/wise/examples/
Journal ref International ACM SIGIR Conference on Research and Development in Information Retrieval (2026)
基于知识的LLM决策支持系统:用于激光粉末床融合的可解释缺陷分析与缓解指导
机构 * Department of Mechanical Engineering, University of Massachusetts Dartmouth(达特茅斯大学机械工程系)
专题命中 多模态RAG :knowledge retrieval(abstract);分类 cs.AI
AI总结 本文提出一种整合结构化缺陷知识与LLM推理的知识驱动决策支持系统,用于制造业中激光粉末床融合的可解释缺陷诊断与缓解指导。系统基于包含27种已知缺陷类型的知识库,支持模糊自然语言查询、文献支持的缺陷解释及基于编码工艺知识的缺陷原因和缓解策略指导。
Comments 28 pages, 15 figures
AnalogRetriever: 为模拟电路检索学习跨模态表示
机构 * Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; University of Cambridge(剑桥大学) ; Nanjing University of Posts and Telecommunications(南京邮电大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文提出AnalogRetriever,通过构建高质量数据集和三模态检索框架,实现跨模态的模拟电路检索,实验表明其在六个方向上的Recall@1达到75.2%,显著优于现有方法。
Comments 10 pages, 7 figures. Yihan Wang and Lei Li contributed equally to this paper
Re:Verse -- 能读懂漫画吗?
机构 * University of Central Florida(中央佛罗里达大学) ; Indian Institute of Technology, Jodhpur(印度理工学院,朱达浦尔) ; Indian Institute of Technology, Varanasi(印度理工学院,瓦拉纳西)
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本文通过分析漫画叙事理解,揭示现有VLM在时间因果和跨面板连贯性上的不足,提出新的评估框架,系统研究长篇叙事理解能力。
Comments Accepted (oral) at ICCV (AISTORY Workshop) 2025
Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 3820-3830
基于MLLM的视觉丰富文档理解综述:方法、挑战与新兴趋势
机构 * The University of Western Australia(西澳大学) ; The University of Melbourne(墨尔本大学) ; Weill Cornell Medicine(韦尔·柯尔医学中心)
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文综述了基于MLLM的视觉丰富文档理解最新进展,探讨了文本、视觉和布局特征的表示与整合技术,以及预训练、指令微调等训练方法,分析了数据稀缺、多页文档处理等挑战及新兴趋势。
Comments Accepted at ACL 2026 Findings
IMACT-CXR:一种用于胸部X光解读的交互式多智能体对话教学系统
机构 * University of Houston(德克萨斯大学休斯敦分校) ; Emory University(埃默里大学)
专题命中 多模态RAG :knowledge retrieval(abstract);分类 cs.AI
AI总结 IMACT-CXR通过整合空间标注、注视分析、知识检索和图像基础推理,构建了一个基于AutoGen的工作流,帮助学员提升胸部X光解读能力,实现了精准的教学反馈与知识强化。
Comments Accepted at IEEE ISBI 2026. This version corresponds to the accepted manuscript
Lang2Act: 通过自涌现语言工具链实现细粒度视觉推理
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) ; Alibaba Group, Hangzhou, China(阿里巴巴集团)
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.AI
AI总结 Lang2Act通过自涌现语言工具链提升视觉感知与推理能力,采用强化学习框架优化VLMs的视觉感知和下游任务性能,实验显示其在视觉感知能力上有显著提升。
通过组件导向的多模态知识增强专门化大型模型进行甲骨文解读
机构 * College of Software, Jilin University(吉林大学软件学院) ; School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) ; School of Archaeology, Jilin University(吉林大学考古学院) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MoE, China(教育部知识驱动人机智能工程研究中心)
专题命中 多模态RAG :knowledge retrieval(abstract);分类 cs.CL
AI总结 本文提出一种基于组件的多模态知识增强框架,利用视觉语言模型和语言模型代理进行组件识别与语义推理,通过专家标注的OB-Radix数据集提升甲骨文解读的精度与细节。
BRIDGE:通过强化学习查询对齐实现多模态到文本检索
机构 * High institute for computer & information systems(高等计算机与信息系统学院) ; Chungbuk National University(忠北大学) ; Assiut University(艾斯尤特大学) ; University of Innsbruck(因斯布鲁克大学)
专题命中 多模态RAG :retriever(abstract);分类 cs.IR
AI总结 BRIDGE通过强化学习查询对齐模型和增强神经搜索检索器,解决多模态查询在文本库中的检索问题,实现优于多模态编码器的nDCG@10性能。
Comments Accepted at CVPR 2026 Workshop GRAIL-V
通过紧凑双向架构实现图像描述
机构 * School of Big Data and Statistics, Anhui University(安徽大学大数据与统计学院) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ; Intelligent Interconnected Systems Laboratory of Anhui Province (Hefei University of Technology)(安徽省智能互联系统实验室(合肥工业大学)) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息学院) ; JD Explore Academy, JD.com Inc(京东探索研究院) ; State Key Laboratory of Digital Intelligent Technology for Unmanned Coal Mining, Anhui University of Science and Technology(安徽理工大学深部煤矿采动响应与灾害防控国家重点实验室)
专题命中 多模态RAG :retriever(abstract);分类 cs.CL
AI总结 本文提出紧凑双向Transformer模型,通过并行解码器隐式和显式利用双向上下文,经消融研究发现其比显式交互机制更重要,结合词级融合进一步提升效果,并扩展至LSTM基座实现新SOTA结果。
CiQi-Agent:在多模态代理中对视觉、工具和美学的对齐用于中国瓷器的文化推理
机构 * Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shaanxi Academy of Cultural Relics Conservation(陕西省文物保护研究院)
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文提出CiQi-Agent,通过多图像输入、视觉工具调用和多模态检索增强生成,实现对瓷器六个属性的精细分析,同时构建了专家标注的CiQi-VQA数据集和对齐的CiQi-Bench基准,实验表明其在六个属性上的准确率比GPT-5高12.2%。
OmniRAG-Agent:面向低资源长音频视频的代理多模态推理
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本文提出OmniRAG-Agent,通过构建图像音频检索增强生成模块和代理循环,解决低资源长音频视频问答中的高成本编码、弱细粒度检索等问题,实验表明其在低资源环境下表现优异。
ExpressMind:一种用于高速公路运营的多模态预训练大语言模型
机构 * Beihang University(北航) ; Shandong Hi-speed Group Co., Ltd(山东高速集团有限公司) ; Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 多模态RAG :RAG(abstract);分类 cs.AI
AI总结 本文提出ExpressMind,一种针对高速公路运营的多模态预训练大语言模型,通过构建全栈数据集和双层预训练方法,提升事件检测、安全响应生成和复杂交通分析能力。
AutothinkRAG: 多模态文档问答中检索增强推理的复杂度感知控制
机构 * Dalian University of Technology(大连理工大学) ; Tsinghua University(清华大学) ; Meituan LongCat Interaction Team(美团LongCat交互团队)
专题命中 多模态RAG :RAG(abstract);分类 cs.IR
AI总结 本文提出AutoThinkRAG,通过查询复杂度路由器和感知-推理解耦架构,提升多模态文档问答的效率与鲁棒性,实验表明在DocBench和MMLongBench上准确率提升,且降低计算与成本消耗。
基于检索增强的增强双注意力框架的目标感知多模态孟加拉语仇恨表情识别
机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,BRAC大学) ; Department of Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程系,Ahsanullah科技大学)
专题命中 多模态RAG :RAG(abstract);分类 cs.CL
AI总结 本文提出基于检索增强的增强双注意力框架,用于目标感知多模态孟加拉语仇恨表情识别,通过语义对齐提升类别平衡和多样性,实验表明xDORA和RAG-Fused DORA在识别和检测任务中表现优异。
BLUEPRINT 重筑遗产:面向复杂工程图纸和文档的多模态检索
机构 * Oak Ridge National Laboratory(橡树岭国家实验室) ; Colorado State University(科罗拉多州立大学)
专题命中 多模态RAG :dense retrieval(abstract);分类 cs.IR
AI总结 Blueprint通过布局感知的多模态检索系统,提升对复杂工程图纸和文档的自动化检索能力,实现结构化元数据生成与跨设施搜索效率提升。
Comments 20 pages 8 main + 12 appendix + references