AutoMT: A Multi-Agent LLM Framework for Automated Metamorphic Testing of Autonomous Driving Systems
专题命中 图谱与结构化RAG :RAG(abstract)
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 图谱与结构化RAG :RAG(abstract)
机构 * Ant Group(蚂蚁集团) ; ShanghaiTech University(上海科技大学) ; Zhejiang University(浙江大学) ; Shanghai Jiaotong University(上海交通大学)
专题命中 图谱与结构化RAG :RAG(abstract)
Comments 35 pages, 10 figures
专题命中 图谱与结构化RAG :knowledge retrieval(abstract)
专题命中 图谱与结构化RAG :RAG(abstract)
专题命中 图谱与结构化RAG :RAG(abstract)
专题命中 图谱与结构化RAG :RAG(abstract)
Comments AAAI2025
专题命中 图谱与结构化RAG :retriever(abstract)
Comments Accepted by ICLR 2024
专题命中 图谱与结构化RAG :retriever(abstract)
Comments ICLR 2024
专题命中 图谱与结构化RAG :retriever(abstract)
Comments To appear, NeurIPS 2018
VLD-RAG:用于长的、视觉丰富的多页文档的智能视觉语言检索增强生成
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(title,abstract);hybrid retrieval(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 研究针对视觉丰富的长文档问答的多模态检索增强生成,提出VLD-RAG框架,构建多模态索引并采用混合检索策略,经智能体工作流程协调,在相关基准上提升了证据页面检索及问答表现,凸显协调验证与混合检索的重要性。
MG$^2$-RAG:多粒度图用于多模态检索增强生成
机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(title,abstract);分类 cs.IR、cs.AI
AI总结 MG$^2$-RAG通过构建层次化多模态知识图谱,融合文本与视觉信息,提升多模态检索与生成性能,实验显示其在四个任务中均取得最佳效果,同时显著提升效率。
事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架
机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) ; Tianjin University(天津大学) ; Institute of Computing and Intelligence(计算与智能研究所) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) ; Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) ; School of Future Technology(未来技术学院) ; Shanghai University(上海大学)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(title);分类 cs.AI
AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。
RAG-Audio:用于忠实脑电信号到音频重建的检索增强生成
机构 * CVML Lab(CVML实验室)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(title);分类 cs.AI
AI总结 RAG-Audio通过检索真实音频样本初始化生成器采样轨迹,缓解脑电到音频生成的先验主导问题,在Brain2Music数据集上提升了刺激识别准确率并大幅降低Fréchet音频距离。
GraphLoom:面向多模态KG-RAG的可靠性校准图证据路由
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Aristotle University(亚里士多德大学) ; Dashub(达舒布)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);knowledge retrieval(abstract);分类 cs.AI
AI总结 提出GraphLoom框架,通过可靠性校准的图证据路由实现多模态KG-RAG,在ScienceQA等数据集上提升了答案质量与证据忠实度。
数字化教练智能:基于VLM和RAG的整体运动员画像智能体框架
机构 * A.K. Choudhury School of Information Technology University of Calcutta(A.K.楚德里信息科技学院印度加尔各答大学)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);vector search(abstract);分类 cs.AI
AI总结 提出基于LLM的混合智能体框架,结合计算机视觉与视觉语言模型,通过3×3智能网格分块策略降低计算开销,并引入LLM-as-a-Judge自校正循环和双持久化RAG管道,实现符合印度体育局标准的自动化整体运动员评估。
Comments 16 pages
自动化Iconclass:LLM和RAG用于大规模宗教木刻版画分类
机构 * University College Dublin(都柏林大学)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);vector search(abstract);分类 cs.IR
AI总结 本文提出利用LLM和向量数据库结合RAG技术,实现早期现代宗教图像的高效分类,通过全页上下文生成描述并匹配Iconclass代码,提升分类精度至92%。
Comments 29 pages, 7 figures. First presented at the "Digital Humanities and Artificial Intelligence" conference at the University of Reading on 17 June 2024
Journal ref Digital Culture and Education 16(3):161-182, 2026
QV-PIC:面向高效RAG服务的查询感知视觉位置无关缓存
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 QV-PIC是一种查询感知双分辨率PIC复用框架,通过离线编译视觉缓存、在线分分辨率处理,解决渲染图像PIC质量下降问题,在6项RAG任务中显著提升F1并降低TTFT。
Tell Me:基于LLM的心理健康助手,集成RAG、合成对话生成与智能体规划
机构 * Fujitsu Research of America(富士通美国研究)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 提出Tell Me系统,利用大语言模型通过RAG实现个性化对话、合成客户-治疗师对话生成以及智能体规划生成自我护理计划,旨在提供可及的心理支持而非替代专业治疗。
Comments 8 pages, 2 figures, 1 Table. Submitted to the Computation and Language (cs.CL) category. Uses the ACL-style template. Code and demo will be released at: https://github.com/trystine/Tell_Me_Mental_Wellbeing_System
SMA:谁说的?半黑盒RAG控制中的成员泄露审计
机构 * Sun Yat-Sen University(孙中山大学) ; Nanyang Technological University(南洋理工大学) ; University of Chinese Academy of Science(中国科学院大学) ; Zhongguancun Academy(中关村学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本研究针对半黑盒RAG控制中的成员泄露问题,提出首个源感知成员审计SMA,通过零阶优化归因估计机制与跨模态归因技术,实现生成内容的细粒度来源归因,为复杂生成系统的数据来源审计提供新视角。
DualG-MRAG:面向多模态检索增强生成的宏观推理与微观匹配解耦框架
机构 * Beihang University(北京航空航天大学) ; SKLCCSE
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(title,abstract);retriever(abstract,abstract_cn);分类 cs.AI
AI总结 针对多模态RAG在复杂多跳推理中存在的问题,本文提出DualG-MRAG框架,通过解耦宏观推理与微观匹配抑制检索噪声,经实验验证其在证据召回和问答准确率上优于基线。
Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 12 pages
零努力图像到音乐生成:一种可解释的基于RAG的视觉语言模型方法
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The University of Hong Kong(香港大学) ; The Hong Kong University of Science(香港科学大学) ; The Hong Kong Polytechnic University Hong Kong China(香港理工大学香港中国) ; The University of Hong Kong Hong Kong China(香港大学香港中国)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文提出一种基于RAG的视觉语言模型方法,实现图像到音乐生成,通过ABC记谱法连接文本与音乐模态,并利用多模态检索增强生成和自反思技术,提供高可解释性且低计算成本的音乐生成方案。
MIRROR: 基于新颖性约束的记忆引导MCTS红队测试用于智能体RAG
机构 * Fujitsu Research of Europe, United Kingdom(欧洲富士通研究机构,英国) ; Fujitsu Limited, Japan(日本富士通有限公司)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出MIRROR框架,通过记忆引导蒙特卡洛树搜索和显式新颖性约束,在多模态智能体RAG系统的四个攻击面上实现高攻击成功率,并降低跨表面方差。
Comments 6 pages, 2 figures. Accepted at the 2026 International Joint Conference on Neural Networks (IJCNN 2026), IEEE WCCI 2026; presented as an oral talk. Code and ART-SafeBench benchmark: https://github.com/FujitsuResearch/mirror
MAGE-RAG:面向长文档问答的多粒度自适应图证据多模态RAG
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态RAG :RAG(title,title_cn);分类 cs.IR、cs.CL、cs.AI
AI总结 提出MAGE-RAG框架,通过离线构建包含页面和元素节点的证据图,在线自适应构建证据子图,平衡证据覆盖与噪声控制,在长文档多模态问答中取得最优性能。
MM-PoisonRAG:通过局部和全局投毒攻击破坏多模态RAG
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California Los Angeles(加州大学洛杉矶分校)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出MM-PoisonRAG框架,通过局部投毒攻击(LPA)和全局投毒攻击(GPA)两种策略,系统研究多模态检索增强生成(RAG)在知识投毒下的脆弱性,实验表明攻击成功率高达56%且能绕过现有防御。
Comments Code is available at https://github.com/HyeonjeongHa/MM-PoisonRAG
从场景到元素:面向可验证多模态RAG的多粒度证据检索
机构 * NLP 2 CT Lab, Department of Computer and Information Science, University of Macau(NLP2CT实验室,计算机与信息科学系,澳门大学)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本文提出GranuRAG框架,通过多粒度跨模态对齐和元素级检索,解决多模态RAG中粗粒度证据与细粒度查询不匹配的问题,提升可验证性。
VLADriver-RAG:基于检索增强的视觉-语言-动作模型用于自动驾驶
机构 * College of Automotive Engineering(汽车工程学院) ; The National Key Laboratory of Automotive Chassis Integration and Bionics(汽车底盘集成与生物力学国家级重点实验室) ; ReeFocus AI Technology(ReeFocus人工智能技术)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文提出VLADriver-RAG,通过构建结构化的历史知识,提升自动驾驶中长尾场景的泛化能力,采用视觉到场景机制和场景对齐嵌入模型,结合查询驱动的VLA骨干网络,实现高精度轨迹合成。
Retina-RAG:基于检索增强的视觉-语言模型用于联合视网膜诊断和临床报告生成
机构 * Friedrich-Alexander-Universität(弗里德里希-亚历山大大学)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 Retina-RAG通过整合高精度视网膜分类器和参数高效视觉语言模型,实现糖尿病视网膜病变分级、黄斑水肿检测及报告生成,优于现有方法,且在单块消费级GPU上运行。
Comments 10 pages, 5 figures. Submitted to MICCAI 2026
从云层到幻觉:遥感视觉-语言RAG中的大气检索劫持
机构 * China University of Petroleum, Beijing at Karamay(中国石油大学(北京)克拉玛依校区)
专题命中 多模态RAG :RAG(title,title_cn);retriever(abstract);分类 cs.AI
AI总结 研究提出CloudWeb攻击,通过修改输入图像实现遥感多模态RAG中的大气证据劫持,展示了大气变化对检索阶段的影响,并揭示了自然外观的天气变化可能破坏证据检索。
净化多模态检索:用于RAG的片段级证据选择
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR
AI总结 本文提出FES-RAG框架,通过片段级证据选择提升多模态检索效果,减少噪声干扰,实验显示在M2RAG基准上性能提升27%。
UniDoc-RL: 基于分层动作和密集奖励的粗到细视觉RAG
机构 * DeepGlint-AI
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 UniDoc-RL通过分层动作空间和密集奖励方案,提升视觉RAG系统的细粒度视觉语义处理能力,实现端到端训练,实验显示优于现有方法。
Comments 17 pages, 11 figures