arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 8633 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 多模态RAG 557 篇

2103.05284 2021-03-10 cs.CV cs.CL 57%

Open-book Video Captioning with Retrieve-Copy-Generate Network

Ziqi Zhang, Zhongang Qi, Chunfeng Yuan, Ying Shan, Bing Li, Ying Deng, Weiming Hu

专题命中 多模态RAG :retriever(abstract);分类 cs.CL

Comments Accepted by CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.10460 2019-12-02 cs.LG cs.CL cs.CV 57%

Neural Storyboard Artist: Visualizing Stories with Coherent Image Sequences

Shizhe Chen, Bei Liu, Jianlong Fu, Ruihua Song, Qin Jin, Pingping Lin, Xiaoyu Qi, Chunting Wang, Jin Zhou

专题命中 多模态RAG :retriever(abstract);分类 cs.CL

Comments ACM MM 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06558 2024-11-19 cs.CV 56%

Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement

Zhennan Chen, Yajie Li, Haofan Wang, Zhibo Chen, Zhengkai Jiang, Jun Li, Qian Wang, Jian Yang, Ying Tai

专题命中 多模态RAG :RAG(abstract,comments)

Comments Code is available at https://github.com/NJU-PCALab/RAG-Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16721 2026-08-18 cs.CV 新提交 50%

GenRouter: Unified Workflow Routing for Agentic Image Generation

GenRouter:面向智能体图像生成的统一工作流路由

Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu, Weilin Ruan, Yingjie Xu, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SUSTech(南方科技大学) ZODA CUHK(香港中文大学)

专题命中 多模态RAG :knowledge retrieval(abstract)

AI总结 GenRouter是首个智能体图像生成的统一工作流路由框架,通过需求分析、经验匹配、帕累托过滤实现自适应路由,可大幅降低计算开销与延迟并提升视觉对齐效果。

Comments Code: https://github.com/EnVision-Research/GenRouter

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12735 2026-08-06 cs.CV 版本更新 50%

AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition

AffectAgent:协同多智能体推理用于检索增强的多模态情感识别

Zeheng Wang, Zitong Yu, Yijie Zhu, Bo Zhao, Haochen Liang, Taorui Wang, Wei Xia, Jiayu Zhang, Zhishu Liu, Hui Ma, Fei Ma, Qi Tian

机构 * Great Bay University(大湾大学) Guangming Laboratory(光明实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract)

AI总结 本文提出AffectAgent,通过协同多智能体推理框架,解决多模态情感识别中的模态模糊和复杂情感依赖问题,引入MB-MoE和RAAF提升表现。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02970 2026-08-04 cs.HC 版本更新 50%

From Explanation to Diagnosis: Next Generation Interactive Video Coach with Misstep Awareness

从解释到诊断:具有失误感知能力的下一代交互式视频教练

Xiao Jin, Rahul K. Dass, Ashok K. Goel

专题命中 多模态RAG :knowledge retrieval(abstract)

AI总结 提出一种基于双模型架构的失误感知教练能力,通过将任务-方法-知识模型与教学模型结合,实现学习者错误的检测、分类和诊断性支架生成,从而提供更精确、可操作的反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13298 2026-07-16 cs.CV 新提交 50%

FOLIO: Focused Semantic Memory for Streaming Video Understanding

FOLIO:用于流视频理解的聚焦语义记忆

Haoyang Fan, Dhruv Parikh, Anvitha Ramachandran, Sameh Gobriel, Nilesh Jain, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California (USC)(南加州大学) Intel Labs(英特尔实验室) DEVCOM Army Research Office(陆军研究办公室)

专题命中 多模态RAG :hybrid retrieval(abstract)

AI总结 研究在线流视频理解中如何保留信息及组织历史记录的挑战,提出FOLIO聚焦语义记忆系统,通过动态聚焦状态更新记忆,结合短期视觉缓冲区与长期语义记忆,实现轻量级混合检索,提升性能并降低流记忆维护成本。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06839 2026-07-09 cs.LG cs.CV 新提交 50%

LEMUR 2: Unlocking Neural Network Diversity for AI

LEMUR 2:释放人工智能的神经网络多样性

Tolgay Atinc Uzun, Waleed Khalid, Saif U Din, Sai Revanth Mulukuledu, Akashdeep Singh, Chandini Vysyaraju, Raghuvir Duvvuri, Avi Goyal, Yashkumar Rajeshbhai Lukhi, Muhammad A. Hussain, Krunal Jesani, Usha Shrestha, Yash Mittal, Roman Kochnev, Pritam Kadam, Mohsin Ikram, Harsh R. Moradiya, Alice Arslanian, Dmitry Ignatov, Radu Timofte

机构 * University of Würzburg(维尔茨堡大学)

专题命中 多模态RAG :RAG(abstract)

AI总结 LEMUR 2旨在释放神经网络多样性,通过统一生成、评估和部署管道,利用多种方式生成超14000个不同架构及大量训练记录,采用特定管道进行自动部署和延迟基准测试,涵盖多模态任务,为LLM微调提供数据基础,推动相关新兴范式发展。

Comments 10 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06374 2026-07-08 cs.CV 新提交 50%

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

专题命中 多模态RAG :knowledge retrieval(abstract)

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05256 2026-07-03 cs.CV 版本更新 50%

Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

Wiki-R1: 通过数据和采样课程激励基于知识的多模态推理用于VQA

Shan Ning, Longtian Qiu, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心) Lingang Laboratory(临港实验室)

专题命中 多模态RAG :retriever(abstract)

AI总结 提出Wiki-R1框架,通过可控课程数据生成和课程采样策略,结合强化学习激励MLLMs在KB-VQA中的推理能力,在Encyclopedic VQA和InfoSeek上取得新SOTA。

Comments Accepted by ICLR 26, code and weights are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31537 2026-07-01 cs.CV cs.MA 新提交 50%

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

DataEvolver: 面向文本丰富图像生成的自我进化多智能体数据构建

Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang

机构 * Central South University(中南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态RAG :retriever(abstract)

AI总结 提出DataEvolver,一种自我进化的多智能体框架,通过反馈驱动策略迭代优化数据构建,显著提升文本丰富图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19682 2026-06-19 cs.CV 新提交 50%

Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval

Vortex: 面向智能视频检索的多模态融合系统

Duc-Tho Nguyen, Hieu-Hoc Tran-Minh, Khanh-Hoa Lam, Hoang-Nhut Ly, Huu-Phuc Huynh, Thanh-Tien Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国立大学胡志明市理科大学) Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市)

专题命中 多模态RAG :hybrid retrieval(abstract)

AI总结 提出Vortex系统,融合自适应关键帧提取、多模态元数据生成及混合检索策略(CLIP与SigLIP2的倒数秩融合),结合Rocchio反馈和多阶段时序搜索,在比赛中取得优异成绩。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09298 2026-05-08 cs.CV 50%

Multi-Modal LLM based Image Captioning in ICT: Bridging the Gap Between General and Industry Domain

基于多模态LLM的ICT图像描述:弥合通用与行业领域之间的差距

Lianying Chao, Kai Zhang, Haoran Cai, Sijie Wu, Xubin Li, Xin Chen

机构 * GTS, Huawei Technologies Co., Ltd.(华为技术有限公司GTS部门)

专题命中 多模态RAG :retrieval-augmented generation(abstract)

AI总结 本文提出多阶段训练策略,构建ICT领域图像描述模型DICModel,通过合成图像文本对提升模型性能,实验表明其在BLEU指标和准确率上均优于现有模型。

Journal ref 2025 CCF BigData

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11724 2026-04-14 cs.CV 50%

The Devil is in the Details -- From OCR for Old Church Slavonic to Purely Visual Stemma Reconstruction

细节决定成败——从OCR处理旧教会斯拉夫语到纯粹视觉谱系重建

Armin Hoenen

专题命中 多模态RAG :RAG(abstract)

AI总结 本文通过对比多种OCR系统,探讨OCR在处理18世纪手写教会斯拉夫语文本中的准确性,并引入基于图像处理的纯视觉谱系重建方法。

Comments International conference at Valamo monastery, Finnland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08322 2026-04-10 cs.CV 50%

Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data

Fundus-R1: 基于公共数据训练具备知识感知推理能力的视网膜图像阅读MLLM

Yuchuan Deng, Qijie Wei, Kaiheng Qian, Jiazhen Liu, Zijie Xin, Bangxiang Lan, Jingyu Liu, Jianfeng Dong, Xirong Li

机构 * Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 多模态RAG :RAG(abstract)

AI总结 本文提出Fundus-R1,通过公共数据集训练具备知识感知推理能力的视网膜图像阅读MLLM,采用RAG方法生成知识感知推理轨迹,并通过过程奖励增强RLVR,实验证明其在三个基准测试中优于多个基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01639 2026-04-01 cs.CV 50%

ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval

ReCALL: 为基于MLLM的组合图像检索 recalibrate 能力退化

Tianyu Yang, Chenwei He, Xiangzhao Hao, Tianyue Wang, Jiarui Guo, Haiyun Guo, Leigang Qu, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Southeast University(东南大学) Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Guangdong Provincial Key Laboratory of Intellectual Property and Big Data, Guangdong Polytechnic Normal University(广东技术师范大学广东省知识产权大数据重点实验室)

专题命中 多模态RAG :retriever(abstract)

AI总结 ReCALL通过诊断生成器盲点、生成修正指令和三元组、并持续训练来缓解基于生成式MLLM的检索能力退化问题,实验证明其在CIRR和FashionIQ上达到SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13185 2026-03-16 cs.CV 50%

Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos

从单目视频生成时空世界场景图

Rohith Peddi, Saurabh, Shravan Shanmugam, Likhitha Pallapothula, Yu Xiang, Parag Singla, Vibhav Gogate

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 多模态RAG :RAG(abstract)

AI总结 本文提出World Scene Graph Generation任务,通过ActionGenome4D数据集,引入三种方法解决未观测物体推理问题,推动视频场景理解向世界中心、时间持久和可解释的方向发展。

Comments https://github.com/rohithpeddi/WorldSGG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06202 2026-03-09 cs.RO 50%

ExpReS-VLA: Specializing Vision-Language-Action Models Through Experience Replay and Retrieval

ExpReS-VLA: 通过经验回放和检索专门化视觉-语言-动作模型

Shahram Najam Syed, Yatharth Ahuja, Arthur Jakobsson, Jeff Ichnowski

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 多模态RAG :retrieval-augmented generation(abstract)

AI总结 ExpReS-VLA通过经验回放和检索增强,提升VLA模型在特定任务中的适应能力与性能。

Comments 8 pages, 4 figures, 3 tables, accepted to International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22843 2026-02-27 cs.CV 50%

Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering

打破多模态知识驱动视觉问答中的视觉捷径

Dosung Lee, Sangwon Jung, Boyoung Kim, Minyoung Kim, Sungyeon Kim, Junyoung Sung, Paul Hongsuck Seo

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 多模态RAG :retriever(abstract)

AI总结 本研究通过RETINA基准和MIMIR方法,打破多模态知识驱动视觉问答中的视觉捷径问题,验证现有模型对捷径的依赖并展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06820 2026-02-24 cs.CV cs.LG 50%

Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking

大规模视觉-语言重排序的高效判别联合编码器

Mitchell Keren Taraday, Shahaf Wagner, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本·古里安内盖夫大学INSIGHT实验室)

专题命中 多模态RAG :vector search(abstract)

AI总结 EDJE通过离线预计算和轻量级注意力适配器,实现了高效视觉-语言重排序,显著降低存储和计算成本,提升大规模检索性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16493 2026-02-19 cs.CV 50%

MMA: Multimodal Memory Agent

MMA:多模态记忆代理

Yihao Lu, Wanru Cheng, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 多模态RAG :RAG(abstract)

AI总结 MMA通过动态可靠性评分和冲突感知网络共识,提升多模态代理在长horizon任务中的记忆检索与决策能力,同时在多个基准测试中展现优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14322 2026-02-16 cs.CV 50%

Spatio-Temporal driven Attention Graph Neural Network with Block Adjacency matrix (STAG-NN-BA) for Remote Land-use Change Detection

基于块邻接矩阵的时空驱动注意力图神经网络(STAG-NN-BA)用于遥感土地利用变化检测

Usman Nazir, Wadood Islam, Sara Khalid, Murtaza Taj

专题命中 多模态RAG :RAG(abstract)

AI总结 本文提出STAG-NN-BA模型,利用超像素和块邻接矩阵实现遥感土地利用变化检测,优于传统图和非图基线。

Journal ref AAAI Symposium 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10656 2026-02-12 eess.AS cs.SD 50%

AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval

AudioRAG:一个用于音频推理和信息检索的挑战性基准

Jingru Lin, Chen Zhang, Tianrui Wang, Haizhou Li

专题命中 多模态RAG :retrieval-augmented generation(abstract)

AI总结 AudioRAG是一个用于评估音频推理和信息检索能力的挑战性基准,通过整合检索增强生成技术,为未来研究提供更强大的基准。

Comments Accepted by Audio-AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02537 2026-02-04 cs.CV cs.LG 50%

WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models

WorldVQA:评估多模态大语言模型的原子视觉世界知识

Runjie Zhou, Youbo Shao, Haoyu Lu, Bowei Xing, Tongtong Bai, Yujie Chen, Jie Zhao, Lin Sui, Haotian Yao, Zijia Zhao, Hao Yang, Haoning Wu, Zaida Zhou, Jinguo Zhu, Zhiqi Huang, Yiping Bao, Yangyang Liu, Y. Charles, Xinyu Zhou

机构 * Moonshot AI

专题命中 多模态RAG :knowledge retrieval(abstract)

AI总结 WorldVQA通过评估多模态大语言模型的原子视觉知识,建立衡量其事实性和百科全书广度的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13801 2026-01-21 cs.RO 50%

HoverAI: An Embodied Aerial Agent for Natural Human-Drone Interaction

HoverAI: 一种用于自然人-无人机交互的具身空中代理

Yuhua Jin, Nikita Kuzmin, Georgii Demianchuk, Mariya Lezina, Fawad Mehboob, Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Ahsan Mustafa, Dzmitry Tsetserukou

机构 * Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Skolkovo Institute of Science and Technology(斯克尔科沃信息科技研究所)

专题命中 多模态RAG :RAG(abstract)

AI总结 HoverAI通过结合无人机移动、视觉投影和对话式AI,实现了人-无人机自然交互的具身代理,提升了空间感知与社交响应能力。

Comments This paper has been accepted for publication at LBR HRI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11537 2026-01-21 cs.HC 50%

Building AI-based advisory services for smallholder farmers: Technical learnings from the AIEP Initiative

为小农户建设基于AI的咨询服务:AIEP计划的技术经验

Stewart Collis, Florence Kinyua, Vikram Kumar, Howard Lakougna, Christian Merz, Kirti Pandey, Christian Resch

专题命中 多模态RAG :RAG(abstract)

AI总结 AIEP计划通过AI技术为小农户提供农业咨询服务,发现多语言语音交互和语料库编纂是关键挑战,同时强调数据共享和评估基准的重要性。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23044 2026-01-19 cs.CV 50%

Video-Browser: Towards Agentic Open-web Video Browsing

Video-Browser: 向具有代理能力的开放网页视频浏览迈进

Zhengyang Liang, Yan Shu, Xiangrui Liu, Minghao Qin, Kaixin Liang, Nicu Sebe, Zheng Liu, Lizi Liao

专题命中 多模态RAG :RAG(abstract)

AI总结 Video-Browser通过金字塔感知技术,在开放式网络视频浏览中实现37.5%的相对提升,同时减少58.3%的token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04540 2025-12-17 cs.CV 50%

VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management

VideoMem: 通过自适应内存管理增强超长视频理解

Hongbo Jin, Qingyuan Wang, Wenhao Zhang, Yang Liu, Sijie Cheng

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 多模态RAG :RAG(abstract)

AI总结 VideoMem通过自适应内存管理框架,有效提升超长视频理解任务的性能,采用PRPO算法和两个核心模块实现高效训练和长期记忆保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02395 2025-12-09 cs.CV 50%

Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch

Skywork-R1V4:通过图像与深度研究交织思考实现代理多模态智能

Yifan Zhang, Liang Hu, Haofeng Sun, Peiyu Wang, Yichen Wei, Shukang Yin, Jiangbo Pei, Wei Shen, Peng Xia, Yi Peng, Tianyidan Xie, Eric Li, Yang Liu, Xuchen Song, Yahui Zhou

机构 * Skywork AI

专题命中 多模态RAG :knowledge retrieval(abstract)

AI总结 Skywork-R1V4通过交织推理实现多模态代理智能,仅用监督学习在少数据上训练,超越现有模型在多个基准测试中的表现。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18883 2025-11-24 cs.CV 50%

Universal Video Temporal Grounding with Generative Multi-modal Large Language Models

通用视频时间定位与生成多模态大语言模型

Zeqian Li, Shangzhe Di, Zhonghua Zhai, Weilin Huang, Yanfeng Wang, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ByteDance Seed(字节跳动种子)

专题命中 多模态RAG :retriever(abstract)

AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏