arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 8633 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 多模态RAG 557 篇

2601.06037 2026-01-23 cs.CL cs.AI cs.CV 73%

TeleMem: Building Long-Term and Multimodal Memory for Agentic AI

TeleMem: 构建面向代理AI的长期和多模态记忆

Chunliang Chen, Ming Guan, Xiao Lin, Jiaxu Li, Luxi Lin, Qiyi Wang, Xiangyu Chen, Jixiang Luo, Changzhi Sun, Dell Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 TeleMem通过统一的长期和多模态记忆系统,提升代理AI在长对话和多模态任务中的表现,实现更高的准确率、更低的令牌使用和更快的操作速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13564 2026-01-14 cs.CL cs.AI 73%

Memory in the Age of AI Agents

人工智能代理时代的记忆

Yuyang Hu, Shichun Liu, Yanwei Yue, Guibin Zhang, Boyang Liu, Fangyi Zhu, Jiahang Lin, Honglin Guo, Shihan Dou, Zhiheng Xi, Senjie Jin, Jiejun Tan, Yanbin Yin, Jiongnan Liu, Zeyu Zhang, Zhongxiang Sun, Yutao Zhu, Hao Sun, Boci Peng, Zhenrong Cheng, Xuanbo Fan, Jiaxin Guo, Xinlei Yu, Zhenhong Zhou, Zewen Hu, Jiahao Huo, Junhao Wang, Yuwei Niu, Yu Wang, Zhenfei Yin, Xiaobin Hu, Yue Liao, Qiankun Li, Kun Wang, Wangchunshu Zhou, Yixin Liu, Dawei Cheng, Qi Zhang, Tao Gui, Shirui Pan, Yan Zhang, Philip Torr, Zhicheng Dou, Ji-Rong Wen, Xuanjing Huang, Yu-Gang Jiang, Shuicheng Yan

机构 * Core Supervisors. 0.5em Affiliations: National University of Singapore, Renmin University of China, Fudan University, Peking University, Nanyang Technological University, Tongji University, University of California San Diego, Hong Kong University of Science Technology (Guangzhou), Griffith University, Georgia Institute of Technology, OPPO, Oxford University

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文系统梳理了人工智能代理记忆的现状与分类,提出了记忆的三种形式、功能分类及动态分析,为未来智能设计提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05648 2026-01-12 q-bio.GN cs.AI cs.CL cs.LG 73%

Open World Knowledge Aided Single-Cell Foundation Model with Robust Cross-Modal Cell-Language Pre-training

开放世界知识辅助的单细胞基础模型与鲁棒跨模态细胞-语言预训练

Haoran Wang, Xuanyi Zhang, Shuangsang Fang, Longke Ran, Ziqing Deng, Yong Zhang, Yuxiang Li, Shaoshuai Li

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 OKR-CELL通过开放世界知识和鲁棒跨模态预训练,提升单细胞基础模型在细胞-语言跨模态任务中的表现。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07879 2025-09-15 cs.IR cs.AI cs.CV 73%

OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval

Wei Yang, Jingjing Fu, Rui Wang, Jinyu Wang, Lei Song, Jiang Bian

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20521 2025-09-09 cs.AI cs.CL 73%

Project Riley: Multimodal Multi-Agent LLM Collaboration with Emotional Reasoning and Voting

Ana Rita Ortigoso, Gabriel Vieira, Daniel Fuentes, Luis Frazão, Nuno Costa, António Pereira

机构 * Polytechnic University of Leiria(莱里亚理工大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 5 figures. Submitted for review to Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14189 2025-08-15 cs.CL cs.AI 73%

DeepWriter: A Fact-Grounded Multimodal Writing Assistant Based On Offline Knowledge Base

Song Mao, Lejun Cheng, Pinlong Cai, Guohang Yan, Ding Wang, Botian Shi

机构 * Shanghai AI LAB(上海人工智能实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06208 2025-06-09 cs.CL cs.AI 73%

Building Models of Neurological Language

Henry Watkins

机构 * UCL Queen Square Institute of Neurology(伦敦大学学院女王广场神经病学研究所)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20341 2025-05-28 eess.AS cs.AI cs.CL cs.SD 73%

Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset

Rui Liu, Pu Gao, Jiatian Xi, Berrak Sisman, Carlos Busso, Haizhou Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) Inner Mongolia University(内蒙古大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments INTERSPEECH2025. Code and audio examples: https://github.com/AI-S2-Lab/EmoCorrector

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08747 2025-04-15 cs.AI cs.IR 73%

GridMind: A Multi-Agent NLP Framework for Unified, Cross-Modal NFL Data Insights

Jordan Chipka, Chris Moyer, Clay Troyer, Tyler Fuelling, Jeremy Hochstedler

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

Comments 16 pages, 2 figures, submitted to 2025 Sloan Sports Analytics Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00501 2025-03-04 cs.IR cs.CL 73%

Qilin: A Multimodal Information Retrieval Dataset with APP-level User Sessions

Jia Chen, Qian Dong, Haitao Li, Xiaohui He, Yan Gao, Shaosheng Cao, Yi Wu, Ping Yang, Chen Xu, Yao Hu, Qingyao Ai, Yiqun Liu

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08521 2025-02-10 cs.IR cs.CL 73%

MuRAR: A Simple and Effective Multimodal Retrieval and Answer Refinement Framework for Multimodal Question Answering

Zhengyuan Zhu, Daniel Lee, Hong Zhang, Sai Sree Harsha, Loic Feujio, Akash Maharaj, Yunyao Li

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

Comments Accepted at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13944 2025-01-27 cs.CL cs.AI 73%

Fanar: An Arabic-Centric Multimodal Generative AI Platform

Fanar Team, Ummar Abbas, Mohammad Shahmeer Ahmad, Firoj Alam, Enes Altinisik, Ehsannedin Asgari, Yazan Boshmaf, Sabri Boughorbel, Sanjay Chawla, Shammur Chowdhury, Fahim Dalvi, Kareem Darwish, Nadir Durrani, Mohamed Elfeky, Ahmed Elmagarmid, Mohamed Eltabakh, Masoomali Fatehkia, Anastasios Fragkopoulos, Maram Hasanain, Majd Hawasly, Mus'ab Husaini, Soon-Gyo Jung, Ji Kim Lucas, Walid Magdy, Safa Messaoud, Abubakr Mohamed, Tasnim Mohiuddin, Basel Mousi, Hamdy Mubarak, Ahmad Musleh, Zan Naeem, Mourad Ouzzani, Dorde Popovic, Amin Sadeghi, Husrev Taha Sencar, Mohammed Shinoy, Omar Sinan, Yifan Zhang, Ahmed Ali, Yassine El Kheir, Xiaosong Ma, Chaoyi Ruan

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15203 2024-11-26 cs.LG cs.AI cs.CL 73%

Multimodal large language model for wheat breeding: a new exploration of smart breeding

Guofeng Yang, Yu Li, Yong He, Zhenjiang Zhou, Lingzhen Ye, Hui Fang, Yiqi Luo, Xuping Feng

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23437 2024-11-01 cs.LG cs.CL cs.IR 73%

Mind the Gap: A Generalized Approach for Cross-Modal Embedding Alignment

Arihan Yadav, Alan McMillan

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02233 2024-10-07 cs.CL cs.AI cs.LG 73%

Synthetic Multimodal Question Generation

Ian Wu, Sravan Jayanthi, Vijay Viswanathan, Simon Rosenberg, Sina Pakazad, Tongshuang Wu, Graham Neubig

专题命中 多模态RAG :retrieval augmented generation(abstract);retriever(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2024 Findings; Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18470 2024-09-02 cs.CE cs.AI cs.CL q-fin.RM q-fin.TR 73%

ECC Analyzer: Extract Trading Signal from Earnings Conference Calls using Large Language Model for Stock Performance Prediction

Yupeng Cao, Zhi Chen, Qingyun Pei, Nathan Jinseok Lee, K. P. Subbalakshmi, Papa Momar Ndiaye

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 1 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04681 2024-07-08 cs.CV cs.AI cs.CL cs.LG 73%

Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge

Yuanze Lin, Yunsheng Li, Dongdong Chen, Weijian Xu, Ronald Clark, Philip Torr, Lu Yuan

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19150 2024-06-28 cs.CV cs.AI cs.IR 73%

RAVEN: Multitask Retrieval Augmented Vision-Language Learning

Varun Nagaraj Rao, Siddharth Choudhary, Aditya Deshpande, Ravi Kumar Satzoda, Srikar Appalaraju

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01273 2025-08-26 cs.IR cs.MM 72%

SoccerRAG: Multimodal Soccer Information Retrieval via Natural Queries

Aleksander Theo Strand, Sushant Gautam, Cise Midoglu, Pål Halvorsen

专题命中 多模态RAG :RAG(abstract,comments);retrieval augmented generation(abstract);分类 cs.IR

Comments accepted to CBMI 2024 as a regular paper; https://github.com/simula/soccer-rag

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03276 2025-12-04 cs.LG 71%

Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval

太迟回忆:多模态知识检索中双跳问题的解释

Constantin Venhoff, Ashkan Khakzar, Sonia Joseph, Philip Torr, Neel Nanda

机构 * University of Oxford(牛津大学) McGill University(麦吉尔大学) Meta MATS

专题命中 多模态RAG :knowledge retrieval(title)

AI总结 本文研究了多模态知识检索中双跳问题的影响,发现VLMs在处理视觉输入时过晚解决实体表示导致事实回忆性能下降,并提出通过修补和提示方法恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21714 2026-08-25 cs.CL 新提交 70%

LëtzCross: A Cross-Lingual Page-Level Benchmark for Multimodal Retrieval over Luxembourgish Documents

LëtzCross:面向卢森堡语文档的多模态检索跨语言页面级基准

Omar El Bachyr, Fred Philippy, Laura Maria Bernardy, Saad Ezzini, Jacques Klein, Tegawende Bissyande

机构 * University of Luxembourg(卢森堡大学) King Fahd University of Petroleum and Minerals(法赫德国王石油矿产大学)

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 该研究推出LëtzCross基准,对比纯文本与ColPali式页面图像检索器,发现后者表现更优,还明确单语言微调中法语文对卢森堡语查询表现最高、多语言微调中纳入卢森堡语效果最强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29058 2026-08-03 cs.AI 新提交 70%

Evidence-Grounded Constraint Checking in Construction Documents

建筑文档中基于证据的约束检查

Rashid Mushkani, Hugo Berard, Shin Koseki

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对建筑文档审查的约束检查问题,提出基于证据的流程,通过实验发现调整图像预算分配可提升项目家族决策准确性,同时揭示分辨率广度权衡,为证据路由和专家审查提供依据。

Comments 11 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05736 2026-07-15 q-bio.QM cs.CL cs.CV cs.LG 70%

Multimodal Integrated Knowledge Transfer to Large Language Models through Preference Optimization with Biomedical Applications

通过偏好优化整合多模态知识以增强大语言模型的多模态知识转移(生物医学应用)

Zhanliang Wang, Da Wu, Quan Nguyen, Zhuoran Xu, Kai Wang

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 MINT通过偏好优化整合多模态知识,提升大语言模型在生物医学任务中的表现,特别是在罕见遗传疾病预测和组织类型分类中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26266 2026-07-01 cs.AI cs.CV 版本更新 70%

GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation

GUIDE:通过实时网络视频检索和即插即用标注解决GUI代理的领域偏见

Rui Xie, Zhi Gao, Chenrui Shi, Zirui Shang, Lu Chen, Qing Li

机构 * Shanghai Jiao Tong University(上海交通大学) State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院) Beijing Institute of Technology(北京理工大学)

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 GUIDE通过实时网络视频检索和即插即用标注框架,解决GUI代理的领域偏见问题,通过视频语义分析和自动化标注流程提升代理对特定应用的操作流程和UI布局的理解,实验表明其在多代理系统和单模型代理中均能提升性能。

Comments Accepted to ECCV 2026. 30 pages: 15-page main paper followed by supplementary material as an appendix (Sections A-F). Project page: https://sharryXR.github.io/GUIDE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29341 2026-06-02 cs.CV cs.CL 70%

WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

WorldMemArena: 通过动作-世界交互评估多模态智能体记忆

Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu, Yepeng Liu, Lin Long, Yichen Guo, Nuo Chen, Zhaotian Weng, Elena Kochkina, Simerjot Kaur, Charese Smiley, Xiaomo Liu, James Zou, Sheng Liu, Yuheng Bu, Songyou Peng, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) J.P. Morgan Chase(摩根大通) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 提出WorldMemArena基准,通过动作-世界交互循环的四阶段生命周期评估多模态智能体记忆,揭示现有方法在写入、维护、检索和使用中的失败点。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21996 2026-05-29 cs.CV cs.AI 70%

VRAG: Learning World Models for Interactive Video Generation

VRAG:面向交互式视频生成的世界模型学习

Taiye Chen, Xun Hu, Zihan Ding, Chi Jin

机构 * Peking University(北京大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学)

专题命中 多模态RAG :retrieval augmented generation(abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 针对自回归视频生成中累积误差和记忆机制不足的问题,提出视频检索增强生成(VRAG)方法,通过显式全局状态条件降低长期累积误差并提升时空一致性。

Comments Published at NeurIPS 2025. Project page: https://sites.google.com/view/vrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17946 2026-05-21 cs.AI cs.CV cs.LG 70%

SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain

SVFSearch: 一种面向游戏垂直领域的多模态知识密集型短视频帧搜索基准

Lingtao Mao, Huangyu Dai, Xinyu Sun, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou

机构 * Kuaishou Technology(快手科技)

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SVFSearch,首个针对中文游戏领域短视频帧搜索的多模态知识密集型基准,通过5000个四选一测试示例和4198个辅助训练示例,评估了从直接问答到计划-行动-重新计划代理等多种方法在短视频帧搜索中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13391 2026-05-14 cs.AI 70%

RS-Claw: Progressive Active Tool Exploration via Hierarchical Skill Trees for Remote Sensing Agents

RS-Claw:通过分层技能树实现渐进式主动工具探索的遥感代理

Liangtian Liu, Zeyuan Wang, Ziyu Li, Kai Ouyang, Zichao Tang, Chengfu Liu, Haifeng Li, Hanwen Yu, Wentao Yang, Cheng Yang, Dongyang Hou

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) School of Resources and Environment, University of Electronic Science and Technology of China(资源与环境学院,电子科技大学) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(地球科学与空间信息工程学院,湖南科技大学) Sanya Institute of Hunan University of Science and Technology(海南科技大学三亚研究院)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出RS-Claw,通过分层技能树实现主动探索,解决遥感代理工具选择中的被动机制问题,提升长周期推理中的工具命中率和上下文空间效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23392 2026-04-28 cs.AI 70%

SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing

SoccerRef-Agents: 多智能体系统用于自动足球裁判

Zi Meng, Wanli Song, Yi Hu, Jiayuan Rao, Gang Chen

机构 * University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SoccerRef-Agents多智能体系统,通过构建多模态基准和知识库,提升足球裁判决策的准确性和可解释性。

Comments 26 pages, 8 figures. Submitted to ISACE 2026. Github Repo: https://github.com/yjlog/SoccerRef-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02409 2026-04-06 cs.CV cs.AI 70%

LumiVideo: An Intelligent Agentic System for Video Color Grading

LumiVideo:一种用于视频色彩分级的智能代理系统

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) South China University of Technology(华南理工大学) Hong Kong Baptist University(香港浸会大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港浸会大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 LumiVideo通过感知、推理、执行和反思四个阶段模仿专业调色师的工作流程,利用LLM和RAG框架实现非线性色彩参数空间导航,生成符合行业标准的色彩配置文件,并支持通过自然语言反馈进行迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏