arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 551 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 多模态RAG 551 篇

2605.12799 2026-05-14 cs.MA cs.CY cs.MM 75%

Synthesizing the Expert: A Validated Multimodal Dataset for Trustworthy AI-Assisted Swimming Coaching

合成专家:一个经过验证的多模态数据集用于可信的人工智能辅助游泳教练

Ahmad Al-Kabbany, Esraa Kassem

专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 本文提出一个多模态数据集,用于构建可信的人工智能游泳教练系统,通过多代理LLM架构生成1864个验证的'问题-上下文-答案'三元组,提升自动化指导的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11516 2026-05-13 cs.NI 75%

Agents Should Replace Narrow Predictive AI as the Orchestrator in 6G AI-RAN

智能体应取代窄预测AI作为6G AI-RAN的协调者

Pranshav Gajjar, Vijay K Shah

专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 本文主张为实现Level 5自主6G网络,AI-RAN应从碎片化的窄预测模型转向多模态大语言模型作为核心推理智能体,通过提升LLM作为认知操作系统,动态翻译人类意图并自主诊断网络异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02452 2026-04-29 cs.CV 75%

Personalization Toolkit: Training Free Personalization of Large Vision Language Models

个性化工具包:无需训练的大型视觉语言模型个性化

Soroush Seifi, Vaggelis Dorovatas, Matteo Cassinelli, Fabien Despinoy, Daniel Olmeda Reino, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田欧洲公司)

专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 本文提出无需训练的LVLM个性化方法,通过预训练视觉基础模型提取特征,结合检索增强生成技术实现多概念个性化,适用于图像和视频。

Comments Accepted at Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09114 2026-02-03 cs.LG 75%

TRACE: Grounding Time Series in Context for Multimodal Embedding and Retrieval

TRACE: 在上下文中对时间序列进行建模以实现多模态嵌入与检索

Jialin Chen, Ziyu Zhao, Gaukhar Nurbek, Aosong Feng, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);retriever(abstract)

AI总结 TRACE通过在上下文中对时间序列进行建模,实现多模态嵌入与检索,提升下游任务的预测精度和可解释性,同时作为强大的独立编码器优化上下文感知表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21596 2025-07-16 cs.CL cs.AI cs.IR 75%

Evaluating Multimodal Large Language Models on Educational Textbook Question Answering

Hessa A. Alawwad, Anas Zafar, Areej Alhothali, Usman Naseem, Ali Alkhathlan, Amani Jamal

机构 * Faculty of Computing and Information Technology(计算与信息科技学院) King Abdulaziz University(阿卜杜勒阿齐兹大学) FAST School of Computing(快速计算学院) National University of Computer and Emerging Sciences(国家计算机与新兴科学大学) School of Computing(计算学院) Macquarie University(麦考瑞大学) Center of Research Excellence in AI and Data Science(人工智能与数据科学卓越研究中心)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments 8 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18763 2025-02-27 cs.IT math.IT 75%

CommGPT: A Graph and Retrieval-Augmented Multimodal Communication Foundation Model

Feibo Jiang, Wanyun Zhu, Li Dong, Kezhi Wang, Kun Yang, Cunhua Pan, Octavia A. Dobre

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);knowledge retrieval(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09939 2024-02-16 cs.AI cs.CL cs.HC cs.IR cs.LG 75%

Generative AI in the Construction Industry: A State-of-the-art Analysis

Ridwan Taiwo, Idris Temitope Bello, Sulemana Fatoama Abdulai, Abdul-Mugis Yussif, Babatunde Abiodun Salami, Abdullahi Saka, Tarek Zayed

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments 74 pages, 11 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13808 2025-05-21 cs.NE cs.AI 74%

RAG/LLM Augmented Switching Driven Polymorphic Metaheuristic Framework

Faramarz Safi Esfahani, Ghassan Beydoun, Morteza Saberi, Brad McCusker, Biswajeet Pradhan

专题命中 多模态RAG :RAG(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19218 2026-08-21 cs.CL cs.AI cs.LG 新提交 73%

Time-Series Retrieval for Grounding Multimodal Language Models in Remaining Useful Life

用于将多模态语言模型与剩余使用寿命关联的时间序列检索

Valeriu Dimidov, Raphaël Frank

机构 * University of Luxembourg(卢森堡大学)

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出时间序列检索关联的多模态大语言模型框架,在C-MAPSS基准FD001分区实验显示,该方法可提升RUL预测的误差与稳定性,且效果随模型容量变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19961 2026-03-24 cs.CL cs.IR 73%

Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval

解锁多模态文档智能:从当前成就到视觉文档检索的未来前沿

Yibo Yan, Jiahao Huo, Guanbo Feng, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Yuanhuiyi Lyu, Yu Huang, Jungang Li, Kening Zheng, Xu Zheng, Philip S. Yu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

AI总结 本文综述了视觉文档检索领域,探讨了多模态大语言模型时代下的方法演进与挑战,提出未来发展方向。

Comments Under review. This version updates the relevant works released before 15 March, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16713 2026-02-17 cs.RO cs.AI cs.CL 73%

A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World

务实型机器人:通过体验现实世界学习任务规划

Kaixian Qu, Guowei Lan, René Zurbrügg, Changan Chen, Christopher E. Mower, Haitham Bou-Ammar, Marco Hutter

机构 * Robotic Systems Lab, ETH Zürich(瑞士联邦理工学院机器人系统实验室) ETH AI Center, ETH Zürich(瑞士联邦理工学院人工智能中心) Huawei Noah’s Ark Lab, London, UK(华为诺亚实验室,伦敦,英国) UCL Centre for AI, London, UK(伦敦大学学院人工智能中心)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 PragmaBot 通过现实世界经验学习任务规划,利用 STM 自我反思和 RAG 提高任务成功率

Comments Accepted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06037 2026-01-23 cs.CL cs.AI cs.CV 73%

TeleMem: Building Long-Term and Multimodal Memory for Agentic AI

TeleMem: 构建面向代理AI的长期和多模态记忆

Chunliang Chen, Ming Guan, Xiao Lin, Jiaxu Li, Luxi Lin, Qiyi Wang, Xiangyu Chen, Jixiang Luo, Changzhi Sun, Dell Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 TeleMem通过统一的长期和多模态记忆系统,提升代理AI在长对话和多模态任务中的表现,实现更高的准确率、更低的令牌使用和更快的操作速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13564 2026-01-14 cs.CL cs.AI 73%

Memory in the Age of AI Agents

人工智能代理时代的记忆

Yuyang Hu, Shichun Liu, Yanwei Yue, Guibin Zhang, Boyang Liu, Fangyi Zhu, Jiahang Lin, Honglin Guo, Shihan Dou, Zhiheng Xi, Senjie Jin, Jiejun Tan, Yanbin Yin, Jiongnan Liu, Zeyu Zhang, Zhongxiang Sun, Yutao Zhu, Hao Sun, Boci Peng, Zhenrong Cheng, Xuanbo Fan, Jiaxin Guo, Xinlei Yu, Zhenhong Zhou, Zewen Hu, Jiahao Huo, Junhao Wang, Yuwei Niu, Yu Wang, Zhenfei Yin, Xiaobin Hu, Yue Liao, Qiankun Li, Kun Wang, Wangchunshu Zhou, Yixin Liu, Dawei Cheng, Qi Zhang, Tao Gui, Shirui Pan, Yan Zhang, Philip Torr, Zhicheng Dou, Ji-Rong Wen, Xuanjing Huang, Yu-Gang Jiang, Shuicheng Yan

机构 * Core Supervisors. 0.5em Affiliations: National University of Singapore, Renmin University of China, Fudan University, Peking University, Nanyang Technological University, Tongji University, University of California San Diego, Hong Kong University of Science Technology (Guangzhou), Griffith University, Georgia Institute of Technology, OPPO, Oxford University

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文系统梳理了人工智能代理记忆的现状与分类,提出了记忆的三种形式、功能分类及动态分析,为未来智能设计提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05648 2026-01-12 q-bio.GN cs.AI cs.CL cs.LG 73%

Open World Knowledge Aided Single-Cell Foundation Model with Robust Cross-Modal Cell-Language Pre-training

开放世界知识辅助的单细胞基础模型与鲁棒跨模态细胞-语言预训练

Haoran Wang, Xuanyi Zhang, Shuangsang Fang, Longke Ran, Ziqing Deng, Yong Zhang, Yuxiang Li, Shaoshuai Li

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 OKR-CELL通过开放世界知识和鲁棒跨模态预训练,提升单细胞基础模型在细胞-语言跨模态任务中的表现。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07879 2025-09-15 cs.IR cs.AI cs.CV 73%

OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval

Wei Yang, Jingjing Fu, Rui Wang, Jinyu Wang, Lei Song, Jiang Bian

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20521 2025-09-09 cs.AI cs.CL 73%

Project Riley: Multimodal Multi-Agent LLM Collaboration with Emotional Reasoning and Voting

Ana Rita Ortigoso, Gabriel Vieira, Daniel Fuentes, Luis Frazão, Nuno Costa, António Pereira

机构 * Polytechnic University of Leiria(莱里亚理工大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 5 figures. Submitted for review to Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14189 2025-08-15 cs.CL cs.AI 73%

DeepWriter: A Fact-Grounded Multimodal Writing Assistant Based On Offline Knowledge Base

Song Mao, Lejun Cheng, Pinlong Cai, Guohang Yan, Ding Wang, Botian Shi

机构 * Shanghai AI LAB(上海人工智能实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06208 2025-06-09 cs.CL cs.AI 73%

Building Models of Neurological Language

Henry Watkins

机构 * UCL Queen Square Institute of Neurology(伦敦大学学院女王广场神经病学研究所)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20341 2025-05-28 eess.AS cs.AI cs.CL cs.SD 73%

Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset

Rui Liu, Pu Gao, Jiatian Xi, Berrak Sisman, Carlos Busso, Haizhou Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) Inner Mongolia University(内蒙古大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments INTERSPEECH2025. Code and audio examples: https://github.com/AI-S2-Lab/EmoCorrector

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08846 2025-04-15 cs.CY cs.AI cs.CL cs.LG 73%

AI-University: An LLM-based platform for instructional alignment to scientific classrooms

Mostafa Faghih Shojaei, Rahul Gulati, Benjamin A. Jasperson, Shangshang Wang, Simone Cimolato, Dangli Cao, Willie Neiswanger, Krishna Garikipati

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08747 2025-04-15 cs.AI cs.IR 73%

GridMind: A Multi-Agent NLP Framework for Unified, Cross-Modal NFL Data Insights

Jordan Chipka, Chris Moyer, Clay Troyer, Tyler Fuelling, Jeremy Hochstedler

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

Comments 16 pages, 2 figures, submitted to 2025 Sloan Sports Analytics Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00501 2025-03-04 cs.IR cs.CL 73%

Qilin: A Multimodal Information Retrieval Dataset with APP-level User Sessions

Jia Chen, Qian Dong, Haitao Li, Xiaohui He, Yan Gao, Shaosheng Cao, Yi Wu, Ping Yang, Chen Xu, Yao Hu, Qingyao Ai, Yiqun Liu

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08521 2025-02-10 cs.IR cs.CL 73%

MuRAR: A Simple and Effective Multimodal Retrieval and Answer Refinement Framework for Multimodal Question Answering

Zhengyuan Zhu, Daniel Lee, Hong Zhang, Sai Sree Harsha, Loic Feujio, Akash Maharaj, Yunyao Li

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

Comments Accepted at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13944 2025-01-27 cs.CL cs.AI 73%

Fanar: An Arabic-Centric Multimodal Generative AI Platform

Fanar Team, Ummar Abbas, Mohammad Shahmeer Ahmad, Firoj Alam, Enes Altinisik, Ehsannedin Asgari, Yazan Boshmaf, Sabri Boughorbel, Sanjay Chawla, Shammur Chowdhury, Fahim Dalvi, Kareem Darwish, Nadir Durrani, Mohamed Elfeky, Ahmed Elmagarmid, Mohamed Eltabakh, Masoomali Fatehkia, Anastasios Fragkopoulos, Maram Hasanain, Majd Hawasly, Mus'ab Husaini, Soon-Gyo Jung, Ji Kim Lucas, Walid Magdy, Safa Messaoud, Abubakr Mohamed, Tasnim Mohiuddin, Basel Mousi, Hamdy Mubarak, Ahmad Musleh, Zan Naeem, Mourad Ouzzani, Dorde Popovic, Amin Sadeghi, Husrev Taha Sencar, Mohammed Shinoy, Omar Sinan, Yifan Zhang, Ahmed Ali, Yassine El Kheir, Xiaosong Ma, Chaoyi Ruan

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15203 2024-11-26 cs.LG cs.AI cs.CL 73%

Multimodal large language model for wheat breeding: a new exploration of smart breeding

Guofeng Yang, Yu Li, Yong He, Zhenjiang Zhou, Lingzhen Ye, Hui Fang, Yiqi Luo, Xuping Feng

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23437 2024-11-01 cs.LG cs.CL cs.IR 73%

Mind the Gap: A Generalized Approach for Cross-Modal Embedding Alignment

Arihan Yadav, Alan McMillan

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02233 2024-10-07 cs.CL cs.AI cs.LG 73%

Synthetic Multimodal Question Generation

Ian Wu, Sravan Jayanthi, Vijay Viswanathan, Simon Rosenberg, Sina Pakazad, Tongshuang Wu, Graham Neubig

专题命中 多模态RAG :retrieval augmented generation(abstract);retriever(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2024 Findings; Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18470 2024-09-02 cs.CE cs.AI cs.CL q-fin.RM q-fin.TR 73%

ECC Analyzer: Extract Trading Signal from Earnings Conference Calls using Large Language Model for Stock Performance Prediction

Yupeng Cao, Zhi Chen, Qingyun Pei, Nathan Jinseok Lee, K. P. Subbalakshmi, Papa Momar Ndiaye

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 1 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04681 2024-07-08 cs.CV cs.AI cs.CL cs.LG 73%

Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge

Yuanze Lin, Yunsheng Li, Dongdong Chen, Weijian Xu, Ronald Clark, Philip Torr, Lu Yuan

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19150 2024-06-28 cs.CV cs.AI cs.IR 73%

RAVEN: Multitask Retrieval Augmented Vision-Language Learning

Varun Nagaraj Rao, Siddharth Choudhary, Aditya Deshpande, Ravi Kumar Satzoda, Srikar Appalaraju

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏