arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 8633 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 多模态RAG 557 篇

2603.13375 2026-03-17 cs.CV cs.LG 67%

InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization

InfiniteDance: 可扩展的3D舞蹈生成以实现真实场景泛化

Ronghui Li, Zhongyuan Hu, Li Siyao, Youliang Zhang, Haozhe Xie, Mingyuan Zhang, Jie Guo, Xiu Li, Ziwei Liu

机构 * Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文提出InfiniteDance,通过扩大数据与模型设计,实现可扩展的3D舞蹈生成,解决了真实场景下的泛化问题。

Comments project page: https://infinitedance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01091 2026-02-18 cs.SD 67%

AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models

AudioRAG+: 基于反馈的检索增强音频生成与大音频语言模型

Junqi Zhao, Chenxing Li, Jinzheng Zhao, Rilin Chen, Dong Yu, Mark D. Plumbley, Wenwu Wang

机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, UK(视觉、语音和信号处理中心(CVSSP),英国萨里大学) Tencent AI Lab, Beijing, China(腾讯人工智能实验室,中国北京) Tencent AI Lab, Seattle, USA(腾讯人工智能实验室,美国西雅图)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 AudioRAG+利用大音频语言模型提升文本到音频生成中特定声音事件的合成能力,通过反馈驱动检索增强生成过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09411 2026-02-10 cs.CV cs.GR 67%

ImageRAG: Dynamic Image Retrieval for Reference-Guided Image Generation

ImageRAG:用于参考引导图像生成的动态图像检索

Rotem Shalev-Arkushin, Rinon Gal, Amit H. Bermano, Ohad Fried

机构 * Tel-Aviv University(特拉维夫大学) Tel Aviv University(特拉维夫大学) Reichman University(里奇曼大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 ImageRAG通过动态图像检索提升参考引导图像生成的质量,无需专门训练即可适应不同模型类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00028 2026-02-03 cs.LG cs.MM 67%

ELLMPEG: An Edge-based Agentic LLM Video Processing Tool

ELLMPEG:一种基于边缘的代理LLM视频处理工具

Zoha Azimi, Reza Farahani, Radu Prodan, Christian Timmerer

机构 * Christian Doppler Laboratory ATHENA, Department of Information Technology (ITEC) University of Klagenfurt(亚琛实验室ATHENA,信息科技系,克雷格弗尔特大学) Department of Information Technology (ITEC) University of Klagenfurt(信息科技系,克雷格弗尔特大学) Department of Computer Science University of Innsbruck(计算机科学系,因斯布鲁克大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 ELLMPEG是一种基于边缘的代理LLM视频处理工具,通过整合工具感知的检索增强生成与迭代自我反思,实现本地生成和验证FFmpeg和VVenC命令,提升视频处理效率和准确性。

Comments 12 pages, 5 tables, 8 Figures, accepted for the MMSys 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14874 2026-01-22 cs.RO 67%

HumanoidVLM: Vision-Language-Guided Impedance Control for Contact-Rich Humanoid Manipulation

HumanoidVLM: 用于接触密集型人形机器人工操作的视觉-语言引导阻抗控制

Yara Mahmoud, Yasheerah Yaqoot, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 HumanoidVLM通过视觉-语言模型和检索增强生成模块,实现人形机器人在接触密集场景中的自适应阻抗控制与抓取配置选择。

Comments This paper has been accepted for publication at LBR of HRI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10551 2026-01-16 cs.CV 67%

Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure

释放大型视觉-语言模型的能力以实现道路基础设施的智能感知

Luxuan Fu, Chong Liu, Bisheng Yang, Zhen Dong

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室) Wuhan University(武汉大学) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文提出一种领域适应框架,通过数据高效微调和知识引导推理,提升大型视觉语言模型在城市道路基础设施感知中的性能和专业合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09557 2026-01-16 cs.NE cs.CR 67%

SiliconHealth: A Complete Low-Cost Blockchain Healthcare Infrastructure for Resource-Constrained Regions Using Repurposed Bitcoin Mining ASICs

SiliconHealth: 一种基于区块链的低成本医疗基础设施,利用再利用的比特币挖矿ASICs为资源匮乏地区服务

Francisco Angulo de Lafuente, Seid Mehammed Abdu, Nirmal Tej

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 SiliconHealth利用废弃比特币挖矿ASICs构建低成本区块链医疗系统,实现安全、节能的医疗记录管理,适用于资源匮乏地区。

Comments 8 pages, 9 tables, 2 figures, experimental validation with cross-device results, economic analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05908 2025-12-08 cs.SE cs.AI cs.CL cs.IR 67%

Natural Language Summarization Enables Multi-Repository Bug Localization by LLMs in Microservice Architectures

自然语言摘要通过LLM在微服务架构中多仓库Bug定位

Amirkia Rafiei Oskooei, S. Selcan Yukcu, Mehmet Cevheri Bozoglan, Mehmet S. Aktas

机构 * Yildiz Technical University, Dept. of Computer Eng.(Yildiz技术大学,计算机工程系) Yildiz Technical University, Department of Computer Engineering(Yildiz技术大学,计算机工程系)

专题命中 多模态RAG :RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 利用自然语言摘要和LLM技术,通过多仓库微服务架构实现更高效的Bug定位,显著提升定位准确率和透明度。

Comments Accepted at LLM4Code Workshop, ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02025 2025-11-26 cs.SE 67%

SAFE: Harnessing LLM for Scenario-Driven ADS Testing from Multimodal Crash Data

SAFE: 借助LLM从多模态碰撞数据中驱动场景的ADS测试

Siwei Luo, Yang Zhang, Yao Deng, Linfeng Liang, Xi Zheng

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 SAFE通过多模态提取和LLM技术,提升从碰撞数据中重建真实场景和检测安全违规的能力,实现高准确率和高效生成。

Comments The paper has been accepted for publication in the proceedings of the IEEE/ACM 48th International Conference on Software Engineering to be held 12-18 April 2026 (ICSE2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13589 2025-11-25 cs.CV 67%

AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding

AdaVideoRAG:多情境自适应检索增强高效长视频理解

Zhucun Xue, Jiangning Zhang, Xurong Xie, Yuxuan Cai, Yong Liu, Xiangtai Li, Dacheng Tao

机构 * Zhejiang University(浙江大学) Youtu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technolog(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 AdaVideoRAG通过自适应检索增强框架提升长视频理解效率与准确性,支持多层级知识检索与深度语义分析。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10108 2025-11-21 cs.LG q-bio.NC 67%

NeuroXVocal: Detection and Explanation of Alzheimer's Disease through Non-invasive Analysis of Picture-prompted Speech

NeuroXVocal:通过非侵入性分析提示语音检测和解释阿尔茨海默病

Nikolaos Ntampakis, Konstantinos Diamantaras, Ioanna Chouvarda, Magda Tsolaki, Vasileios Argyriou, Panagiotis Sarigianndis

机构 * International Hellenic University, Sindos, Greece MetaMind Innovations, Kozani, Greece Aristotle University of Thessaloniki, Thessaloniki, Greece Greek Association of Alzheimer’s Disease \& Related Disorders, Thessaloniki, Greece Kingston University London, London, UK University of Western Macedonia, Kozani, Greece

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 NeuroXVocal通过非侵入性语音分析实现阿尔茨海默病的检测与解释,结合高精度分类和文献支持的可解释性,提升临床诊断效果。

Journal ref Medical Image Computing and Computer Assisted Intervention - MICCAI 2025. Lecture Notes in Computer Science, vol 15973. Springer, Cham (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02415 2025-11-05 cs.CV 67%

ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension

Duo Xu, Hao Cheng, Xin Lin, Zhen Xie, Hao Wang

机构 * Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments 23 pages, EMNLP25 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23357 2025-10-28 cs.RO 67%

Large language model-based task planning for service robots: A review

Shaohan Bian, Ying Zhang, Guohui Tian, Zhiqiang Miao, Edmond Q. Wu, Simon X. Yang, Changchun Hua

机构 * School of Electrical Engineering, Yanshan University(燕山大学电气工程学院) Engineering Research Center of Intelligent Control System and Intelligent Equipment, Ministry of Education, Yanshan University(燕山大学智能控制与设备工程研究中心) Hebei Key Laboratory of Intelligent Rehabilitation and Neuromodulation, Yanshan University(河北省智能康复与神经调制重点实验室) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(国家机器人视觉感知与控制技术工程研究中心) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) Advanced Robotics and Intelligent Systems Laboratory, School of Engineering, University of Guelph(圭尔夫大学工程学院先进机器人与智能系统实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Submitted to Biomimetic Intelligence and Robotics for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18303 2025-10-22 cs.CV 67%

Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models

Lehan Wang, Yi Qin, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14032 2025-10-17 cs.CV 67%

Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding

Xiaoqian Shen, Wenxuan Zhang, Jun Chen, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布斯大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments NeurIPS 2025 (Spotlight). Webpage at https://xiaoqian-shen.github.io/Vgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01622 2025-10-03 cs.IR cs.AI cs.CL 67%

LLM4Rec: Large Language Models for Multimodal Generative Recommendation with Causal Debiasing

Bo Ma, Hang Li, ZeHua Hu, XiaoFan Gui, LuYao Liu, Simon Lau

机构 * Department of Software \& Microelectronics Peking University Beijing, China Department of Software \& Microelectronics Peking University Beijing, China hangli\ Department of Software \& Microelectronics Peking University Beijing, China zehua\ Department of Software \& Microelectronics Peking University Beijing, China xiaofan\ Economic Law School China University of Political Science Peking University Changsha, China

专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02723 2025-10-02 cs.RO 67%

ImpedanceGPT: VLM-driven Impedance Control of Swarm of Mini-drones for Intelligent Navigation in Dynamic Environment

Faryal Batool, Yasheerah Yaqoot, Malaika Zafar, Roohan Ahmed Khan, Muhammad Haris Khan, Aleksey Fedoseev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科沃科学与技术研究所)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Accepted in IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13326 2025-09-18 cs.HC cs.LG 67%

LLM Chatbot-Creation Approaches

Hemil Mehta, Tanvi Raut, Kohav Yadav, Edward F. Gehringer

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Forthcoming in Frontiers in Education (FIE 2025), Nashville, Tennessee, USA, Nov 2-5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11124 2025-09-16 cs.SD eess.AS 67%

STASE: A spatialized text-to-audio synthesis engine for music generation

Tutti Chi, Letian Gao, Yixiao Zhang

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Accepted to LLM4Music @ ISMIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19338 2025-09-03 cs.LG cs.CR 67%

Membership Inference Attacks on Large-Scale Models: A Survey

Hengyu Wu, Yang Cao

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Preprint. Submitted for peer review. The final version may differ

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20585 2025-08-29 cs.HC 67%

Persode: Personalized Visual Journaling with Episodic Memory-Aware AI Agent

Seokho Jin, Manseo Kim, Sungho Byun, Hansol Kim, Jungmin Lee, Sujeong Baek, Semi Kim, Sanghum Park, Sung Park

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09845 2025-08-05 cs.RO 67%

Friction-Aware Safety Locomotion for Wheeled-legged Robots using Vision Language Models and Reinforcement Learning

Bo Peng, Donghoon Baek, Qijie Wang, Joao Ramos

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Mechanical Science Engineering(机械科学与工程系) School of Software(软件学院)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Accepted to Humanoids 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21924 2025-07-30 cs.CV 67%

MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning

Tianhong Gao, Yannian Fu, Weiqun Wu, Haixiao Yue, Shanshan Liu, Gang Zhang

机构 * Baidu Inc.(百度公司)

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05461 2025-07-23 cs.HC 67%

GLOSS: Group of LLMs for Open-Ended Sensemaking of Passive Sensing Data for Health and Wellbeing

Akshat Choube, Ha Le, Jiachen Li, Kaixin Ji, Vedant Das Swain, Varun Mishra

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15266 2025-07-22 cs.RO cs.SY eess.SY 67%

VLM-UDMC: VLM-Enhanced Unified Decision-Making and Motion Control for Urban Autonomous Driving

Haichao Liu, Haoren Guo, Pei Liu, Benshan Ma, Yuxiang Zhang, Jun Ma, Tong Heng Lee

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09149 2025-06-23 cs.CV cs.MM 67%

Memory-enhanced Retrieval Augmentation for Long Video Understanding

Huaying Yuan, Zheng Liu, Minghao Qin, Hongjin Qian, Yan Shu, Zhicheng Dou, Ji-Rong Wen, Nicu Sebe

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光华学院人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Trento(特伦托大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06399 2025-05-13 cs.RO 67%

LLM-Land: Large Language Models for Context-Aware Drone Landing

Siwei Cai, Yuwei Wu, Lifeng Zhou

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Drexel University(德雷塞尔大学) Department of Electrical and Systems Engineering(电气与系统工程系) University of Pennsylvania(宾夕法尼亚大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03556 2025-05-07 cs.IT math.IT 67%

A Comprehensive Survey of Large AI Models for Future Communications: Foundations, Applications and Challenges

Feibo Jiang, Cunhua Pan, Li Dong, Kezhi Wang, Merouane Debbah, Dusit Niyato, Zhu Han

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07110 2025-04-22 eess.SY cs.SY 67%

Bio-Eng-LMM AI Assist chatbot: A Comprehensive Tool for Research and Education

Ali Forootani, Danial Esmaeili Aliabadi, Daniela Thraen

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13190 2025-04-21 cs.NI eess.SP 67%

Cellular-X: An LLM-empowered Cellular Agent for Efficient Base Station Operations

Liujianfu Wang, Xinyi Long, Yuyang Du, Xiaoyan Liu, Kexin Chen, Soung Chang Liew

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments MobiSys ’25, June 23-27, 2025, Anaheim, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏