arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 8633 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 多模态RAG 557 篇

2602.03432 2026-02-04 cs.IR 57%

Failure is Feedback: History-Aware Backtracking for Agentic Traversal in Multimodal Graphs

失败是反馈:面向多模态图中代理遍历的历史感知回溯

Joohyung Yun, Doyup Lee, Wook-Shin Han

专题命中 多模态RAG :retriever(abstract);分类 cs.IR

AI总结 FiF通过历史感知回溯和经济理性的代理工作流程,提升多模态图中检索的适应性和效率。

Comments Project page: https://failureisfeedback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01561 2026-02-03 cs.CV cs.AI 57%

Multimodal UNcommonsense: From Odd to Ordinary and Ordinary to Odd

多模态UNcommonsense:从奇特到普通和从普通到奇特

Yejin Son, Saejin Kim, Dongjun Min, Younjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 多模态RAG :retriever(abstract);分类 cs.AI

AI总结 多模态UNcommonsense通过R-ICL框架提升模型在非典型场景下的推理能力,实现从奇特到普通和从普通到奇特的转换。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22929 2026-02-03 cs.CV cs.CL cs.CR 57%

Semantic Leakage from Image Embeddings

图像嵌入中的语义泄露

Yiyi Chen, Qiongkai Xu, Desmond Elliott, Qiongxiu Li, Johannes Bjerva

机构 * Department of Computer Science, Aalborg University, Copenhagen, Denmark(计算机科学系,奥尔堡大学,哥本哈根,丹麦) School of Computing, Macquarie University, Sydney, Australia(计算学院,麦考瑞大学,悉尼,澳大利亚) Department of Computer Science, University of Copenhagen, Copenhagen, Denmark(计算机科学系,哥本哈根大学,哥本哈根,丹麦) Department of Electronic Systems, Aalborg University, Copenhagen, Denmark(电子系统系,奥尔堡大学,哥本哈根,丹麦)

专题命中 多模态RAG :retriever(abstract);分类 cs.CL

AI总结 SLImE通过保留局部语义邻域实现从压缩图像嵌入中恢复语义信息,揭示了图像嵌入的隐私风险。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22055 2026-01-30 cs.CL 57%

$G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA

$G^2$-Reader: 双重演化图式用于多模态文档问答

Yaxin Du, Junru Song, Yifan Zhou, Cheng Wang, Jiahao Gu, Zimeng Chen, Menglan Chen, Wen Yao, Yang Yang, Ying Wen, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Intelligent Game and Decision Laboratory(智能游戏与决策实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 $G^2$-Reader通过双重图式解决多模态文档问答中的结构破坏和检索失效问题,实现66.21%的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20831 2026-01-29 cs.AI cs.RO 57%

MemCtrl: Using MLLMs as Active Memory Controllers on Embodied Agents

MemCtrl: 使用 MLLMs 作为具身智能体的主动内存控制器

Vishnu Sashank Dorbala, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

专题命中 多模态RAG :RAG(abstract);分类 cs.AI

AI总结 MemCtrl 通过使用 MLLMs 的可训练内存头 μ 实现在线内存修剪,提升具身智能体在复杂指令下的任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20676 2026-01-29 cs.CL 57%

Efficient Multimodal Planning Agent for Visual Question-Answering

高效的多模态规划代理用于视觉问答

Zhuo Chen, Xinyu Geng, Xinyu Wang, Yong Jiang, Zhen Zhang, Pengjun Xie, Kewei Tu

机构 * ShanghaiTech University(上海科技大学) Alibaba Tongyi Lab(阿里云通义实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出了一种高效的多模态规划代理,通过动态分解mRAG流程,提升视觉问答任务的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18203 2026-01-28 cs.IR 57%

DMAP: Human-Aligned Structural Document Map for Multimodal Document Understanding

DMAP: 人类对齐的多模态文档结构地图用于多模态文档理解

ShunLiang Fu, Yanxin Zhang, Yixin Xiang, Xiaoyu Du, Jinhui Tang

专题命中 多模态RAG :RAG(abstract);分类 cs.IR

AI总结 DMAP通过构建人类对齐的多模态文档结构地图,提升文档理解的结构化表示和多模态推理能力。

Comments WebConf 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04571 2026-01-09 cs.AI cs.MM 57%

Enhancing Multimodal Retrieval via Complementary Information Extraction and Alignment

通过互补信息提取与对齐增强多模态检索

Delong Zeng, Yuexiang Xie, Yaliang Li, Ying Shen

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(1 智能系统工程学院,中山大学) Alibaba Group(2 阿里巴巴集团) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(3 广东省火灾科学与智能应急技术重点实验室)

专题命中 多模态RAG :dense retrieval(abstract);分类 cs.AI

AI总结 CIEA通过互补信息提取与对齐提升多模态检索效果,实现对图像和文本统一潜在空间的建模,并在多个基准上取得显著优势。

Comments Accepted by ACL'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02968 2026-01-07 cs.AI 57%

Rationale-Grounded In-Context Learning for Time Series Reasoning with Multimodal Large Language Models

基于理由的上下文学习用于多模态大语言模型的时间序列推理

Qingxiang Liu, Zhiqing Cui, Xiaoliang Luo, Yuqian Wu, Zhuoyang Jiang, Huaiyu Wan, Sheng Sun, Lvchun Wang, Wei Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) China Mobile (Jiangxi) Virtual Reality Technology Co., Ltd.(中国移动(江西)虚拟现实技术有限公司) School of Computer and Information Technology, Beijing Jiaotong University(北京交通大学计算机与信息学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 多模态RAG :hybrid retrieval(abstract);分类 cs.AI

AI总结 本研究提出RationaleTS方法,通过基于理由的上下文学习提升多模态大语言模型在时间序列推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20916 2025-12-25 cs.IR cs.MM 57%

MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model

MMSRARec: 基于多模态大语言模型的摘要与检索增强的序列推荐

Haoyu Wang, Yitong Wang, Jining Wang

专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.IR

AI总结 本文提出MMSRARec,基于多模态大语言模型,通过摘要与检索增强序列推荐,提升推荐性能、可解释性与计算效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15006 2025-12-18 cs.CV cs.AI 57%

Evaluating the Capability of Video Question Generation for Expert Knowledge Elicitation

评估视频问题生成在专家知识获取中的能力

Huaying Zhang, Atsushi Hashimoto, Tosho Hirasawa

机构 * OMRON SINIC X Corp.(OMRON SINIC X公司) Hokkaido University(北海道大学)

专题命中 多模态RAG :retriever(abstract);分类 cs.AI

AI总结 本文提出了一种评估视频问题生成能力的新协议,通过模拟专家问答交流来评估问题质量,利用新构建的EgoExoAsk数据集验证了模型在获取未见知识方面的有效性。

Comments WACV 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07360 2025-12-09 cs.CV cs.AI 57%

Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation

基于区域邻接图的结构感知特征校正用于无训练开放词汇语义分割

Qiming Huang, Hao Ai, Jianbo Jiao

机构 * The MIx Group, School of Computer Science University of Birmingham(米克集团,计算机科学学院,伯明翰大学)

专题命中 多模态RAG :RAG(abstract);分类 cs.AI

AI总结 本文提出基于区域邻接图的结构感知特征校正方法,通过增强局部辨别能力来提升开放词汇语义分割的性能。

Comments Accepted to WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16635 2025-11-21 cs.CV cs.CL 57%

SurvAgent: Hierarchical CoT-Enhanced Case Banking and Dichotomy-Based Multi-Agent System for Multimodal Survival Prediction

SurvAgent: 基于层次化CoT增强的案例库与二元多智能体系统用于多模态生存预测

Guolin Huang, Wenting Chen, Jiaqi Yang, Xinheng Lyu, Xiaoling Luo, Sen Yang, Xiaohan Xing, Linlin Shen

机构 * Shenzhen University(深圳大学) Stanford University(斯坦福大学) University of Nottingham Ningbo China(诺丁汉大学宁波分校) Ant Group(蚂蚁集团)

专题命中 多模态RAG :RAG(abstract);分类 cs.CL

AI总结 SurvAgent通过层次化CoT增强的多智能体系统,整合多模态数据,提升生存预测的可解释性与准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10390 2025-11-18 cs.CV cs.AI 57%

MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns

Jiarui Zhang, Yuliang Liu, Zijun Wu, Guosheng Pang, Zhili Ye, Yupei Zhong, Junteng Ma, Tao Wei, Haiyang Xu, Weikai Chen, Zeen Wang, Qiangjun Ji, Fanxi Zhou, Qi Zhang, Yuanrui Hu, Jiahao Liu, Zhang Li, Ziyang Zhang, Qiang Liu, Xiang Bai

机构 * KingSoft Office Zhuiguang AI Lab(金山办公紫光人工智能实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05796 2025-11-14 cs.CV cs.AI 57%

Dual-Mode Deep Anomaly Detection for Medical Manufacturing: Structural Similarity and Feature Distance

Julio Zanon Diaz, Georgios Siogkas, Peter Corcoran

专题命中 多模态RAG :RAG(abstract);分类 cs.AI

Comments 12 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22900 2025-11-10 cs.CV cs.CL 57%

MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering

Mai A. Shaaban, Tausifa Jan Saleem, Vijay Ram Papineni, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Mathematics and Computer Science, Faculty of Science, Alexandria University(亚历山大大学数学与计算机科学系) Sheikh Shakhbout Medical City(谢赫·沙赫布OUT医疗城)

专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01617 2025-11-04 cs.CV cs.IR 57%

Vote-in-Context: Turning VLMs into Zero-Shot Rank Fusers

Mohamed Eltahir, Ali Habibullah, Lama Ayash, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学) King Khalid University (KKU)(国王 Khalid 大学) Edge Hill University(埃德希尔大学)

专题命中 多模态RAG :retriever(abstract);分类 cs.IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22023 2025-11-04 cs.IR 57%

Multimodal Item Scoring for Natural Language Recommendation via Gaussian Process Regression with LLM Relevance Judgments

Yifan Liu, Qianfeng Wen, Jiazhou Liang, Mark Zhao, Justin Cui, Anton Korikov, Armin Toroghi, Junyoung Kim, Scott Sanner

专题命中 多模态RAG :dense retrieval(abstract);分类 cs.IR

Comments 16 pages,20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15877 2025-10-15 cs.CV cs.CL cs.LG 57%

Highlighting What Matters: Promptable Embeddings for Attribute-Focused Image Retrieval

Siting Li, Xiang Gao, Simon Shaolei Du

专题命中 多模态RAG :retriever(abstract);分类 cs.CL

Comments NeurIPS 2025; 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10610 2025-10-07 cs.CV cs.CL 57%

MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly

Zhaowei Wang, Wenhao Yu, Xiyu Ren, Jipeng Zhang, Yu Zhao, Rohit Saxena, Liang Cheng, Ginny Wong, Simon See, Pasquale Minervini, Yangqiu Song, Mark Steedman

机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系) Tencent AI Seattle Lab(腾讯AI西雅图实验室) University of Edinburgh(爱丁堡大学) NVIDIA AI Technology Center (NVAITC), NVIDIA, Santa Clara, USA(英伟达圣克拉拉人工智能技术中心)

专题命中 多模态RAG :RAG(abstract);分类 cs.CL

Comments Accepted as a spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00088 2025-10-02 cs.AI cs.CY 57%

Judging by Appearances? Auditing and Intervening Vision-Language Models for Bail Prediction

Sagnik Basu, Shubham Prakash, Ashish Maruti Barge, Siddharth D Jaiswal, Abhisek Dash, Saptarshi Ghosh, Animesh Mukherjee

机构 * Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 多模态RAG :RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24350 2025-09-30 cs.CV cs.AI 57%

Dynamic Orchestration of Multi-Agent System for Real-World Multi-Image Agricultural VQA

Yan Ke, Xin Yu, Heming Du, Scott Chapman, Helen Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 多模态RAG :retriever(abstract);分类 cs.AI

Comments 13 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05748 2025-09-03 cs.IR 57%

WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent

Xinyu Geng, Peng Xia, Zhen Zhang, Xinyu Wang, Qiuchen Wang, Ruixue Ding, Chenxi Wang, Jialong Wu, Yida Zhao, Kuan Li, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

专题命中 多模态RAG :RAG(abstract);分类 cs.IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12263 2025-09-01 cs.CV cs.AI 57%

Region-Level Context-Aware Multimodal Understanding

Hongliang Wei, Xianqi Zhang, Xingtao Wang, Xiaopeng Fan, Debin Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) Department of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术系,哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院长) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

专题命中 多模态RAG :RAG(abstract);分类 cs.AI

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19319 2025-08-28 eess.IV cs.AI cs.CV 57%

MedVQA-TREE: A Multimodal Reasoning and Retrieval Framework for Sarcopenia Prediction

Pardis Moradbeiki, Nasser Ghadiri, Sayed Jalal Zahabi, Uffe Kock Wiil, Kristoffer Kittelmann Brockhattingen, Ali Ebrahimi

机构 * Department of Electrical and Computer Engineering, Isfahan University of Technology(电气与计算机工程系,伊斯法罕技术大学) SDU Health Informatics and Technology, The Maersk Mc-Kinney Moller Institute, University of Southern Denmark(南部丹麦大学健康信息学与技术,马士基麦金尼莫勒研究所) Geriatric Research Unit, Department of Clinical Research, University of Southern Denmark(老年医学研究单元,临床研究系,南部丹麦大学)

专题命中 多模态RAG :knowledge retrieval(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18108 2025-08-26 cs.CL 57%

SentiMM: A Multimodal Multi-Agent Framework for Sentiment Analysis in Social Media

Xilai Xu, Zilin Zhao, Chengye Song, Zining Wang, Jinhe Qiang, Jiongrui Yan, Yuhuai Lin

机构 * College of Information and Electrical Engineering, China Agricultural University(信息与电气工程学院,中国农业大学) College of Software, Jilin University(软件学院,吉林大学) College of Communication Engineering, Jilin University(通信工程学院,吉林大学)

专题命中 多模态RAG :knowledge retrieval(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06328 2025-08-11 cs.IR 57%

M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation

Zhiyou Xiao, Qinhan Yu, Binghui Li, Geng Chen, Chong Chen, Wentao Zhang

专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12884 2025-07-01 cs.LG cs.AI cs.CV 57%

TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks

Yuanze Hu, Zhaoxin Fan, Xinyu Wang, Gen Li, Ye Qiu, Zhichao Yang, Wenjun Wu, Kejian Wu, Yifan Sun, Xiaotie Deng, Jin Dong

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) Beihang University(北京航空航天大学) Hangzhou International Innovation Institute(杭州国际创新研究院) Xreal Renmin University(中国人民大学) Peking University(北京大学) Beijing Academy of Blockchain and Edge Computing (BABEC)(北京区块链与边缘计算研究院)

专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12831 2025-07-01 eess.IV cs.AI cs.CV 57%

Segment as You Wish -- Free-Form Language-Based Segmentation for Medical Images

Longchao Da, Rui Wang, Xiaojian Xu, Parminder Bhatia, Taha Kass-Hout, Hua Wei, Cao Xiao

机构 * Arizona State University(亚利桑那州立大学)

专题命中 多模态RAG :RAG(abstract);分类 cs.AI

Comments 19 pages, 9 as main content. The paper was accepted to KDD2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10756 2025-06-13 cs.RO cs.AI 57%

Grounded Vision-Language Navigation for UAVs with Open-Vocabulary Goal Understanding

Yuhang Zhang, Haosheng Yu, Jiaping Xiao, Mir Feroskhan

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)

专题命中 多模态RAG :retriever(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏