arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-09-01 至 2026-09-01 共收录 3 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 多模态RAG 3 篇

2608.28699 2026-09-01 cs.CV 新提交 90%

Beyond Visual Boundaries: Rethinking Scene Segmentation for Movie RAG

超越视觉边界:为电影检索增强生成(RAG)重新思考场景分割

Dong-Hee Kim, Seonwoo Choi, Changbeen Kim, Jungmyung Wi, Juyeon Ko, Youngju Choi, Il Hyeon Mun, Hyunwoo J. Kim, Donghyun Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract)

AI总结 本文针对电影RAG场景,发现现有场景分割方法不如均匀时间分块,提出以叙事为核心的NarraScene数据集,其生成的片段作为检索单元可提升下游电影理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30163 2026-09-01 cs.IR cs.CV 新提交 89%

Doc-REFRAG: Rethinking Multimodal Document Retrieval-Augmented Generation

Doc-REFRAG:重新思考多模态文档检索增强生成

Ruofan Hu, Shengyang Xu, Minjie Hong, Xiaoda Yang, Sashuai Zhou, Ke Lei, Tao Jin, Zhou Zhao

专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(title,abstract);分类 cs.IR

AI总结 针对现有多模态RAG模型在多图像场景中准确率有限且计算开销大的问题,提出基于大规模数据集DocLongRAG的问题引导框架Doc-REFRAG,其在六个基准上优于11个基线,实现SOTA准确率且推理延迟更低。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30213 2026-09-01 cs.CV cs.CL 新提交 81%

Towards a Joint Khmer Text Recognition and Word Segmentation

高棉语文本识别与分词联合模型研究

Marry Kong, Rina Buoy, Sovisal Chenda, Nguonly Taing, Masakazu Iwamura, Koichi Kise

机构 * Techo Startup Center(德科创业中心) Ministry of Economy and Finance(经济与财政部) Osaka Metropolitan University(大阪公立大学)

专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);knowledge retrieval(abstract);分类 cs.CL

AI总结 本文提出一种采用CTC解码器的统一模型,实现高棉语文本识别与分词联合,可在不同模态基准数据集上同时完成字符识别与词边界定位,无需额外分词步骤。

Comments 16 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏