LLM-C3MOD: A Human-LLM Collaborative System for Cross-Cultural Hate Speech Moderation
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
Comments Accepted to NAACL 2025 Workshop - C3NLP (Workshop on Cross-Cultural Considerations in NLP)
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
Comments Accepted to NAACL 2025 Workshop - C3NLP (Workshop on Cross-Cultural Considerations in NLP)
机构 * Douyin Content Group, ByteDance(字节跳动内容部) ; School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)
专题命中 长文档RAG :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
机构 * The City University of Hong Kong(香港城市大学) ; Renmin University of China(中国人民大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shenzhen University(深圳大学) ; National Yang Ming Chiao Tung University(阳明交通大学) ; Taipei Veterans General Hospital(台北荣民总医院)
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
Comments Accepted by NeurIPS25 Spotlight
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
Comments Technical Report by RELAI.ai
机构 * MIRIX AI
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
机构 * National Taiwan University(国立台湾大学) ; NVIDIA(NVIDIA公司) ; National Tsing Hua University(国立清华大学)
专题命中 长文档RAG :retriever(abstract);分类 cs.CL、cs.AI
Comments Accepted for ICCV 2025. Project page: https://joslefaure.github.io/assets/html/hermes.html
机构 * LUMIA Lab, Shanghai Jiao Tong University(上海交通大学LUMIA实验室) ; Tiansuan Lab, Ant Group Co., Ltd.(蚂蚁集团天算实验室) ; SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院)
专题命中 长文档RAG :RAG(abstract);分类 cs.IR、cs.CL
Comments ACL 2025 Main
机构 * Snowflake AI Research(Snowflake人工智能研究院)
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
机构 * State Key Laboratory of Intelligent Game(智能游戏国家重点实验室) ; Science and Technology on Integrated Information System Laboratory(集成信息系统技术实验室) ; Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanyang Technological University(南洋理工大学)
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
Comments 15 pages, 4 figures
机构 * UC Berkeley(伯克利大学) ; Stanford University(斯坦福大学) ; Foundry ; Princeton University(普林斯顿大学)
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
专题命中 长文档RAG :retriever(abstract);分类 cs.CL、cs.AI
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
Comments 13 pages
专题命中 长文档RAG :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2024 Datasets and Benchmarks Track
专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI
专题命中 长文档RAG :vector search(abstract);分类 cs.CL、cs.AI
Comments 14 pages
专题命中 长文档RAG :retrieval augmented generation(abstract);分类 cs.CL、cs.AI
专题命中 长文档RAG :retrieval augmented generation(abstract);分类 cs.CL、cs.AI
Comments Accepted to the EMNLP 2021 Conference as a long-paper, 9 pages, 15 pages with appendices and references, 2 figures, 4 tables
表格作为标记:一种增强图的多表表格理解表示
机构 * Effyic Technology Co., Ltd(Effyic技术有限公司) ; McGill University(麦吉尔大学)
专题命中 长文档RAG :RAG(abstract);分类 cs.AI
AI总结 本文提出Sheet as Token框架,通过图增强方法将每个工作表视为统一语义单元,提升多表表格检索能力,实验表明图增强的跨表推理在有限计算下优于浅层图基线。
章鱼v2:用于超级代理的设备端语言模型
机构 * Stanford University(斯坦福大学)
专题命中 长文档RAG :RAG(abstract);分类 cs.CL
AI总结 章鱼v2通过设备端20亿参数模型,在准确性和延迟上超越GPT-4,同时将上下文长度减少95%,提升边缘设备应用性能。
迷失在单一向量中:通过分块证据聚合改进长文档检索
机构 * Chongqing University(重庆大学) ; State Key Laboratory of AI Safety(人工智能安全国家重点实验室) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of California, Merced(加州大学默塞德分校) ; University of Queensland(昆士兰大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 长文档RAG :dense retrieval(abstract);分类 cs.CL
AI总结 针对长文档检索中单向量编码削弱关键片段证据的问题,提出无训练的分块证据聚合策略DICE,通过独立编码分块并聚合为单一向量,在保持标准接口的同时显著提升检索性能。
Comments Code is available at https://github.com/PunchlineAAAA/DICE
超越块级抽取:面向GraphRAG的跨块图增强
机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学)
专题命中 长文档RAG :retrieval-augmented generation(abstract);分类 cs.CL
AI总结 提出CrossAug方法,利用GNN引导的跨块图增强,在查询前离线补充GraphRAG索引中缺失的跨块关系,提升多跳和长文档问答性能。
Comments 15 pages, 5 figures, 8 tables
知识包:通过KV缓存注入实现零token知识传递
机构 * Independent Researcher(独立研究员)
专题命中 长文档RAG :RAG(abstract);分类 cs.CL
AI总结 本文提出知识包,通过预计算的KV缓存实现零token成本的知识传递,实验显示在正确格式下,知识包在700个问题上无差异,比RAG节省95%token,同时支持RAG无法实现的行为引导。
Comments 12 pages, 3 figures, 8 tables. Code: https://github.com/cnails/kv-knowledge-packs
通过LLM增强的跨城市学习预测极端事件中的人类移动
机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心)
专题命中 长文档RAG :RAG(abstract);分类 cs.AI
AI总结 本文提出X-MLM框架,利用LLM建模移动意图,跨城市转移极端事件对移动意图的影响知识,提升极端事件中的人类移动预测性能。
基于块级缓存系统的KV缓存重用策略实验研究
专题命中 长文档RAG :retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本文通过实验探讨块级缓存系统中KV缓存重用策略的局限性与优化方法,提出一种融合现有技术的改进设计以提升准确性。
AVIATOR:面向高保真、大规模代码安全数据集的AI代理漏洞注入流程
机构 * National Institute of Standards and Technology, Software and Systems Division(美国国家标准与技术研究院软件与系统 division) ; Université Grenoble Alpes, CNRS, LIG(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,LIG实验室)
专题命中 长文档RAG :RAG(abstract);分类 cs.AI
AI总结 本文提出AVIATOR,首个AI代理漏洞注入框架,通过协调AI代理、工具分析和迭代自我纠正,生成高保真漏洞数据,提升漏洞检测模型性能。
编译记忆:不是更多信息,而是为语言代理提供更精确的指令
机构 * AlphaBitCore, Inc.(AlphaBitCore公司)
专题命中 长文档RAG :RAG(abstract);分类 cs.AI
AI总结 本文提出Atlas内存内核,通过编译积累的任务经验为语言代理生成指令结构,无需微调、RAG或人工干预,提升GPT-4o和Claude Sonnet~4.5在合同分析和多跳问答任务中的性能。
基于代理的DAG编排规划框架:用于混合数据湖中多模态、多跳问答系统
专题命中 长文档RAG :RAG(abstract);分类 cs.AI
AI总结 本文提出A.DOT规划框架,通过编译自然语言查询为DAG执行计划,实现多模态多跳问答,提升准确性和效率,并生成可追溯的证据链。
长文奖励基准:评估长文生成的奖励模型
专题命中 长文档RAG :RAG(abstract);分类 cs.CL
AI总结 本文提出Long-form RewardBench,首个专为长文生成设计的奖励模型评估平台,通过五个子任务评估20+主流模型,揭示分类与生成模型在长文奖励建模上的差异。
Comments Accepted by AAAI2026