arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-27 至 2026-01-27 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 16 篇

2601.11969 2026-01-27 cs.CL cs.AI 90%

MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models

MemoryRewardBench: 评估大型语言模型中长期记忆管理的奖励模型基准

Zecheng Tang, Baibei Ji, Ruoxi Sun, Haitian Wang, WangJie You, Zhang Yijun, Wenpeng Zhu, Ji Qi, Juntao Li, Min Zhang

机构 * LCM Laboratory(LCM实验室) China Mobile (Suzhou)(中国移动(苏州))

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 MemoryRewardBench通过系统评估奖励模型在长序列内存管理中的表现,揭示了不同模型在长期记忆处理中的能力差异与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10571 2026-01-27 cs.CL cs.AI 88%

On the Failure of Latent State Persistence in Large Language Models

大型语言模型中潜在状态持续性的失效

Jen-tse Huang, Kaiser Sun, Wenxuan Wang, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Renmin University of China(中国人民大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文揭示大型语言模型在维持持久潜在状态方面的缺陷,通过三个实验展示其在概率分配、概念漂移和变量绑定上的失败,表明LLMs更倾向于反应性求解而非主动规划。

Comments 8 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06950 2026-01-27 cs.CL 86%

CtrlRAG: Black-box Document Poisoning Attacks for Retrieval-Augmented Generation of Large Language Models

CtrlRAG:用于大型语言模型检索增强生成的黑盒文档污染攻击

Runqi Sui

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Sun Yat-sen University(中山大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 CtrlRAG通过注入恶意文档实现对RAG系统的黑盒攻击,提升攻击成功率并提出动态防御策略以平衡安全与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15124 2026-01-27 cs.LG cs.AI 81%

RAG-GFM: Overcoming In-Memory Bottlenecks in Graph Foundation Models via Retrieval-Augmented Generation

RAG-GFM:通过检索增强生成克服图基础模型中的内存瓶颈

Haonan Yuan, Qingyun Sun, Jiacheng Tao, Xingcheng Fu, Jianxin Li

机构 * SKLCCSE, School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北航) Guangxi Normal University(广西师范大学)

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 RAG-GFM通过检索增强生成方法,解决图基础模型中的内存瓶颈问题,提升模型的效率和效果。

Comments Accepted by the Web Conference 2026 (Research Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18527 2026-01-27 cs.CL 79%

Exploring Fine-Tuning for In-Context Retrieval and Efficient KV-Caching in Long-Context Language Models

探索针对长上下文语言模型的微调以实现上下文检索和高效的KV缓存

Francesco Maria Molfese, Momchil Hardalov, Rexhina Blloshmi, Bill Byrne, Adrià de Gispert

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了长上下文语言模型在微调策略下的性能提升及KV缓存压缩下的鲁棒性,展示了领域内和跨领域任务中的不同表现。

Comments European Chapter of the Association for Computational Linguistics EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18285 2026-01-27 cs.CL 77%

U-Fold: Dynamic Intent-Aware Context Folding for User-Centric Agents

U-Fold:面向用户中心任务的动态意图感知上下文折叠

Jin Su, Runnan Fang, Yeqiu Li, Xiaobin Wang, Shihao Cai, Pengjun Xie, Ningyu Zhang, Fajie Yuan

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Westlake University(西湖大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 U-Fold通过动态意图感知上下文折叠方法,提升用户为中心任务中长上下文处理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03729 2026-01-27 cs.HC cs.AI 77%

Beyond Chat: a Framework for LLMs as Human-Centered Support Systems

超越聊天:一种LLMs作为以人为中心的支持系统框架

Zhiyin Zhou

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种LLMs作为以人为中心的支持系统框架,旨在通过透明性、个性化等原则,提升人类在决策和幸福感方面的支持,同时应对隐私、偏见等风险。

Journal ref David C. Wyld et al. (Eds): CRYPIS, CBIoT, CAIML, NLCA, NC, WiMo, ICAIT, ICDIPV, ITCSE, 2025, pp. 271-289, 2025. CS & IT, CSCP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18771 2026-01-27 cs.CL cs.AI cs.IR 73%

Dep-Search: Learning Dependency-Aware Reasoning Traces with Persistent Memory

Dep-Search: 基于持久记忆的学习依赖意识推理轨迹

Yanming Liu, Xinyue Peng, Zixuan Yan, Yanxin Shen, Wenjie Xu, Yuefeng Huang, Xinyi Wang, Jiannan Cao, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Intel Corporation(英特尔公司) Tsinghua University(清华大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Dep-Search 通过 GRPO 集成结构化推理、检索和持久记忆,提升 LLM 处理复杂多跳推理任务的能力。

Comments Dep-Search 1st version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16781 2026-01-27 cs.CL cs.LG 73%

Persuasion Tokens for Editing Factual Knowledge in LLMs

说服令牌用于编辑大语言模型中的事实知识

Paul Youssef, Christin Seifert, Jörg Schlötterer

机构 * Marburg University(马尔堡大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出说服令牌技术,通过训练特殊令牌实现高效的大语言模型事实知识编辑,无需依赖长演示,且在多个数据集和模型上表现优异。

Comments Accepted at EACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16032 2026-01-27 cs.PF cs.AI cs.LG cs.OS 73%

Sawtooth Wavefront Reordering: Enhanced CuTile FlashAttention on NVIDIA GB10

锯齿波前重排:增强的CuTile FlashAttention on NVIDIA GB10

Yifan Zhu, Yekai Pan, Chen Ding

机构 * University of Rochester(罗切斯特大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出锯齿波前重排技术,通过减少L2缓存缺失提升CuTile FlashAttention在NVIDIA GB10上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15609 2026-01-27 cs.LG cs.CL 73%

When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards

当锐化变成崩溃:可验证奖励强化学习中的采样偏差与语义耦合

Mingyuan Fan, Weiguang Han, Daixin Wang, Cen Chen, Zhiqiang Zhang, Jun Zhou

机构 * School of Data Science\&Engineering, East China Normal University(数据科学与工程学院,东华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了可验证奖励强化学习中的采样偏差与语义耦合问题,提出逆成功优势校准和分布级校准方法以提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05903 2026-01-27 cs.CY cs.AI cs.CL cs.HC 73%

The Imperfect Learner: Incorporating Developmental Trajectories in Memory-based Student Simulation

不完美的学习者:在基于记忆的学生模拟中纳入发展轨迹

Zhengyuan Liu, Stella Xin Yin, Bryan Chen Zhengyu Tan, Roy Ka-Wei Lee, Guimei Liu, Dion Hoe-Lian Goh, Wenya Wang, Nancy F. Chen

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于记忆的学生模拟框架,通过分层记忆机制和结构化知识表示,整合发展轨迹和元认知过程,以更准确地模拟学习者的知识发展和学习困难。

Comments Fixed some grammar and format issues. Added some experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07713 2026-01-27 cs.CL 70%

MemWeaver: A Hierarchical Memory from Textual Interactive Behaviors for Personalized Generation

MemWeaver: 一种从文本交互行为构建的分层记忆用于个性化生成

Shuo Yu, Mingyue Cheng, Daoyu Wang, Qi Liu, Zirui Liu, Ze Guo, Xiaoyu Tao

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MemWeaver通过构建分层记忆模型,利用文本交互行为捕捉用户兴趣的时间演变和语义关系,实现深度个性化内容生成。

Comments Accepted by The Web Conference 2026 (WWW'26) 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18788 2026-01-27 cs.CL cs.LG stat.ML 62%

Unsupervised Text Segmentation via Kernel Change-Point Detection on Sentence Embeddings

基于句子嵌入的核变化点检测实现无监督文本分段

Mumin Jia, Jairo Diaz-Rodriguez

机构 * Department of Mathematics and Statistics, York University, Toronto, Canada(数学与统计学系,约克大学,多伦多,加拿大)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 基于句子嵌入的核变化点检测实现无监督文本分段,结合理论保证与实际效果,提升文本分割性能。

Comments arXiv admin note: substantial text overlap with arXiv:2510.03437. substantial text overlap with arXiv:2510.03437. substantial text overlap with arXiv:2510.03437. substantial text overlap with arXiv:2510.03437

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12668 2026-01-27 cs.IR cs.CL 57%

Understanding Parametric Knowledge Injection in Retrieval-Augmented Generation

理解检索增强生成中的参数化知识注入

Minghao Tang, Shiyu Ni, Jingtong Wu, Zengxin Han, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) ICT, Chinese Academy of Sciences(中国科学院信息科技研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 本文研究了参数化RAG中的知识注入,发现结合传统和参数化方法(PT-RAG)在性能上最佳,同时揭示了其在知识冲突和鲁棒性方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16872 2026-01-27 cs.IR 50%

From Atom to Community: Structured and Evolving Agent Memory for User Behavior Modeling

从原子到社区:结构化和演化的代理记忆用于用户行为建模

Yuxin Liao, Le Wu, Min Hou, Yu Wang, Han Wu, Meng Wang

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 STEAM通过结构化和演化的代理记忆框架,提升用户行为建模的准确性与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏