arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-14 至 2026-01-14 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 11 篇

2601.08829 2026-01-14 cs.CL cs.AI 86%

Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System

在Elo排名评审系统中建模LLM代理评审动态

Hsiang-Wei Huang, Junbin Lu, Kuang-Ming Chen, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在Elo排名评审系统中,通过整合Elo评分和评审者记忆提升领域主席决策准确性的LLM代理评审动态。

Comments In submission. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08739 2026-01-14 cs.CL 85%

PrivGemo: Privacy-Preserving Dual-Tower Graph Retrieval for Empowering LLM Reasoning with Memory Augmentation

PrivGemo: 保护隐私的双塔图检索用于增强LLM推理的记忆增强

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Data61, CSIRO(Data61,CSIRO)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PrivGemo通过双塔设计和隐私保护机制,实现隐私保护的图检索增强推理,提升LLM在知识密集型任务中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08215 2026-01-14 cs.CL cs.LG 81%

Towards Principled Design of Mixture-of-Experts Language Models under Memory and Inference Constraints

面向内存和推理约束下混合专家语言模型的原理性设计

Seng Pei Liew, Kenta Shinzato, Yuyang Dong

机构 * SB Intuitions

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于内存和推理约束的混合专家语言模型设计原则,通过系统研究揭示性能主要由总参数和专家稀疏性决定,并提出优化方法指导架构设计。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08343 2026-01-14 cs.MA cs.CL 79%

When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM Judges

当KV缓存复用在多智能体系统中失效:跨候选者交互对LLM判断者至关重要

Sichu Liang, Zhenglin Wang, Jiajia Chu, Pengfei Xia, Hui Zang, Deyu Zhou

机构 * Southeast University(东南大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL

AI总结 本研究揭示了在多智能体系统中KV缓存复用的失效模式,指出跨候选者交互对LLM判断者的重要性,强调了以判断者为中心的推理需要专门设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15291 2026-01-14 cs.CL 77%

Hallucinate at the Last in Long Response Generation: A Case Study on Long Document Summarization

在长响应生成中最后 hallucinate:长文档摘要的案例研究

Joonho Yang, Seunghyun Yoon, Hwan Chang, Byeongjeong Kim, Hwanhee Lee

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Adobe Research, USA(Adobe 研究,美国)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在长响应生成中幻觉集中在后部的现象,并提出方法以提高长输出结尾的忠实性。

Comments 26 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08079 2026-01-14 cs.AI cs.CL cs.IR 73%

MemoBrain: Executive Memory as an Agentic Brain for Reasoning

MemoBrain: 作为推理代理的执行记忆脑

Hongjin Qian, Zhao Cao, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MemoBrain通过构建依赖感知的记忆模型,实现对长周期推理轨迹的显式认知控制,提升工具增强代理的推理连贯性和任务对齐性。

Comments Our codes are in https://github.com/qhjqhj00/MemoBrain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13564 2026-01-14 cs.CL cs.AI 73%

Memory in the Age of AI Agents

人工智能代理时代的记忆

Yuyang Hu, Shichun Liu, Yanwei Yue, Guibin Zhang, Boyang Liu, Fangyi Zhu, Jiahang Lin, Honglin Guo, Shihan Dou, Zhiheng Xi, Senjie Jin, Jiejun Tan, Yanbin Yin, Jiongnan Liu, Zeyu Zhang, Zhongxiang Sun, Yutao Zhu, Hao Sun, Boci Peng, Zhenrong Cheng, Xuanbo Fan, Jiaxin Guo, Xinlei Yu, Zhenhong Zhou, Zewen Hu, Jiahao Huo, Junhao Wang, Yuwei Niu, Yu Wang, Zhenfei Yin, Xiaobin Hu, Yue Liao, Qiankun Li, Kun Wang, Wangchunshu Zhou, Yixin Liu, Dawei Cheng, Qi Zhang, Tao Gui, Shirui Pan, Yan Zhang, Philip Torr, Zhicheng Dou, Ji-Rong Wen, Xuanjing Huang, Yu-Gang Jiang, Shuicheng Yan

机构 * Core Supervisors. 0.5em Affiliations: National University of Singapore, Renmin University of China, Fudan University, Peking University, Nanyang Technological University, Tongji University, University of California San Diego, Hong Kong University of Science Technology (Guangzhou), Griffith University, Georgia Institute of Technology, OPPO, Oxford University

专题命中 长上下文与记忆 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统梳理了人工智能代理记忆的现状与分类,提出了记忆的三种形式、功能分类及动态分析,为未来智能设计提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08435 2026-01-14 cs.CL 70%

Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management

细粒度反馈对齐的长期记忆管理:Fine-Mem

Weitao Ma, Xiaocheng Feng, Lei Huang, Xiachong Feng, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Meituan(美团) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Fine-Mem通过细粒度反馈对齐提升长周期内存管理,通过块级奖励和证据锚定奖励分配优化策略,实现更高效的内存操作与长期效用对齐。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08743 2026-01-14 cs.CL cs.AI 62%

TableCache: Primary Foreign Key Guided KV Cache Precomputation for Low Latency Text-to-SQL

TableCache: 基于主外键关系的KV缓存预计算用于低延迟的文本到SQL

Jinbo Su, Yuxuan Hu, Cuiping Li, Hong Chen, Jia Li, Lintao Ma, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Key Laboratory of Data Engineering and Knowledge Engineering, Beijing, China(数据工程与知识工程重点实验室) Engineering Research Center of Database and Business Intelligence, Beijing, China(数据库与商业智能工程研究中心) Ant Group, Hangzhou, China(蚂蚁集团)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 TableCache通过预计算主外键关系的KV缓存,提高文本到SQL任务的低延迟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25026 2026-01-14 cs.CL cs.AI 62%

Modeling Language as a Sequence of Thoughts

将语言建模为思想序列

Nasim Borazjanizadeh, James McClelland

机构 * Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 TG模型通过递归变换器在token和句子级抽象建模语言,提升数据和参数效率,减少关系方向泛化错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06309 2026-01-14 cs.LG cs.AR math.OC 57%

Analog In-memory Training on General Non-ideal Resistive Elements: The Impact of Response Functions

基于通用非理想电阻元件的类比内存训练:响应函数的影响

Zhaoxian Wu, Quan Xiao, Tayfun Gokmen, Omobayode Fagbohungbe, Tianyi Chen

机构 * Cornell University(康奈尔大学) IBM T. J. Watson Research Center(IBM T.J.沃森研究中⼼) Rensselaer Polytechnic Institute(拉特盖尔理工学院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文研究了非理想响应函数对类比内存计算训练动态的影响,提出残差学习算法以解决非对称响应函数带来的问题,并通过模拟验证了理论成果。

详情

展开后加载摘要…

URL PDF HTML 收藏