arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-01 至 2026-01-01 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 12 篇

2512.23862 2026-01-01 cs.LG cs.AI cs.CL 88%

Probing the Limits of Compressive Memory: A Study of Infini-Attention in Small-Scale Pretraining

探测压缩记忆的极限:对Infini-Attention在小规模预训练中的研究

Ruizhe Huang, Kexuan Zhang, Yihao Fang, Baifeng Yu

机构 * Huawei Technologies Canada Co., Ltd(华为技术加拿大有限公司)

专题命中 长上下文与记忆 :pretraining(title,abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 本研究通过Infini-Attention在小规模预训练中提升SLMs的长上下文能力,验证了其在有限参数下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24969 2026-01-01 cond-mat.stat-mech cs.CL physics.bio-ph q-bio.NC 88%

Large language models and the entropy of English

大语言模型与英语的熵

Colin Scheibner, Lindsay M. Smith, William Bialek

机构 * Joseph Henry Laboratories of Physics(乔赛亚·亨利物理实验室) Princeton Center for Theoretical Science(普林斯顿理论科学中心) Lewis--Sigler Institute for Integrative Genomics(刘易斯-西格尔整合基因组学研究所) Princeton University(普林斯顿大学) Initiative for the Theoretical Sciences(理论科学倡议) The CUNY Graduate Center(纽约市立大学研究生中心)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过大语言模型揭示英语文本中长程结构的熵特性及依赖关系

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23836 2026-01-01 cs.CL cs.AI cs.LG 83%

Retrieval Augmented Question Answering: When Should LLMs Admit Ignorance?

检索增强型问答:当LLMs应承认无知时

Dingmin Wang, Ji Ma, Shankar Kumar

机构 * Google Research(谷歌研究) University of Oxford(牛津大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出了一种自适应提示策略,通过分割检索信息并逐步提示LLM回答问题,以提高问答性能并减少无关信息的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24077 2026-01-01 cs.AI 70%

LoongFlow: Directed Evolutionary Search via a Cognitive Plan-Execute-Summarize Paradigm

LoongFlow:通过认知计划-执行-总结范式实现定向进化搜索

Chunhui Wan, Xunan Dai, Zhuo Wang, Minglei Li, Yanpeng Wang, Yinan Mao, Yu Lan, Zhiwen Xiao

机构 * Baidu Inc(百度公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LoongFlow通过认知计划-执行-总结范式实现高效进化搜索,提升算法发现与流水线优化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23760 2026-01-01 cs.CR cs.AI 70%

Audited Skill-Graph Self-Improvement for Agentic LLMs via Verifiable Rewards, Experience Synthesis, and Continual Memory

通过可验证奖励、经验合成和持续记忆对代理LLM进行审计化技能图自改进

Ken Huang, Jerry Huang

机构 * OWASP Fairfax, VA, USA Kleiner Perkins

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ASG-SI框架,通过可验证奖励、经验合成和持续记忆实现代理LLM的审计化技能图自改进,以提升安全性和可追溯性。

Comments 11 pages, 4 figures. Includes a complete runnable reference implementation and audit logging framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10969 2026-01-01 cs.CV 67%

Bringing The Consistency Gap: Explicit Structured Memory for Interleaved Image-Text Generation

弥合一致性差距:用于交错图像-文本生成的显式结构化记忆

Zeteng Lin, Xingxing Li, Wen You, Xiaoyang Li, Zehan Lu, Yujun Cai, Jing Tang

机构 * Hong Kong University of Science and Technology(Guangzhou)(香港科技大学(广州)) University of Queensland(昆士兰大学)

专题命中 长上下文与记忆 :language model(abstract);prompting(abstract)

AI总结 IUT-Plug通过显式结构化记忆机制解决多模态生成中的上下文漂移问题,提升长序列一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23852 2026-01-01 cs.LG cs.CL 66%

Trellis: Learning to Compress Key-Value Memory in Attention Models

Trellis: 在注意力模型中学习压缩键值记忆

Mahdi Karami, Ali Behrouz, Praneeth Kacham, Vahab Mirrokni

机构 * Google Research(谷歌研究)

专题命中 长上下文与记忆 :language model(abstract,comments);分类 cs.CL、cs.LG

AI总结 Trellis通过动态压缩键值内存提升注意力模型的效率与长上下文处理能力

Comments In Second Conference on Language Modeling (COLM) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24695 2026-01-01 cs.LG cs.AI 62%

Nested Learning: The Illusion of Deep Learning Architectures

嵌套学习:深度学习架构的幻觉

Ali Behrouz, Meisam Razaviyayn, Peilin Zhong, Vahab Mirrokni

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出嵌套学习范式,通过多级优化问题设计更高效的学习算法,展示持续学习模块Hope在语言建模等任务中的表现。

Comments A version of this work is published at Neural Information Processing Systems (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24684 2026-01-01 cs.CL cs.AI 62%

R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory

R-Debater:通过论证记忆的检索增强辩论生成

Maoyuan Li, Zhongsheng Wang, Haoyuan Li, Jiamou Liu

机构 * Wuhan College of Communication(武汉通信学院) Wuhan College of Communication University of Auckland(武汉通信学院奥克兰大学) University of Auckland(奥克兰大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 R-Debater通过整合检索和结构化规划,实现了更忠实、一致且连贯的多轮辩论生成。

Comments Accepteed by AAMAS 2026 full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05646 2026-01-01 cs.LG cs.AI 62%

Lattice: Learning to Efficiently Compress the Memory

Lattice: 学习高效压缩内存

Mahdi Karami, Razvan Pascanu, Vahab Mirrokni

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 Lattice通过正交更新机制,高效压缩内存,提升语言建模和联想回忆任务的性能与内存效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23675 2026-01-01 cs.LG 57%

End-to-End Test-Time Training for Long Context

端到端的测试时间训练用于长上下文

Arnuv Tandon, Karan Dalal, Xinhao Li, Daniel Koceja, Marcel Rød, Sam Buchanan, Xiaolong Wang, Jure Leskovec, Sanmi Koyejo, Tatsunori Hashimoto, Carlos Guestrin, Jed McCaleb, Yejin Choi, Yu Sun

机构 * NVIDIA(NVIDIA公司) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) UC San Diego(圣地亚哥大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文提出了一种端到端的测试时间训练方法,通过在测试时进行token预测和训练时的元学习,实现长上下文处理,具有与完整注意力相同的扩展性但更高效的推理速度。

Comments Code: https://github.com/test-time-training/e2e

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24172 2026-01-01 cs.CV cs.LG 57%

Deep Global Clustering for Hyperspectral Image Segmentation: Concepts, Applications, and Open Challenges

超光谱图像分割的深度全局聚类:概念、应用与开放挑战

Yu-Tang Chang, Pin-Wei Chen, Shih-Fang Chen

机构 * Department of Biomechatronics Engineering(生物机电工程系) National Taiwan University(台湾国立大学)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 本文提出深度全局聚类框架,用于高效超光谱图像分割,通过局部块观测学习全局聚类结构,实现快速训练与稳定内存使用,同时在农业监测中展示出无监督疾病检测能力。

Comments 10 pages, 4 figures. Technical report extending ACPA 2025 conference paper. Code and data available at https://github.com/b05611038/HSI_global_clustering

详情

展开后加载摘要…

URL PDF HTML 收藏