arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-13 至 2026-02-13 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 9 篇

2602.12108 2026-02-13 cs.AI 83%

The Pensieve Paradigm: Stateful Language Models Mastering Their Own Context

Pensieve范式:具备状态的语言模型掌握自身上下文

Xiaoyuan Liu, Tian Liang, Dongyang Ma, Deyu Zhou, Haitao Mi, Pinjia He, Yan Wang

机构 * Tencent AI Lab(腾讯人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 长上下文与记忆 :language model(title);LLM(abstract);foundation model(abstract);分类 cs.AI

AI总结 StateLM 通过内部推理循环和记忆工具,使语言模型具备状态管理能力,从而在长文档问答、聊天记忆和深度研究任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11598 2026-02-13 cs.RO cs.AI cs.CV 83%

ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

ABot-N0:关于VLA基础模型在多功能具身导航中的技术报告

Zedong Chu, Shichao Xie, Xiaolong Wu, Yanfen Shen, Minghua Luo, Zhengbo Wang, Fei Liu, Xiaoxu Leng, Junjun Hu, Mingyang Yin, Jia Lu, Yingnan Guo, Kai Yang, Jiawei Han, Xu Chen, Yanqing Zhu, Yuxiang Zhao, Xin Liu, Yirong Yang, Ye He, Jiahang Wang, Yang Cai, Tianlin Zhang, Li Gao, Liu Liu, Mingchao Sun, Fan Jiang, Chiyu Wang, Zhicheng Liu, Hongyu Pan, Honglin Han, Zhining Gu, Kuan Yang, Jianfang Zhang, Di Jing, Zihao Guan, Wei Guo, Guoqing Liu, Di Yang, Xiangpo Yang, Menglin Yang, Hongguang Xing, Weiguo Li, Mu Xu

专题命中 长上下文与记忆 :foundation model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 ABot-N0通过统一的VLA基础模型实现多功能具身导航,结合认知大脑与动作专家架构,在多个基准测试中超越专用模型,支持动态环境中的长周期任务。

Comments Project Page: https://amap-cvlab.github.io/ABot-Navigation/ABot-N0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11607 2026-02-13 cs.CL 77%

Scene-Aware Memory Discrimination: Deciding Which Personal Knowledge Stays

场景感知的记忆辨别:决定哪些个人知识应被保留

Yijie Zhong, Mengying Guo, Zewei Wang, Zhongyang Li, Dandan Tu, Haofen Wang

机构 * College of Design and Innovation, Tongji University(同济大学设计与创新学院) Huawei Technologies Co. Ltd.(华为技术有限公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出了一种场景感知的记忆辨别方法,通过门控单元和聚类提示模块提升记忆处理效率与准确性,有效组织个人知识。

Comments Accepted by Knowledge-Based Systems. Lincense: CC BY-NC-ND

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12278 2026-02-13 cs.IR cs.AI 70%

AttentionRetriever: Attention Layers are Secretly Long Document Retrievers

AttentionRetriever: 注意力层其实是秘密的长文档检索器

David Jiahao Fu, Lam Thanh Do, Jiayu Li, Kevin Chen-Chuan Chang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AttentionRetriever通过结合注意力机制和实体检索,实现高效长文档检索,优于现有方法并保持高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07348 2026-02-13 cs.CL cs.AI cs.NE 62%

Controlled Self-Evolution for Algorithmic Code Optimization

算法代码优化的受控自演进

Tu Hu, Ronghao Chen, Shuo Zhang, Jianghao Yin, Mou Xiao Feng, Jingping Liu, Shaolei Zhang, Wenqi Jiang, Yuqi Fang, Sen Hu, Huacan Wang, Yi Xu

机构 * NJU(南京大学) PKU(北京大学) Midea-AIRC(美的人工智能研究院) ECNU(华东师范大学) SYSU(南方科技大学) RUC(中国人民大学) QuantaAlpha(量子Alpha) QuantML(量子机器学习)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 受控自演进通过改进初始化、反馈引导和经验记忆,提升算法代码优化的效率和效果。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11185 2026-02-13 cs.LG cs.AI 62%

Spectra: Rethinking Optimizers for LLMs Under Spectral Anisotropy

Spectra: 重新思考在谱各向异性下大语言模型的优化器

Zhendong Huang, Hengjie Cao, Fang Dong, Ruijun Huang, Mengyi Chen, Yifeng Yang, Xin Zhang, Anrui Chen, Mingzhi Dong, Yujiang Wang, Jinlong Hou, Qin Lv, Robert P. Dick, Yuan Cheng, Fan Yang, Tun Lu, Li Shang

机构 * Fudan University, Shanghai, China(复旦大学) University of Bath, Bath, United Kingdom(巴斯大学) Oxford Suzhou Centre for Advanced Research, Suzhou, China(牛津苏格兰先进研究中心) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Department of Computer Science, University of Colorado Boulder, Colorado, USA(计算机科学系,科罗拉多大学博尔德分校) Department of Electrical Engineering and Computer Science, University of Michigan(电气工程与计算机科学系,密歇根大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Spectra通过抑制主导低秩尖峰子空间并减少优化器状态内存,提升了大语言模型的训练效率和下游准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11808 2026-02-13 cs.LG 57%

Deep Kernel Fusion for Transformers

基于变压器的深度核融合

Zixi Zhang, Zhiwen Mo, Yiren Zhao, Robert Mullins

机构 * Imperial College London(帝国理工学院伦敦分校) University of Cambridge(剑桥大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.LG

AI总结 本研究提出DeepFusionKernel,通过深度融合内核减少HBM流量并提高缓存复用,实现大语言模型在长上下文推理中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17311 2026-02-13 cs.AI 57%

Phase Transition for Budgeted Multi-Agent Synergy

预算多智能体协同的相变

Bang Liu, Linglong Kong, Jian Pei

机构 * Department of Computer Science and Operations Research Université de Montréal & Mila - Quebec AI Institute(计算机科学与运筹学系,蒙特利尔大学及魁北克人工智能研究所) Department of Mathematical & Statistical Science University of Alberta(数学与统计学系,阿尔伯塔大学) Department of Computer Science Duke University(计算机科学系,杜克大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 该研究提出了一种理论,通过分析上下文窗口、通信损失和共享失败等约束,揭示了预算多智能体系统在不同相变状态下的表现,并给出了计算分配规则和预算阈值。

Comments 55 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11622 2026-02-13 cs.IR 50%

Evolutionary Router Feature Generation for Zero-Shot Graph Anomaly Detection with Mixture-of-Experts

进化路由器特征生成用于混合专家的零样本图异常检测

Haiyang Jiang, Tong Chen, Xinyi Gao, Guansong Pang, Quoc Viet Hung Nguyen, Hongzhi Yin

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出EvoFG框架,通过进化特征生成和增强记忆路由器,解决零样本图异常检测中的分布偏移问题,提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏