arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-02 至 2026-02-02 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 12 篇

2601.19895 2026-02-02 cs.LG cs.CL 79%

Post-LayerNorm Is Back: Stable, ExpressivE, and Deep

Post-LayerNorm 是回潮:稳定、富有表现力且深

Chen Chen, Lai Wei

机构 * ByteDance Seed(字节跳动种子)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Keel通过采用Highway风格连接的Post-LN架构,在极端深度下实现稳定训练,提升LLM的表达能力和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22974 2026-02-02 cs.ET cs.CL 77%

MiTa: A Hierarchical Multi-Agent Collaboration Framework with Memory-integrated and Task Allocation

MiTa: 一种具有内存集成和任务分配的分层多智能体协作框架

XiaoJie Zhang, JianHan Wu, Xiaoyang Qu, Jianzong Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MiTa通过分层结构和内存整合提升多智能体协作效率,实现全局任务分配与片段记忆整合。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23188 2026-02-02 cs.CL 70%

Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience

受认知神经科学启发的深度搜索与分层元认知监控

Zhongxiang Sun, Qipeng Wang, Weijie Yu, Jingxuan Yang, Haolang Lu, Jun Xu

机构 * Gaoling School of Artificial Intelligence\ University of China Beijing China School of Information Technology Search Applications Department, Tencent Beijing China Beijing University of Posts Gaoling School of Artificial Intelligence\ University of China Search Applications Department, Tencent

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出DS-MCM框架,通过分层元认知监控机制提升深度搜索的性能和鲁棒性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22966 2026-02-02 cs.CL 70%

A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training

注意力与残差汇流的统一视角:异常驱动的重缩放对变换器训练至关重要

Zihan Qiu, Zeyu Huang, Kaiyue Wen, Peng Jin, Bo Zheng, Yuxin Zhou, Haofeng Huang, Zekun Wang, Xiao Li, Huaqing Zhang, Yang Xu, Haoran Lian, Siqi Zhang, Rui Men, Jianwei Zhang, Ivan Titov, Dayiheng Liu, Jingren Zhou, Junyang Lin

机构 * Qwen Team(Qwen团队) University of Edinburgh(爱丁堡大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出异常驱动重缩放对变换器训练的重要性,通过统一注意力与残差汇流的起源,展示了异常值在训练稳定性与性能提升中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22570 2026-02-02 cs.CV cs.LG 70%

Leveraging Data to Say No: Memory Augmented Plug-and-Play Selective Prediction

利用数据说不:基于记忆的插拔式选择预测

Aditya Sarkar, Yi Li, Jiacheng Cheng, Shlok Mishra, Nuno Vasconcelos

机构 * University of Maryland, College Park(马里兰大学) University of California, San Diego(加州大学圣地亚哥分校) Qualcomm AI(高通人工智能) Yale University(耶鲁大学) Meta AI

专题命中 长上下文与记忆 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出基于记忆的插拔式选择预测方法,通过增强视觉语言嵌入来减少方差并改进分数校准,提升图像描述、匹配和细粒度分类性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22528 2026-02-02 cs.AI 70%

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06776 2026-02-02 cs.CL cs.AI 62%

From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs

从单个token到单个block:一种为扩散语言模型设计的原理性适应路径

Yuchuan Tian, Yuchen Liang, Shuo Zhang, Yingte Shu, Guangwen Yang, Wei He, Sibo Fang, Tianyu Guo, Kai Han, Chao Xu, Hanting Chen, Xinghao Chen, Yunhe Wang

机构 * Peking University(北京大学) Huawei Technologies(华为技术)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种原理性适应路径,将自回归模型适配到扩散语言模型,以提升其长上下文生成能力,并在7B类模型中取得最佳性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02295 2026-02-02 cs.CV cs.AI cs.LG 62%

VideoNSA: Native Sparse Attention Scales Video Understanding

VideoNSA:原生稀疏注意力扩展视频理解

Enxin Song, Wenhao Chai, Shusheng Yang, Ethan Armand, Xiaojun Shan, Haiyang Xu, Jianwen Xie, Zhuowen Tu

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 VideoNSA通过端到端训练提升视频理解,结合原生稀疏注意力实现长视频和时间推理的性能优化

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23487 2026-02-02 cs.AI cs.FL 57%

Are Agents Probabilistic Automata? A Trace-Based, Memory-Constrained Theory of Agentic AI

智能体是概率自动机吗?基于轨迹的、内存受限的智能体AI理论

Roham Koohestani, Ziyou Li, Anton Podkopaev, Maliheh Izadi

机构 * JetBrains Research, Amsterdam, the Netherlands(JetBrains研究院,荷兰阿姆斯特丹) Delft University of Technology, Delft, the Netherlands(代尔夫特理工大学,荷兰代尔夫特) Constructor University, Bremen, Germany(Constructor大学,德国不来梅)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 本文提出了一种基于轨迹的、内存受限的智能体AI理论,通过自动机理论模型分析智能体与环境交互行为的概率分布,并探讨了不同内存限制下轨迹语言的可判定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22379 2026-02-02 cs.CL 57%

SPLA: Block Sparse Plus Linear Attention for Long Context Modeling

SPLA:块稀疏加线性注意力用于长上下文建模

Bailin Wang, Dan Friedman, Tao Lei, Chong Wang

机构 * apple(苹果公司)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.CL

AI总结 SPLA通过块稀疏加线性注意力框架,在长上下文建模中提升效率并保持性能,超越密集注意力模型。

Comments v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23211 2026-02-02 cs.MA 50%

Multi-Agent Systems Should be Treated as Principal-Agent Problems

多智能体系统应被视为委托-代理问题

Paulius Rauba, Simonas Cepenas, Mihaela van der Schaar

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出将多智能体系统视为委托-代理问题,探讨信息不对称和目标不一致对系统行为的影响,并通过谋略现象分析其缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22630 2026-02-02 cs.CV 50%

LINA: Linear Autoregressive Image Generative Models with Continuous Tokens

LINA: 基于连续令牌的线性自回归图像生成模型

Jiahao Wang, Ting Pan, Haoge Deng, Dongchen Han, Taiqiang Wu, Xinlong Wang, Ping Luo

机构 * The University of Hong Kong(香港大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 LINA是一种基于线性注意力的高效文本到图像生成模型,通过改进归一化和门控机制,在计算效率和生成质量上取得平衡。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏