arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-13 至 2026-01-13 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 21 篇

2506.07334 2026-01-13 cs.LG 89%

Graph-KV: Breaking Sequence via Injecting Structural Biases into Large Language Models

Graph-KV: 通过向大语言模型注入结构偏差打破序列

Haoyu Wang, Peihao Wang, Mufei Li, Shikun Liu, Siqi Miao, Zhangyang Wang, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 Graph-KV通过引入结构偏差打破序列限制,提升大语言模型在图结构任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03356 2026-01-13 cs.CR 89%

From static to adaptive: immune memory-based jailbreak detection for large language models

从静态到适应性:基于免疫记忆的大型语言模型 jailbreak 检测

Jun Leng, Yu Liu, Litian Zhang, Ruihan Hu, Zhuting Fang, Xi Zhang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 基于免疫记忆的框架,通过动态记忆更新和主动免疫机制,提升大型语言模型对 jailbreak 攻击的检测准确率至 94%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07403 2026-01-13 cs.CL 88%

LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction

LongEmotion: 测量大语言模型在长上下文交互中的情感智能

Weichu Liu, Jing Xiong, Yuxuan Hu, Zixuan Li, Minghuan Tan, Ningning Mao, Hui Shen, Wendong Xu, Chaofan Tao, Min Yang, Chengming Li, Lingpeng Kong, Ngai Wong

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) The University of Hong Kong(香港大学) City University of Hong Kong(香港城市大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Beijing Normal University(北京师范大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LongEmotion是一个评估大语言模型在长上下文交互中情感智能的基准,通过多任务和协作框架提升模型在情绪识别与共情生成中的表现。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04566 2026-01-13 cs.AI cs.CL 86%

BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents

BackdoorAgent: 一个统一框架用于针对基于LLM的代理的后门攻击

Yunhao Feng, Yige Li, Yutao Wu, Yingshui Tan, Yanming Guo, Yifan Ding, Kun Zhai, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Singapore Management University(新加坡管理大学) Alibaba Group(阿里巴巴集团) Deakin University(德肯大学) Hunan Institute of Advanced Technology(湖南高级技术研究所)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BackdoorAgent提出一个统一框架,分析LLM代理中后门攻击的跨阶段传播和触发器持续性,揭示代理工作流的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07468 2026-01-13 cs.AI 85%

Beyond Dialogue Time: Temporal Semantic Memory for Personalized LLM Agents

超越对话时间:面向个性化LLM代理的时序语义记忆

Miao Su, Yucan Guo, Zhongni Hou, Long Bai, Zixuan Li, Yufei Zhang, Guojun Yin, Wei Lin, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) State Key Laboratory of AI Safety(人工智能安全国家重点实验室) School of Computer Science, University of Chinese Academy of Sciences(中国科学院大学计算机科学学院)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TSM,一种面向个性化LLM代理的时序语义记忆框架,通过建模语义时间和持续记忆,提升对话任务的准确性和持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21144 2026-01-13 cs.AI 85%

NeuroGenPoisoning: Neuron-Guided Attacks on Retrieval-Augmented Generation of LLM via Genetic Optimization of External Knowledge

NeuroGenPoisoning: 通过神经引导对抗LLM检索增强生成中的外部知识注入

Hanyu Zhu, Lance Fiondella, Jiawei Yuan, Kai Zeng, Long Jiao

机构 * University of Massachusetts Dartmouth(马萨诸塞大学达特茅斯分校) George Mason University(乔治·梅森大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NeuroGenPoisoning通过神经引导和遗传优化生成对抗性外部知识,有效解决RAG中的知识冲突并提高污染成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08997 2026-01-13 cs.AI 85%

Intrinsic Memory Agents: Heterogeneous Multi-Agent LLM Systems through Structured Contextual Memory

内在记忆代理:通过结构化上下文记忆实现异构多代理LLM系统

Sizhe Yuen, Francisco Gomez Medina, Ting Su, Yali Du, Adam J. Sobey

机构 * The Alan Turing Institute(艾伦·图灵研究所) King’s College London(伦敦大学国王学院) University of Southampton(南安普顿大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出内在记忆代理,通过结构化上下文记忆提升多代理LLM系统在复杂任务中的表现,展现更高的设计质量和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05504 2026-01-13 cs.CR cs.MA 85%

Memory Poisoning Attack and Defense on Memory Based LLM-Agents

基于内存的LLM代理中的内存污染攻击与防御

Balachandra Devarangadi Sunil, Isheeta Sinha, Piyush Maheshwari, Shantanu Todmal, Shreyan Mallik, Shuchi Mishra

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了基于内存的LLM代理中的内存污染攻击与防御,通过实验发现预存合法记忆可显著降低攻击效果,并提出两种新的防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07470 2026-01-13 cs.AI 81%

Learning How to Remember: A Meta-Cognitive Management Method for Structured and Transferable Agent Memory

学习如何记忆:一种用于结构化和可迁移智能体记忆的元认知管理方法

Sirui Liang, Pengfei Cao, Jian Zhao, Wenhao Teng, Xiangwen Liao, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所) Department of Gastrointestinal Surgery, Fujian Provincial Cancer Hospital(福建省癌症医院胃肠外科) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出MCMA方法,通过学习记忆抽象技能提升智能体在长期任务中的记忆管理和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06973 2026-01-13 cs.CL 79%

LLMs Can't Play Hangman: On the Necessity of a Private Working Memory for Language Agents

LLMs无法玩井字游戏:关于语言代理所需私人工作记忆的必要性

Davide Baldelli, Ali Parviz, Amal Zouaq, Sarath Chandar

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔大学) University of California, San Diego(加州大学圣地亚哥分校) LAMA-WeST Lab(LAMA-WeST实验室) Chandar Research Lab(Chandar研究实验室)

专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.CL

AI总结 本文提出私人状态交互任务(PSITs)并证明标准LLMs无法在交互任务中保持秘密和一致性,提出包含显式私人工作记忆的架构以恢复一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03989 2026-01-13 cs.CL 79%

Stronger Baselines for Retrieval-Augmented Generation with Long-Context Language Models

更强的检索增强生成基线:长上下文语言模型

Alex Laitenberger, Christopher D. Manning, Nelson F. Liu

机构 * Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL

AI总结 本文提出DOS RAG作为长上下文问答任务的强基线,通过保持文档结构和简单性,在多个基准上超越复杂方法。

Comments 11 pages, 6 figures, for associated source code, see https://github.com/alex-laitenberger/stronger-baselines-rag

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 32559-32569

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06377 2026-01-13 cs.AI 79%

HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents

HiMem:用于长时间跨度代理的分层长时记忆

Ningning Zhang, Xingxing Yang, Zhizhong Tan, Weiping Deng, Wenyong Wang

机构 * Macau University of Science and Technology(澳门科学理工大學)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 HiMem通过分层长时记忆框架提升长跨度对话代理的适应性和自我进化能力,采用双通道分割和多阶段信息提取实现高效且保真的记忆管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06115 2026-01-13 cs.AI 79%

Dreaming Is Not a Bug: A Jung-Inspired Dream Layer for Multi-Agent LLM Companions

梦境并非bug:一种基于荣格思想的多智能体LLM伴侣的梦境层

V. Cheung

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种基于荣格思想的梦境层,通过离线生成梦境叙事来增强多智能体LLM伴侣的学习与关系建立能力,将幻觉转化为资源而非bug。

Comments Preprint, 35 pages (5 pages of appendix), 2 figures, 3 tables. Conceptual and architectural proposal with preliminary simulation results

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06152 2026-01-13 cs.AI 77%

HiMeS: Hippocampus-inspired Memory System for Personalized AI Assistants

HiMeS:基于海马体的记忆系统用于个性化AI助手

Hailong Li, Feifei Li, Wenhui Que, Xingyu Fan

机构 * Tencent Inc.(腾讯公司)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HiMeS通过融合短期和长期记忆机制,提升个性化AI助手在知识密集型场景中的问答质量与用户定制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06966 2026-01-13 cs.CL cs.AI 73%

RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction

RealMem: 在真实世界中评估大语言模型的内存驱动交互

Haonan Bian, Zhiyuan Yao, Sen Hu, Zishan Xu, Shaolei Zhang, Yifu Guo, Ziliang Yang, Xueran Han, Huacan Wang, Ronghao Chen

机构 * Xidian University(西安电子科技大学) Zhejiang University(浙江大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Sun Yat-sen University(中山大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RealMem是一个基于真实项目场景的基准,评估大语言模型在长期项目导向交互中的记忆管理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14086 2026-01-13 cs.CV cs.AI cs.LG 73%

Seg-LSTM: Performance of xLSTM for Semantic Segmentation of Remotely Sensed Images

Seg-LSTM:xLSTM在遥感图像语义分割中的性能

Qinfeng Zhu, Yuanzhi Cai, Lei Fan

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Seg-LSTM首次评估了xLSTM在遥感图像语义分割中的性能,发现其表现逊于基于Transformer和Mamba的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06842 2026-01-13 cs.AI 70%

Seeing through the Conflict: Transparent Knowledge Conflict Handling in Retrieval-Augmented Generation

通过冲突看见:在检索增强生成中实现透明的知识冲突处理

Hua Ye, Siyuan Chen, Ziqi Zhong, Canran Xiao, Haoliang Zhang, Yuhan Wu, Fei Shen

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TCR通过透明冲突解决框架提升检索增强生成中的冲突检测与知识恢复能力,减少误导性上下文影响。

Comments 9 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06562 2026-01-13 cs.LG 70%

Mosaic: Unlocking Long-Context Inference for Diffusion LLMs via Global Memory Planning and Dynamic Peak Taming

Mosaic: 通过全局内存规划和动态峰值镇压解锁扩散语言模型的长上下文推理

Liang Zheng, Bowen Shi, Yitao Hu, Jiawei Zhang, Ruofan Li, Sheng Chen, Wenxin Li, Keqiu Li

机构 * Tianjin University, China(天津大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Mosaic通过全局内存规划和动态峰值镇压,提升扩散语言模型的长上下文推理能力,实现内存效率和推理长度的显著提升。

Comments 11 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23010 2026-01-13 cs.SE 67%

TALM: Dynamic Tree-Structured Multi-Agent Framework with Long-Term Memory for Scalable Code Generation

TALM:具有长期记忆的动态树结构多智能体框架用于可扩展的代码生成

Ming-Tung Shen, Yuh-Jzer Joung

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 TALM通过动态树结构多智能体框架结合长期记忆机制,提升复杂代码生成任务中的推理性能和令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06425 2026-01-13 cs.CL cs.AI cs.LG 67%

Tensor Product Attention Is All You Need

张量积注意力是所有你所需要的

Yifan Zhang, Yifeng Liu, Huizhuo Yuan, Zhen Qin, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

机构 * IIIS, Tsinghua University(清华大学信息科学技术学院) Shanghai Qi Zhi Institute(上海启智研究院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TPA通过张量分解实现高效注意力机制,T6模型在语言建模任务中超越传统基线,提升性能与内存效率。

Comments Published in NeurIPS 2025 (Spotlight); Project Page: https://github.com/tensorgi/TPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07779 2026-01-13 cs.MA cs.AI cs.CL cs.CV cs.HC 62%

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架

Bowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu, Qiushi Sun, Zehao Li, JingJing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Qingyun Li, Yian Wang, Yu Qiao, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) CUHK MMLab(香港中文大学MMLab) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。

Comments 31 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏