Auditing Provenance Sensitivity in LLM Agent Action Selection
审计大语言模型智能体动作选择中的溯源敏感性
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 研究大语言模型智能体动作选择中的溯源敏感性,引入针对特定目标的授权审计,通过改变命题源权威等测试行为,发现可信和不可信变体在部分案例中产生不同动作,模型对线索有反应但不可信证据仍影响行动。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
审计大语言模型智能体动作选择中的溯源敏感性
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 研究大语言模型智能体动作选择中的溯源敏感性,引入针对特定目标的授权审计,通过改变命题源权威等测试行为,发现可信和不可信变体在部分案例中产生不同动作,模型对线索有反应但不可信证据仍影响行动。
用于大语言模型智能体的概要图内存:通过叙事概要进行隐式跨实体遍历
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 研究针对大语言模型智能体长期记忆中多跳关联未被充分测量的问题,提出了MemHop基准和ProGraph两层内存架构,通过概要扩展与压缩残差实现跨实体遍历,提升了多跳推理及精确召回能力,在多个基准测试中表现优异并开源相关实现。
Comments 11 pages, 2 figures, 7 tables. Code and MemHop benchmark: https://github.com/ShengtongZhu/ProGraph
AgentBrew:从强大教师到弱小语言模型智能体的终身知识酿造
机构 * The University of Hong Kong(香港大学)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 研究语言模型智能体知识酿造问题,提出AgentBrew方法,含失败触发教师和学生感知合成两个组件,无需训练,能将教师交互经验提炼到学生外部记忆,经实验验证可产生强大且可部署的智能体。
从记忆到技能:基于证据的长期大语言模型智能体协同进化治理
机构 * University of Science and Technology of China(中国科学技术大学) ; Hong Kong Polytechnic University(香港理工大学) ; Fuzhou University(福州大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL
AI总结 针对长期大语言模型智能体记忆系统问题,提出无需训练的MSCE框架,将经验组织为多种形式,把证据支持的策略转化为可调用技能,引入反射加权值回填,实验证明其性能优于基线,有跨域转移性和终身进化能力。
Comments Submitted into EMNLP'2026
隔离作为大语言模型智能体系统安全的头等原则:概念、分类法、挑战及未来方向
机构 * HKUST(香港科技大学) ; NYU(纽约大学) ; SWUPL(西南政法大学)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 探讨大语言模型智能体系统安全问题,将隔离作为头等原则,用边界中心分类法组织文献,助于识别隔离丧失位置、妥协传播方式及相关防御,还总结了故障路径,讨论挑战并勾勒研究议程。
PM-Bench:评估大语言模型智能体中的前瞻记忆
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 研究针对智能体人工智能中的前瞻记忆挑战,引入PM-Bench基准,受认知科学启发评估大语言模型智能体相关能力。在模拟一周内比较八个先进模型,发现各模型在此基准测试中均具挑战性,且无单一改善策略占优,还发布该基准用于诊断与干预。
Comments Published as a conference paper at COLM 2026
用于智能语言模型系统的共享选择性持久内存
机构 * Apple Inc.(苹果公司)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 智能语言模型系统面临上下文问题,本文提出共享选择性持久内存架构,识别保留四类可重用上下文,丢弃特定会话推理痕迹,实现共享协作重用。在企业场景和公共数据集实验中验证其有效性,提高任务完成率,降低成本,优于全历史持久化等极端方式。
Comments 11 pages, 2 figures, 4 tables
FreqDepthKV:用于长上下文语言模型推理中稳健的键值缓存压缩的频率引导深度共享
机构 * Instituto de Investigación en Visión Artificial(人工视觉研究所)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 研究针对长上下文语言模型推理中键值缓存成本问题,提出FreqDepthKV方法,将相邻层键值状态分解,通过在线探测器分配缓存模式,在多基准测试中保持任务准确性,提升解码吞吐量并降低内存,实现高效压缩。
Comments 11 pages, 2 figures
品牌即记忆:视觉语言模型为新闻来源编码因果性、可机制定位的可信度先验
机构 * University of New South Wales(新南威尔士大学)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI
AI总结 研究视觉语言模型中基于媒体身份的来源可信度先验,通过交叉模型基准测试和机制分析,揭示其特性及影响,如模型和规模依赖性、因果形成机制等。
过去即序幕:面向顺序演化的大语言模型记忆的选择性更新插件控制器
机构 * University of Virginia(弗吉尼亚大学) ; Princeton University(普林斯顿大学) ; University of Central Florida(中佛罗里达大学)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 提出Janus插件控制器,通过记忆动量触发器检测异常并基于紧凑混合评估集决定是否接受记忆更新,避免有害覆盖,在六个数据集上提升准确率2.7-4.6点。
ComMem:视觉语言模型测试时自适应的互补记忆系统
机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(生命科学学院,IDG/麦克戈文脑科学研究院,清华大学,北京,中国) ; Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所,北京,中国) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) ; Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,中国)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI
AI总结 提出受生物互补记忆系统启发的ComMem方法,通过快速适应细节记忆和慢速整合抽象记忆协同工作,实现视觉语言模型在测试时的跨模态一致自适应,在15个基准数据集上显著优于现有方法。
Comments A brain-inspired complementary memory framework leveraging fast visual caching and slow textual refinement for VLM test-time adaptation
AI Tokenomics:基础模型中的代币、计算与定价经济学
机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院)
专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI
AI总结 本文提出AI代币经济学框架,研究代币在AI系统中的生成、消耗、定价、分配与优化,揭示代币支出与经济价值的区别,并指出开放研究方向。
学习记住什么:通过约束优化实现长时域语言代理的观测安全记忆保留
机构 * Huawei Noah's Ark Lab(华为诺亚方舟实验室) ; Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)
专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.AI
AI总结 针对长时域语言代理的有限上下文窗口,提出OSL-MR框架,将记忆保留建模为约束随机优化问题,通过在线可观测特征与离线监督的严格分离学习查询条件化的证据价值,实验表明在严格预算下优于现有方法。
通过增强负采样提升知识图谱基础模型
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI
AI总结 提出自适应负采样方法KMAS,通过动态调整困难负三元组比例,增强知识图谱基础模型在零样本补全任务中的性能。
CoBit: 基于比特流扩散的语言建模
机构 * University of Cambridge(剑桥大学)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL
AI总结 提出CoBit模型,将文本建模为固定宽度二进制比特流上的连续扩散过程,采用匹配滤波残差参数化和基于熵率门控的朗之万校正采样器,在LM1B和OpenWebText上达到接近自回归模型的生成困惑度,并消除词汇表缩放瓶颈。
Express 语言建模
机构 * Cornell Tech(康奈尔科技) ; University of Cambridge(剑桥大学) ; Microsoft Research(微软研究院)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.LG
AI总结 提出 Express 工具,将非因果注意力近似转换为因果近似,结合 Thinformer 实现最优因果注意力保证,并加速语言建模中的四个资源瓶颈。
长上下文与检索增强语言模型中证据利用的四条件诊断协议
机构 * University of Western Ontario(西方大学)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL
AI总结 提出四条件证据可用性协议,通过ONCU估计器分离无证据、全上下文、检索证据和Oracle证据四种条件下的模型表现,诊断长上下文与检索增强语言模型的证据利用瓶颈。
Comments 46 pages, 37 tables, 1 figure
AdaMEM:语言代理的测试时自适应记忆
机构 * Yunxiang Zhang(张 Yunxiang) ; Yiheng Li(李 Yiheng) ; Ali Payani(Payani Ali) ; Lu Wang(王 Lu)
专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.AI
AI总结 提出AdaMEM框架,通过混合记忆架构(长期轨迹记忆+动态短期策略记忆)实现测试时自适应,无需在线更新参数,在ALFWorld、WebShop等任务上显著优于静态记忆基线。
Comments ICML 2026
超几何与证据优先专家用于大型视觉-语言模型
机构 * China University of Petroleum (Beijing)(中国石油大学(北京)) ; Hainan Institute of China University of Petroleum (Beijing)(中国石油大学(北京)海南学院) ; South China Normal University(华南师范大学)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI
AI总结 针对大型视觉-语言模型中视觉与语言模态的不对称性,提出AsyMoE架构,通过超几何跨模态专家和证据优先语言专家分别建模层级关系与保持上下文基础,在减少参数的同时提升性能。
ChronoVAE-HOPE:超越注意力——面向专业时间序列分类的下一代VAE基础模型
机构 * Department of Computer Science and Artificial Intelligence(计算机科学与人工智能系) ; DiCITS ; iMUDS ; DaSCI ; University of Granada(格拉纳达大学) ; Advanced Medical Imaging Group(先进医学成像组) ; Instituto de Investigación Biosanitaria de Granada(格拉纳达生物医学研究 institute) ; Department of Software Engineering(软件工程系) ; Department of Rural Engineering(农村工程系) ; University of Córdoba(科尔多瓦大学)
专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.LG
AI总结 提出ChronoVAE-HOPE,一种基于VAE和HOPE块(含Titans模块和连续记忆系统)的下一代时间序列基础模型,通过解耦潜在空间分离趋势与季节成分,在UCR基准分类任务上表现优异。
ArborKV: 一种面向树状推理的KV缓存管理方法
机构 * University of Science(科学大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 本文提出ArborKV,一种结构感知的KV缓存管理方法,通过轻量级值估计器和树状分配策略,实现纯token提取式淘汰与惰性再水合,从而在保持高精度的同时减少KV内存使用,使在固定硬件预算下能支持更大规模的树状推理搜索。
Memory Grafting: 通过离线条件记忆实现语言模型预训练的扩展
机构 * Tsinghua University(清华大学)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL
AI总结 本文提出Memory Grafting方法,通过利用冻结的隐藏状态作为条件n-gram记忆,实现语言模型预训练的扩展,通过离线处理和高效检索机制提升模型容量,实验表明其在不同规模下均优于MoE和Vanilla Engram基线。
Comments 25 pages, 12 figures, 5 tables
Auto-Dreamer:学习离线记忆巩固用于语言智能体
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California San Diego(加州大学圣地亚哥分校)
专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.CL
AI总结 本文提出Auto-Dreamer,一种学习离线记忆巩固方法,用于语言智能体,通过分离快速会话记忆获取与慢速跨会话巩固过程,提升智能体在多个任务流中的记忆整合与知识复用能力。
Comments Preprint
基于技能的视觉地理定位用于视觉-语言模型
机构 * Southwest Jiaotong University(西南交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Zhejiang University(浙江大学)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI
AI总结 本文提出GeoSkill框架,通过技能图进化提升视觉语言模型的地理定位能力与自我进化能力,实验显示其在GeoRC任务中表现优异,且在外部数据集上具有良好的泛化能力。
回声放大知识:通过情感向量再注入在语言模型中引入躯体标记类比
机构 * CapSen Robotics with ∮ \oint (Stokes)(CapSen机器人公司)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI
AI总结 本文通过情感向量再注入技术,探讨语言模型中情感与知识的关系,验证了情感反馈对决策的影响,复现了Damasio的核心发现。
具有协变量信息的时间序列基础模型可解释性负荷预测
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.LG
AI总结 本文提出一种高效计算SHAP的方法,用于增强时间序列基础模型的透明度,通过在负荷预测任务中评估两种TSFMs,展示其在电力系统中的可靠性与可解释性。
一种双任务范式用于研究语言模型中的句子理解策略
机构 * Tohoku University(东大大学) ; National Institute of Informatics(国家信息研究所) ; The University of Tokyo(东京大学)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL
AI总结 本文提出双任务范式,结合算术计算与句子理解任务,揭示语言模型在资源受限下更倾向于基于合理性推理,支持人类认知资源分配对句子理解的影响。
BlindGuard: 保护基于大语言模型的多智能体系统免受未知攻击
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 本文提出BlindGuard,一种无需标注的多智能体系统防御方法,通过层次编码器和腐蚀引导检测器有效检测多种攻击类型,优于监督基线。
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, 2026
AromaGen:基于多模态语言模型的交互式丰富嗅觉体验生成
机构 * MIT Media Lab(MIT媒体实验室) ; Harvard Graduate School of Design(哈佛设计研究生院) ; MIT CSAIL(MIT计算机科学与人工智能实验室)
专题命中 长上下文与记忆 :language model(title);LLM(abstract);分类 cs.AI
AI总结 AromaGen利用多模态语言模型实现基于文本和视觉输入的实时嗅觉生成,通过迭代优化提升嗅觉混合物的自然度,达到与真实食物香气相似的水平。
评估掩码自编码基础模型在从地面钻井数据预测井下指标中的潜力
机构 * Schulich School of Engineering(施鲁奇工程学院) ; Department of Electrical and Software Engineering(电气与软件工程系) ; University of Calgary(卡尔加里大学) ; Department of Chemical and Petroleum Engineering(化学与石油工程系)
专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.LG
AI总结 本文评估MAEFMs在从地面钻井数据预测井下指标中的潜力,发现其在时间序列建模中具有优势,建议未来进行实证验证。