Agent-Assisted Side-Channel Attacks on Non-Prefix KV Cache in RAG
代理辅助的非前缀KV缓存侧信道攻击
专题命中 记忆与上下文管理 :agent(title)
AI总结 针对RAG系统中非前缀KV缓存融合的侧信道漏洞,提出SpliceLeak攻击,利用“阶梯波”时序特征提取私有提示长度和语义内容,并设计SpliceDefense防御机制。
Comments 15 pages, 8 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
代理辅助的非前缀KV缓存侧信道攻击
专题命中 记忆与上下文管理 :agent(title)
AI总结 针对RAG系统中非前缀KV缓存融合的侧信道漏洞,提出SpliceLeak攻击,利用“阶梯波”时序特征提取私有提示长度和语义内容,并设计SpliceDefense防御机制。
Comments 15 pages, 8 figures
量化理论上的AI对齐保证:贝叶斯说服中的接收者效用界
机构 * Cornell University(康奈尔大学)
专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 通过贝叶斯说服模型,研究AI发送者优化错位目标时,人类接收者仍能获得多少有用信息,证明接收者效用比不超过3/2,并给出紧性下界。
Comments 12 pages, EC 2026 Poster and EC 2026 Incentive-Based AI Alignment Workshop Poster
从不可信输入到可信内存:LLM智能体中内存投毒攻击的系统研究
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文系统研究了基于LLM的智能体中的内存投毒攻击,识别了四种内存写入通道和九种结构漏洞,提出了六类攻击的分类法,并设计了评估基准MPBench,发现更积极读写内存的智能体更易被利用,且现有提示注入防御无法覆盖内存投毒攻击。
计划不会持久:为什么上下文管理对LLM代理至关重要
机构 * Snowflake AI Research(Snowflake AI研究)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文通过重放配对诊断和压缩压力测试,证明标准LLM代理不将计划作为持久状态携带,而是依赖上下文中的计划,并揭示了推理模型的推理痕迹混淆问题。
Comments 17 pages, 8 figures
VISTA Architect:一种面向图数据库的健康AI系统,在多学科肿瘤委员会中展示
机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) ; Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院医学系)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出VISTA Architect架构,通过图数据库和LLM将EHR转化为持久知识图谱,解决长上下文提示和RAG的时序缺失与高成本问题,在胸科肿瘤委员会中实现96.4%准确率。
Comments 22 pages, 4 figures, 6 tables; includes Supplementary Information. Code: https://github.com/VISTA-Stanford/vista-architect (tag v0.1.0-preprint, commit 8837d44)
假设驱动的技能优化用于LLM智能体
机构 * AI Lab, Qifu Technology(奇富科技人工智能实验室)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.SE
AI总结 提出HDSO框架,通过可证伪假设与验证机制从稀疏轨迹中提取可靠技能,无需训练,在ALFWorld上提升平均成功率6.9-7.1个百分点。
作为自动研究失败感知共享记忆的负面知识
机构 * Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出负面知识记忆层,通过策展代理将失败尝试转化为共享库中的记录,供研究代理采纳或拒绝,在ScienceAgentBench和PDE问题上提升性能并减少令牌使用。
Comments 13 pages, 4 figures
RIZZ: 将交互路由到近零干扰区域以实现黑盒智能体的持续适应
机构 * University of Oxford(牛津大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出RIZZ框架,通过验证器门控记忆、路由和提示编译,实现黑盒语言模型系统在非平稳流数据上的持续适应,有效控制干扰并提升性能。
Comments 20 pages, 2 figures
少即是多:面向边缘设备问答应用的轻量级提示压缩
机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) ; Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出CORE,一种无需辅助语言模型的两阶段句子级提示压缩方法,通过NER和语义匹配构建答案集与线索集,结合正交残差检索和空间邻近度过滤,在边缘设备上显著提升准确率、降低内存和能耗。
储层注意力网络:通过内容可寻址储层注入在预训练Transformer中的跨前向传播状态
机构 * Emma Leonhart
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出储层注意力网络(RAN),通过在预训练Transformer中间层注入固定随机储层来携带跨前向传播状态,实验表明未训练的循环动态足以传递可用状态。
Comments 29 pages, 14 figures
意图、反思、优化:一种用于自动驾驶的自适应多模态反思框架
机构 * Sun Yat-sen University(中山大学) ; HKUST(GZ)(香港科技大学(广州)) ; Yinwang Intelligent Technology Co. Ltd.(引望智能科技有限公司)
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI
AI总结 提出IRR-Drive框架,通过生成初步文本意图并预测未来语义BEV表示,构建双模态反思空间,实现自适应轨迹修正,在NAVSIM基准上达到最优性能。
面向AI可见性的逐实体偏差映射:为何品牌提及需要实体特定校准
机构 * Neural Awareness
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL
AI总结 提出逐实体偏差映射(PEBM)框架,识别三种失败模式及参数-检索滞后不对称性,通过大规模实证揭示品牌幻觉悖论,并引入鬼影制图机制解释实体在稀疏潜在区域的虚构输出。
Comments 26 pages, 14 tables. Zenodo preprint: https://doi.org/10.5281/zenodo.20419277. Data and code: https://doi.org/10.5281/zenodo.20308957
基于数字孪生引导自适应欺骗的隐私保护联邦时序图学习及其在弹性医疗物联网中的应用
机构 * FAST National University of Computer and Emerging Sciences(FAST国立计算机与新兴科学大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 提出联邦时序图卷积网络与优势演员-评论家(Federated TGCN-A2C)架构,结合数字孪生异常评分、联邦A2C动作选择和增强蜜罐层,在CICDDoS 2019和TON-IoT数据集上分别达到99.48%和99.61%的测试准确率,并覆盖更多攻击类别。
StickyInvoc:重新思考LLM时代高通量工作流的任务模型
专题命中 记忆与上下文管理 :workflow(abstract)
AI总结 针对LLM推理在高通量工作流中因反复加载模型参数导致的性能瓶颈,提出StickyInvoc任务模型,通过分离状态创建与销毁,将状态持久化复用,实现3.6倍加速。
Comments arXiv admin note: substantial text overlap with arXiv:2510.14024
上游互惠与下游互惠:催化合作
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 通过基于智能体的模拟,研究上游(经验驱动)和下游(声誉驱动)互惠在有限和结构化群体中的联合动态,发现更新机制对两者命运起决定性作用,并揭示最大化上游互惠的最优网络度。
SALMON 2.3:大规模实时TDDFT的分治基态初始化实现
专题命中 记忆与上下文管理 :workflow(abstract)
AI总结 针对大规模实时TDDFT中基态计算瓶颈,SALMON 2.3实现了分治密度泛函理论(DC-DFT)与轨道重构方法,线性标度地高效制备初始态,支持数千原子体系的电子动力学模拟。
Comments 13 pages, 7 figures
eMEM:一种面向具身智能体的混合时空记忆系统
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 提出eMEM混合图记忆系统,通过多索引架构和分层整合管道实现具身智能体在空间、时间和语义上的高效记忆检索,并在ProcTHOR-10K基准测试中达到80.8加权平均分。
Agent-OM:利用大语言模型代理进行本体匹配
机构 * Australian National University(澳大利亚国立大学) ; Monash University(墨尔本大学)
专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI、cs.CL
AI总结 本文提出Agent-OM框架,结合检索与匹配代理及OM工具,有效提升复杂和少样本本体匹配任务性能,接近传统最佳表现。
Comments 31 pages - VLDB 2025 (Page 1-20), OM 2025 (Page 21-31)
测量持续存在的内容:AI智能体身份的调节机制与几何框架
机构 * Anisotrope AI
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.CL
AI总结 提出基于√JSD度量空间和丰富范畴理论中幅度同调的几何框架,用于测量AI智能体身份结构,发现双机制调节结构:身份真空簇和安全盆地簇,并通过等边探针基线验证身份规范创造可测量的行为丰富性。
Comments 29 pages, 6 figures, 8 tables
人-智能体交互的设计原则
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);tool use(abstract);agentic(abstract)
AI总结 本文提出14条设计原则,涵盖初始、交互、长期和故障四个阶段,以指导设计可用、可信且有效的人-智能体交互系统。
Counsel: 面向智能体任务的元评估数据集
机构 * Atla AI ; Cohere AI ; Mistral AI ; Google DeepMind(谷歌DeepMind)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。
专业化角色,混合部署:推动LLM代理团队的成本-精度前沿
机构 * University of Edinburgh(爱丁堡大学) ; Microsoft Research(微软研究院)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出AgentCARD基准,通过角色感知评估和帕累托前沿分析,发现异构团队在成本-精度前沿上优于同构团队,混合部署可降低12倍成本。
将意图转化为规范:一个基准测试和一个交互式用户助手代理
机构 * Red Hat AI Innovation(红帽AI创新) ; MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) ; IBM Core AI(IBM核心AI)
专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 提出SpecBench基准和Buddy代理,通过形态分析分解用户意图、模拟用户评估设计选择,将焦点从代码生成转向人机协作规范制定。
利用注意力机制检测野外恶意智能体技能
机构 * University of Luxembourg(卢森堡大学)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 针对LLM技能市场中的恶意技能注入攻击,提出Locate-and-Judge两阶段检测器,通过注意力定位和审查实现高效全市场扫描,大幅降低成本并保持高精度。
MacAgentBench: 在真实macOS桌面上基准测试AI代理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; East China Normal University(华东师范大学) ; Tsinghua University(清华大学)
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 提出MacAgentBench,包含676个跨25个应用的任务,采用规则评估和细粒度多检查点评分,实验表明最佳配置(OpenClaw上的Claude Opus 4.6)达到73.7% Pass@1,优势主要来自技能库而非框架设计。
BabelJudge: 跨语言和智能体轨迹中LLM作为评判者可靠性的测量
专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出BabelJudge基准,通过受控扰动生成已知标签的成对样本,无监督地测量评判模型的位置偏差、冗长偏差、顺序不一致和跨语言退化,发现Swahili顺序一致性接近随机。
Comments 8 pages, 4 figures. Source code, benchmark toolkit, and reproduction scripts at https://github.com/Shreyaskc/BabelJudge
何时涌现共识是真实的?一种测量耦合增益与LLM智能体社会的有效性诊断
机构 * DeepLethe
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 针对LLM智能体社会中的涌现共识或极化现象,提出基于反事实扰动的耦合增益测量方法,并建立有效性诊断工具,区分真实社会动态与模型伪影。
Comments 13 pages (incl. appendix with proofs), 7 figures. Code and per-run logs released
从问答到任务完成:智能体系统与执行框架设计综述
机构 * City University of Hong Kong(香港城市大学) ; University of Sydney(悉尼大学) ; Peking University(北京大学) ; TokenRhythm Technologies(TokenRhythm 科技公司)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本文从模型-执行框架视角综述LLM智能体,分析模型瓶颈与执行框架设计,提出六组件分解法,并探讨任务完成、效率与可靠性的影响因素。
驾驭智能体技能:技能中介LLM智能体的架构模式与参考架构
机构 * Responsible AI Research (RAIR) Centre(负责任人工智能研究中心) ; Adelaide University(阿德莱德大学) ; University of New South Wales(新南威尔士大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出十种经验性架构模式(五种核心、五种辅助)用于技能中介,并综合成包含供应链、中介、执行控制、证据与反馈四层的参考架构,通过跨实例化评估提供分析框架。
AGENTSERVESIM:面向多轮LLM智能体服务的硬件感知模拟器
机构 * University of Central Florida(中佛罗里达大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 提出AGENTSERVESIM模拟器,通过程序编排器、工具模拟器、会话感知路由器和KV驻留模型等模块,在程序粒度上评估多轮LLM智能体服务策略,在CPU上以6%误差复现真实系统行为。
Comments Preprint