A Unified Agentic Framework for Evaluating Conditional Image Generation
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.CL
Comments Work in progress. GitHub: https://github.com/HITsz-TMG/Agentic-CIGEval
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.CL
Comments Work in progress. GitHub: https://github.com/HITsz-TMG/Agentic-CIGEval
更少上下文,更高准确率:一种用于LLM Agent的双时间记忆引擎,其中精简检索上下文优于完整历史
机构 * Independent Researcher(独立研究者)
专题命中 记忆与上下文管理 :agent(title_cn,abstract_cn);分类 cs.AI、cs.CL、cs.LG
AI总结 提出一种双时间记忆引擎Engram,通过混合读取路径从约9.6k token的检索片段中回答,在LongMemEval_S上达到83.6%准确率,比完整历史(79k token)高10.4个百分点,且无错误。
Comments 14 pages, 4 figures, 3 tables. Code, reproducible harness, and raw per-question logs: https://github.com/ly-wang19/engram
M$^\star$:每个任务都应有专属的记忆框架
机构 * City University of Hong Kong(香港城市大学) ; Microsoft(微软)
专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出M$^\star$方法,通过可执行程序进化自动发现任务优化的记忆系统,在对话、具身规划和专家推理等任务上优于固定记忆基线。
Comments Preprint. Code: https://github.com/wbopan/mstar ; Live demo: https://mstar.wenbo.io
个人视觉上下文学习在大型多模态模型中
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 记忆与上下文管理 :agentic(summary_cn,abstract)
AI总结 本文提出个人视觉上下文学习(Personal VCL)以解决个性化查询,通过Personal-VCL-Bench评估,发现现有模型在利用视觉证据和聚合多视觉观察方面存在显著不足,提出Agentic Context Bank方法提升性能。
Comments Project website: https://vision.cs.utexas.edu/projects/PersonalVCL/
固态代理:固态模拟的新时代
专题命中 记忆与上下文管理 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)
AI总结 El Agente Sólido是一种基于多代理框架的自动化固态量子化学模拟工具,结合密度泛函理论与机器学习势能,提升材料发现的效率和可重复性。
Comments 42 pages, 31 figures, 18 tables
RocqSmith: 自动优化能否打造更优的证明代理?
机构 * JetBrains Research Germany(JetBrains德国研究机构) ; JetBrains Research Netherlands(JetBrains荷兰研究机构) ; Constructor University Bremen(布雷梅Constructor大学)
专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 RocqSmith研究自动优化方法在提升证明代理性能上的效果,发现简单引导方法效果最佳,但无法超越精心设计的证明代理。
机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学电气与计算机工程系布雷拉德部门) ; National Security Institute, Virginia Tech(弗吉尼亚理工大学国家安全研究所)
专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG
Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 15890 to 15916, Suzhou, China, November 2025
ForeDreamer:用于未来事件预测的自进化双智能体记忆架构
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; National University of Singapore(新加坡国立大学) ; Zhejiang University of Technology(浙江工业大学)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL
AI总结 针对开放网络未来事件预测的不足,提出自进化双智能体框架ForeDreamer,分离事实与经验记忆,经Prophet Arena、FutureX实验验证其有效性
Comments accepted to EMNLP 2026 Findings
Nexus:面向统一内存上智能体大语言模型的深度自适应KV缓存拼接与检索解耦工具路由
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI
AI总结 Nexus针对MCP智能体LLM工具模式预填充主导TTFT的问题,通过检索解耦路由与预填充成本,结合深度自适应KV缓存拼接技术,实现了工具选择与参数生成的高效处理,提升了首token生成速度与上下文利用率。
迈向可逆遗忘:在持续式企业智能体中管理过时知识
专题命中 记忆与上下文管理 :AI agent(title,abstract);分类 cs.LG
AI总结 针对企业AI智能体在非平稳环境中面临的过时知识问题,提出含三种记忆状态的可逆遗忘框架,实例化为滞后可逆记忆控制器,可减少过时信息影响且不混淆临时抑制与永久擦除,金融场景可验证其思路。
GraphWake:LLM智能体社群中基于记忆介导极化级联的群体极化
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI
AI总结 该研究提出名为GraphWake的新型威胁,通过记忆介导极化级联操纵LLM智能体社群,实验证实其可大幅提升群体极化程度,揭示了社群层面的极化风险。
上下文之前的授权:一种针对智能体系统中跨受众记忆泄露的模型无关受众边界
专题命中 记忆与上下文管理 :agentic(title);agent(abstract);分类 cs.AI
AI总结 本研究针对智能体系统的跨受众记忆泄露问题,提出模型无关的受众边界方法,通过反单调授权规则确保未授权事实不进入上下文,在合成数据集上验证了其有效性。
Comments 13 pages, 3 figures. Author preprint. Accepted for presentation at AdvML-Frontiers x CoTMA, a non-archival workshop at COLM 2026
从大语言模型(LLM)推理到智能体工作负载:特征分析与服务系统启示
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI
AI总结 本文提出AgentSysBench基准套件,分析智能体工作负载与传统LLM服务的6项差异,据此开展的4项设计探索可实现延迟降低、效率提升、内存减少及冗余调用节省等效果。
AdsWorldEngine:一种通过协调器与工具协同演化实现的自演进对话式广告智能体
专题命中 记忆与上下文管理 :agent(title);agentic(abstract);分类 cs.AI
AI总结 该研究提出AdsWorldEngine对话式广告框架,通过协调器与工具协同演化的自改进循环,结合机会门、评估器及基于标签的判断建模,在离线与在线实验中均显著提升广告性能。
PIPES:基于来源与先验的智能体感知安全防护方案
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI
AI总结 该研究针对工具使用智能体感知易受状态篡改攻击的问题,提出PIPES防护方案,通过语义先验与来源筛选,大幅降低攻击成功率且保留良性效用。
正确性不受管控:智能体工作流的来源完整性
机构 * Microsoft(微软公司)
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI
AI总结 本文针对智能体工作流的来源完整性问题,提出确定性因果状态层Matrix作为机构完整性层,可记录依赖、验证证据,使工作可审计,且能限制恢复范围。
Comments 19 pages, 2 figures
FluctlightDB:面向AI智能体的数据内存模型
专题命中 记忆与上下文管理 :AI agent(title);agent(abstract);分类 cs.AI
AI总结 本文提出面向AI智能体的独立数据内存模型,实现嵌入式引擎FluctlightDB,在多个记忆召回基准上取得优异结果,填补了数据栈的一层空白。
Comments 16 pages, 6 tables, 4 figures, appendix. Code and frozen benchmark artifacts: https://github.com/voxmastery/FluctlightDB. Preprint DOI: 10.5281/zenodo.20949890
迈向智能体记忆的形式化定义:基础、跨度、最优性与序列记忆问题
机构 * Tianjin University(天津大学)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.LG
AI总结 本文提出智能体记忆的形式化定义,定义最优记忆为容量受限的期望覆盖最大化器,实例化于《奥德赛》并将现有系统纳入框架,使记忆质量可度量。
AMP:一种用于智能体内存操作的供应商中立线格式
机构 * Independent Researcher(独立研究者)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI
AI总结 提出一种基于JSON-Schema 2020-12的供应商中立线格式memorywire,支持五种内存操作和四种内存类型,通过参考实现和基准测试验证其性能与兼容性。
Comments 18 pages, 1 figure, 6 tables. v4: PurgeBench is a companion benchmark by the same author (previously called "external"), plus a threats-to-validity note; no results changed. v3 added the memory-poison recovery evaluation and recover tool. Code: github.com/mthamil107/memorywire
信号轨:终端界面中用于传递对话智能体状态的确定性运动语法
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL
AI总结 Signal Rail为终端界面对话智能体设计确定性运动语法,通过空间语义等理念实现状态传递,完成规范与参考实现,提升非文本状态通道的信息表达能力。
Comments 16 pages, 3 figures. Ancillary files include the Signal Rail 1.0 specification, JavaScript and Python engines, and the cross-implementation conformance harness. Code: https://github.com/matteo-grella/signal-rail
TideRL:通过就绪感知调度提升智能体强化学习的有效吞吐量
机构 * Tsinghua University(清华大学) ; Zhongguancun Laboratory(中关村实验室)
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.LG
AI总结 TideRL是一种就绪感知弹性RL系统,通过CTB、RA²P和ERS技术,在多轮智能体工作负载上大幅提升RL训练有效吞吐量,同时优化KV缓存命中率、训练时间和等待时间。
智能体路由器:一种基于执行的带记忆的持续学习方法
机构 * Zhejiang University(浙江大学) ; Zhejiang Lab(之江实验室) ; State Grid Hebei Electric Power Co., Ltd.(国网河北省电力有限公司) ; Macau University of Science and Technology(澳门科技大学)
专题命中 记忆与上下文管理 :agentic(title);agent(abstract);分类 cs.AI
AI总结 该研究针对CLI-based SONiC操作,提出基于执行的双路径后果感知智能体,通过生成动作、预测后果、重排序选择,提升可行动作覆盖度与执行成功率,两条路径互补增益。
REVEAL:用于长视频问答的基于 rubric(评分标准)的显式证据充分性验证智能体
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI
AI总结 该研究针对长视频问答中现有方法割裂事件、忽略证据充分性的问题,提出REVEAL框架,通过自适应分块的结构化记忆与rubric引导的证据验证,实现更可靠的推理且性能优于现有SOTA方法。
LLM智能体系统中潜在入侵的组合式威胁分析:66号指令场景
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI
AI总结 本文以66号指令为场景,提出组合模型分析LLM智能体系统的潜在入侵威胁,分离三类传播路径,指出现有防御无法封闭所有路径,最强防御为能力调解等四项措施,暂未发现完整场景的公开观测。
Comments Version 11.3, 33 pages
InfMem: 面向长上下文智能体的系统2记忆控制
机构 * McGill University(麦吉尔大学) ; Noah's Ark Lab(诺亚实验室)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL
AI总结 InfMem通过预思考-检索-写作协议实现系统2风格的控制,有效提升超长文档推理的准确率并减少推理时间。
Comments Accepted to COLM 2026
QuanTiMedAI:由智能体人工智能引导的量子增强时间序列模型用于心脏骤停死亡率预测
机构 * North South University(北南大学) ; Memorial University(纪念大学)
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI
AI总结 该研究针对心脏骤停死亡率预测的静态数据局限,提出QuanTiMedAI量子-智能体框架,结合智能体LLM与量子循环网络,在MIMIC-IV数据集上仅用605个参数实现0.852的AUROC,优于现有最先进基线。
Comments Submitted for review
用于反馈驱动智能体修复的因果情景记忆
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), VNU-HCM(胡志明市理工大学计算机科学与工程学院(HCMUT,VNU-HCM))
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL
AI总结 本文提出无需训练的MERIT智能体,通过维护双极性记忆辅助LLM智能体修复,在Spider、BIRD数据集上提升了Text-to-SQL任务的执行准确率,同时明确了因果跨查询记忆的适用场景。
面向未来的缓存:用于智能体记忆系统的灌丛鸦情景记忆原理
机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院皮拉尼分校)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL
AI总结 该研究借鉴灌丛鸦情景记忆原理,提出ScrubJay-MEM智能体记忆系统,通过类型条件时间衰减优化记忆管理,在TGT和MemoryAgentBench任务上取得优于现有方法的效果。
MutMem:持久智能体内存中的密码学授权突变
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI
AI总结 本研究针对持久智能体内存的授权与防篡改问题,提出HOM-AIMOS中的MutMem协议,经实验验证其在多个基准任务中表现良好,可有效抵御中毒攻击。
Comments https://github.com/wallidsaydi-creator/HOM-AIMOS. 32 Pages
生成式与智能体式AI中认知能力差距的分类学
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI
AI总结 本文针对制约认知AI发展的认知能力差距开展分类学综述,梳理五大维度的进展与挑战,提出ACIA架构及认知导向评估框架,为构建可靠认知AI与AGI提供路线图。
Comments 15 pages, 4 figures