arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2609.14773cs.CL

Pull:面向有状态LLM对话的工作记忆惰性物化

Pull: Lazy Materialization of Working Memory for Stateful LLM Conversations

  • Chengdu Beiluoshimen Technology Co., Ltd.(成都北洛石门科技有限公司)

机构由 AI 辅助整理,请以论文原文为准。

Jiangang Chen

中文总结 AI 辅助

Pull通过本地确定性Purifier维护可寻址元数据目录,实现惰性物化工作记忆,在LoCoEval和BEAM 1M上大幅减少令牌成本并提升F1,且物化可逆。

中文摘要 AI 辅助

随着LLM对话增长到数百轮,全上下文注入会产生O(N^2)的累积令牌成本,而有损摘要或硬截断则会不可逆地丢弃历史状态。我们提出Pull,一个会话路由器,通过本地确定性的Purifier(零LLM调用,毫秒级延迟)维护可寻址的元数据目录。在查询时,LLM仅惰性物化其所需的轮次;未物化的轮次保持可访问但处于折叠状态。与不可逆压缩不同,Pull的物化是可逆的;后续查询可以展开任何折叠的轮次。在LoCoEval(128个对话,12,780轮)上,Pull在单跳任务中将每查询上下文令牌(阶段2)减少了75.1%,质量相当(Δ = -0.002,不显著),在多跳任务中减少了72.0%,且无质量损失(Δ = +0.017)。一个受控路由基准(7,831个查询×10种方法)表明,实体生命周期跟踪经验上是距离无关路由的先决条件。在BEAM 1M(14个对话,263个问题)上,Pull相比截断基线将F1提高了+55.2%。

英文摘要

As LLM conversations grow to hundreds of turns, full-context injection incurs $O(N^2)$ cumulative token costs, while lossy summarization or hard truncation irreversibly discards historical state. We propose Pull, a session router that maintains an addressable metadata directory via a local, deterministic Purifier (zero LLM calls, millisecond-level latency). At query time, the LLM lazily materializes only the turns it needs; unmaterialized turns remain accessible but collapsed. Unlike irreversible compression, Pull's materialization is reversible; subsequent queries can expand any collapsed turn. On LoCoEval (128 conversations, 12,780 turns), Pull reduces per-query context tokens (Phase 2) by 75.1 percent on single-hop tasks with equivalent quality ($Δ= -0.002$, n.s.) and by 72.0 percent on multi-hop tasks with no quality loss ($Δ= +0.017$). A controlled routing benchmark (7,831 queries x 10 methods) shows that entity lifecycle tracking is empirically a prerequisite for distance-independent routing. On BEAM 1M (14 conversations, 263 questions), Pull improves F1 by +55.2 percent over a truncation baseline.

补充信息

↑