arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

北大联合MemoraX推出GraphMemix:以"证据森林"重塑多模态Agent的长期记忆架构

作者:arXivDaily编辑部 arXiv论文 多模态Agent · 长期记忆 · 图检索

论文导读

导读: 当多模态Agent面对相册、视频、邮件、日历以及跨会话交互记录时,历史数据越庞大,真正决定回答质量的关键证据就越容易被噪声淹没。

北京大学王选计算机研究所与MemoraX AI联合团队提出GraphMemix框架,将记忆检索从传统的逐条排序升级为查询驱动的"证据森林"组合优化。

在四项长期多模态记忆评测基准上,GraphMemix将平均Judge Accuracy推升至61.55%,较当前最强公开基线高出11.75个百分点。

论文信息: GraphMemix: Query-Aware Evidence Forests for Long-Term Multimodal Agent Memory

作者: Geng Li、Yuhao Wang、Dong Li、Jianye Hao、Yuxin Peng

机构: 北京大学王选计算机研究所、MemoraX AI

01|困境:多模态长期记忆面临的双重瓶颈

在长程交互场景中,Agent需要处理的海量异构历史数据涵盖文本、图像、视频与时间线记录。现有技术路线主要沿两个方向发展,但各自存在结构性局限。

路线一:与查询解耦的离线预处理

A-MEM、MIRIX、SGM等方法倾向于在用户提问前,就对历史数据进行摘要提取、结构化编码或链接构建。这类方案的隐患在于:全量历史的生成式处理带来高昂的冷启动与持续维护开销;由于无法预知未来的查询形态,压缩过程极易丢失局部视觉特征、状态变迁与细粒度上下文;一旦早期摘要遗漏关键细节,后续检索几乎无法复原。

路线二:基于向量相似度的多模态RAG

MuRAG、Pensieve等方法依赖Embedding相似度匹配,寻找与问题表面最接近的历史记录。这种方式检索效率尚可,但更倾向于召回"看起来相似"的内容,而非"组合后方能完整"的证据。

举例而言,当用户询问某课程作业修改后的截止日期时,相似度检索可能优先返回最初的原始通知,却漏掉措辞不同、排序靠后的更新邮件;也可能反复召回多条内容雷同的旧通知,挤占有限的Reader上下文窗口。

真正的难点并非"找到最相似的一条记忆",而是:在严格的证据预算约束下,如何遴选出一组相互补全、共同支撑答案的记忆集合?

02|思路转变:从独立排序迈向"证据森林"

GraphMemix的根本创新在于将记忆选择从逐条打分的独立决策,重构为查询感知的组合图优化问题。

• 节点(Node): 表征单条记忆对当前问题的直接支撑能力;

• 边(Edge): 表征在已知某条锚点证据的前提下,另一条记忆能够补充多少新的回答信息;

• 森林(Forest): 表征最终保留的若干条互补证据链的集合。

GraphMemix摒弃了对完整历史进行昂贵生成式预摘要的做法。查询到达后,系统仅围绕高相关性的种子记忆构建一个有界局部图,联合判定"哪些节点值得保留"以及"哪些关系确实带来了信息增量"。

图1|GraphMemix 方法总览:候选图构建、证据效用与成本估计、最大权重证据森林优化。选出的查询相关记忆随后被送入Reader生成答案。

03|技术拆解:GraphMemix的三阶段工作机制

阶段一:构建有界候选图

单条多模态记忆可能同时包含原始图像、Caption、OCR、视频帧与文本字段。GraphMemix首先执行多视图召回,取各视图与查询相似度的最大值作为记忆的初始检索分,并筛选出Top-L种子记忆。

随后,系统通过两类关系进行有限跳扩展:

• Schema关系: 如同一会话、同一轮交互、同一邮件链,或其他可从原始数据中直接观察到的结构关联;

• Mutual-kNN语义关系: 用于发现向量空间中互为近邻的相关记忆。

扩展仅用于提升候选覆盖率,最终候选规模被严格限制在M以内。这样既保留了种子周围的局部上下文,又避免将整张历史图丢给大模型处理。

阶段二:解耦估计节点效用与关系增量

GraphMemix采用两个职责清晰、可并行执行的验证器。

节点验证器(Node Verifier)以Listwise方式阅读查询与全部候选,估计每条记忆独立支撑回答的程度。该分数与原始检索相似度融合后,形成节点效用。

证据链验证器(Evidence-Chain Verifier, ECV)负责回答另一关键问题:在已知锚点证据的条件下,候选记忆是否仍提供新的回答信息?

ECV将候选关系划分为六种角色:

• 正向增量: new_fact、clarification、corroboration

• 无效或负向: redundant、conflict、irrelevant

只有被判定为正向增量,且增量支持分大于零的Schema边,才能进入最终可信图。换言之,单纯"主题相近"或"位置相邻"并不足以获得结构收益。

阶段三:求解最大权重证据森林

GraphMemix联合优化三类因素:

1. 节点的直接效用;

2. 关系边的不确定性成本;

3. 开启独立证据链的组件成本。

直观理解:

证据森林得分 = 节点直接效用 − 独立证据链成本 + 可信边带来的结构收益

在固定节点集合下,系统通过Kruskal算法精确求解最大权重无环森林。在节点选择层面,采用确定性两阶段求解:

1. 通过1-Swap局部搜索生成固定K个节点的候选方案;

2. 在冻结候选方案的子集上执行变基数精确提炼,自动剔除无法证明自身价值的孤立记忆。

最终输出的并非简单的Top-K列表,而是一组经结构化组织的证据树。系统按组件与树内顺序将其序列化,交由冻结的多模态Reader生成最终答案。

04|实验验证:四项基准全面领先

研究团队在ATM-Bench、Mem-Gallery、MemEye、H2HMem四项长期多模态Agent记忆基准上开展评估,所有方法统一使用相同的Reader与评测协议。

核心结果

• 61.55%: Qwen3-VL-8B Reader下的四榜平均Judge Accuracy

• +11.75个百分点: 相比最强公开基线UniversalRAG的宏平均提升

• 4/4: GraphMemix在全部四项基准上均取得更高Judge Accuracy

图2|Qwen3-VL-8B Reader下,GraphMemix与每项基准最强公开基线的Judge Accuracy对比,括号内为绝对提升百分点。

具体表现:

• ATM-Bench: 55.27%,较该基准最强公开基线提升6.80个百分点;

• Mem-Gallery: 76.33%,提升12.57个百分点;

• MemEye: 53.64%,提升5.66个百分点;

• H2HMem: 60.96%,提升16.60个百分点;

• 四榜宏平均: 61.55%,较UniversalRAG的49.80%提升11.75个百分点。

该结果覆盖严格短答案匹配、开放式回答、多项选择与参考信息覆盖等多种任务形态,表明GraphMemix的收益不局限于特定数据格式。

跨模型验证

为验证方法是否依赖特定基模,团队将Reader替换为Gemma 412B Unified。在此配置下,GraphMemix的四榜平均Judge Accuracy达67.42%,较该配置下的最强基线提升12.33个百分点。

这说明GraphMemix优化的是Reader所见的证据结构,而非针对某一回答模型进行特化。

05|效率分析:更高准确率,更短完整生命周期

长期记忆系统的成本不应仅计算单次问答,而需涵盖两个阶段:

1. 消化并组织全部历史记忆;

2. 回答评测集中的全部问题。

图3|ATM-Bench完整生命周期分析:左侧为处理11,034条记忆并回答1,044个问题的时间分解,右侧为准确率与生命周期时间的关系。

在ATM-Bench的完整生命周期对比中,GraphMemix:

• 较A-MEM缩短总耗时约1.78倍;

• 较VimRAG缩短约4.27倍;

• 较LightMem缩短约4.74倍。

GraphMemix并非所有方法中绝对耗时最低者,但它在显著提升准确率的同时,保持了较低的生命周期成本,并处于经验Pareto前沿。

这意味着:现有对比方法无法在更短时间内达到相同或更高的准确率。

其关键在于,语义推理仅发生在查询相关的有界候选图上,而非对完整历史持续执行生成式处理。

06|案例分析:为何"组合选择"优于相似度排序?

以Mem-Gallery中的一道问题为例:

问题: 对话中提到的两只"聪明且学习很快"的狗,分别叫什么名字?

正确答案需同时恢复分散在不同对话中的两组信息:

• Lena的马尔济斯犬Lumi

• Lucy的玩具贵宾犬Coco

图4|GraphMemix在Mem-Gallery上的证据优化过程。绿色外框表示换入节点,红色外框表示换出节点,黄色边框表示标注证据,绿色虚线表示经ECV验证后被森林采用的关系。

传统方法在此案例中暴露出不同形式的不完整性:

• A-MEM重复给出Lumi与"马尔济斯犬",未恢复第二只狗的名字;

• MemGuide与LightMem给出了犬种,而非问题要求的具体狗名;

• 独立相似度排序虽找到部分关键词证据,却未完成"名字—犬种—学习能力"的完整配对。

GraphMemix的初始候选同样不完整,但经5次有效的1-Swap与可信森林重组后:

• 目标函数从1.340单调提升至2.133;

• 最终保留6条经ECV验证的关系边;

• 换入能够补全Coco身份与属性关系的低排名证据;

• Reader最终正确回答:Lumi the Maltese and Coco the Toy Poodle。

这一案例揭示了GraphMemix的关键价值:低相似度证据未必不相关。它可能只有在与另一条记忆建立连接后,才会释放真正的回答价值。

07|总结:长期记忆需要"组织",而非仅仅"召回"

GraphMemix带来的核心启示可归纳为三点:

1. 查询触发、局部构建: 避免昂贵的全历史生成式预总结,仅在查询到达后处理有界候选图;

2. 节点与关系职责分离: 分别建模"单条记忆是否有用"与"它相对锚点增加了什么";

3. 从排序升级为组合优化: 通过最大权重证据森林,在固定Reader预算下保留互补证据,同时抑制冗余与冲突。

实验结果表明,面向长期多模态Agent,检索的终点不应只是一份相似度Top-K列表。唯有将相关记忆组织成完整、可信、预算可控的证据结构,Reader才能真正有效利用长程历史。

参考资料

https://arxiv.org/abs/2608.26983