论文导读
导读: 当多模态Agent面对相册、视频、邮件、日历以及跨会话交互记录时,历史数据越庞大,真正决定回答质量的关键证据就越容易被噪声淹没。
北京大学王选计算机研究所与MemoraX AI联合团队提出GraphMemix框架,将记忆检索从传统的逐条排序升级为查询驱动的"证据森林"组合优化。
在四项长期多模态记忆评测基准上,GraphMemix将平均Judge Accuracy推升至61.55%,较当前最强公开基线高出11.75个百分点。
论文信息: GraphMemix: Query-Aware Evidence Forests for Long-Term Multimodal Agent Memory
作者: Geng Li、Yuhao Wang、Dong Li、Jianye Hao、Yuxin Peng
机构: 北京大学王选计算机研究所、MemoraX AI
01|困境:多模态长期记忆面临的双重瓶颈
在长程交互场景中,Agent需要处理的海量异构历史数据涵盖文本、图像、视频与时间线记录。现有技术路线主要沿两个方向发展,但各自存在结构性局限。
路线一:与查询解耦的离线预处理
A-MEM、MIRIX、SGM等方法倾向于在用户提问前,就对历史数据进行摘要提取、结构化编码或链接构建。这类方案的隐患在于:全量历史的生成式处理带来高昂的冷启动与持续维护开销;由于无法预知未来的查询形态,压缩过程极易丢失局部视觉特征、状态变迁与细粒度上下文;一旦早期摘要遗漏关键细节,后续检索几乎无法复原。
路线二:基于向量相似度的多模态RAG
MuRAG、Pensieve等方法依赖Embedding相似度匹配,寻找与问题表面最接近的历史记录。这种方式检索效率尚可,但更倾向于召回"看起来相似"的内容,而非"组合后方能完整"的证据。
举例而言,当用户询问某课程作业修改后的截止日期时,相似度检索可能优先返回最初的原始通知,却漏掉措辞不同、排序靠后的更新邮件;也可能反复召回多条内容雷同的旧通知,挤占有限的Reader上下文窗口。
真正的难点并非"找到最相似的一条记忆",而是:在严格的证据预算约束下,如何遴选出一组相互补全、共同支撑答案的记忆集合?
02|思路转变:从独立排序迈向"证据森林"
GraphMemix的根本创新在于将记忆选择从逐条打分的独立决策,重构为查询感知的组合图优化问题。
• 节点(Node): 表征单条记忆对当前问题的直接支撑能力;
• 边(Edge): 表征在已知某条锚点证据的前提下,另一条记忆能够补充多少新的回答信息;
• 森林(Forest): 表征最终保留的若干条互补证据链的集合。
GraphMemix摒弃了对完整历史进行昂贵生成式预摘要的做法。查询到达后,系统仅围绕高相关性的种子记忆构建一个有界局部图,联合判定"哪些节点值得保留"以及"哪些关系确实带来了信息增量"。
图1|GraphMemix 方法总览:候选图构建、证据效用与成本估计、最大权重证据森林优化。选出的查询相关记忆随后被送入Reader生成答案。
03|技术拆解:GraphMemix的三阶段工作机制
阶段一:构建有界候选图
单条多模态记忆可能同时包含原始图像、Caption、OCR、视频帧与文本字段。GraphMemix首先执行多视图召回,取各视图与查询相似度的最大值作为记忆的初始检索分,并筛选出Top-L种子记忆。
随后,系统通过两类关系进行有限跳扩展:
• Schema关系: 如同一会话、同一轮交互、同一邮件链,或其他可从原始数据中直接观察到的结构关联;
• Mutual-kNN语义关系: 用于发现向量空间中互为近邻的相关记忆。
扩展仅用于提升候选覆盖率,最终候选规模被严格限制在M以内。这样既保留了种子周围的局部上下文,又避免将整张历史图丢给大模型处理。
阶段二:解耦估计节点效用与关系增量
GraphMemix采用两个职责清晰、可并行执行的验证器。
节点验证器(Node Verifier)以Listwise方式阅读查询与全部候选,估计每条记忆独立支撑回答的程度。该分数与原始检索相似度融合后,形成节点效用。
证据链验证器(Evidence-Chain Verifier, ECV)负责回答另一关键问题:在已知锚点证据的条件下,候选记忆是否仍提供新的回答信息?
ECV将候选关系划分为六种角色:
• 正向增量: new_fact、clarification、corroboration
• 无效或负向: redundant、conflict、irrelevant
只有被判定为正向增量,且增量支持分大于零的Schema边,才能进入最终可信图。换言之,单纯"主题相近"或"位置相邻"并不足以获得结构收益。
阶段三:求解最大权重证据森林
GraphMemix联合优化三类因素:
1. 节点的直接效用;
2. 关系边的不确定性成本;
3. 开启独立证据链的组件成本。
直观理解:
证据森林得分 = 节点直接效用 − 独立证据链成本 + 可信边带来的结构收益
在固定节点集合下,系统通过Kruskal算法精确求解最大权重无环森林。在节点选择层面,采用确定性两阶段求解:
1. 通过1-Swap局部搜索生成固定K个节点的候选方案;
2. 在冻结候选方案的子集上执行变基数精确提炼,自动剔除无法证明自身价值的孤立记忆。
最终输出的并非简单的Top-K列表,而是一组经结构化组织的证据树。系统按组件与树内顺序将其序列化,交由冻结的多模态Reader生成最终答案。
04|实验验证:四项基准全面领先
研究团队在ATM-Bench、Mem-Gallery、MemEye、H2HMem四项长期多模态Agent记忆基准上开展评估,所有方法统一使用相同的Reader与评测协议。
核心结果
• 61.55%: Qwen3-VL-8B Reader下的四榜平均Judge Accuracy
• +11.75个百分点: 相比最强公开基线UniversalRAG的宏平均提升
• 4/4: GraphMemix在全部四项基准上均取得更高Judge Accuracy
图2|Qwen3-VL-8B Reader下,GraphMemix与每项基准最强公开基线的Judge Accuracy对比,括号内为绝对提升百分点。
具体表现:
• ATM-Bench: 55.27%,较该基准最强公开基线提升6.80个百分点;
• Mem-Gallery: 76.33%,提升12.57个百分点;
• MemEye: 53.64%,提升5.66个百分点;
• H2HMem: 60.96%,提升16.60个百分点;
• 四榜宏平均: 61.55%,较UniversalRAG的49.80%提升11.75个百分点。
该结果覆盖严格短答案匹配、开放式回答、多项选择与参考信息覆盖等多种任务形态,表明GraphMemix的收益不局限于特定数据格式。
跨模型验证
为验证方法是否依赖特定基模,团队将Reader替换为Gemma 412B Unified。在此配置下,GraphMemix的四榜平均Judge Accuracy达67.42%,较该配置下的最强基线提升12.33个百分点。
这说明GraphMemix优化的是Reader所见的证据结构,而非针对某一回答模型进行特化。
05|效率分析:更高准确率,更短完整生命周期
长期记忆系统的成本不应仅计算单次问答,而需涵盖两个阶段:
1. 消化并组织全部历史记忆;
2. 回答评测集中的全部问题。
图3|ATM-Bench完整生命周期分析:左侧为处理11,034条记忆并回答1,044个问题的时间分解,右侧为准确率与生命周期时间的关系。
在ATM-Bench的完整生命周期对比中,GraphMemix:
• 较A-MEM缩短总耗时约1.78倍;
• 较VimRAG缩短约4.27倍;
• 较LightMem缩短约4.74倍。
GraphMemix并非所有方法中绝对耗时最低者,但它在显著提升准确率的同时,保持了较低的生命周期成本,并处于经验Pareto前沿。
这意味着:现有对比方法无法在更短时间内达到相同或更高的准确率。
其关键在于,语义推理仅发生在查询相关的有界候选图上,而非对完整历史持续执行生成式处理。
06|案例分析:为何"组合选择"优于相似度排序?
以Mem-Gallery中的一道问题为例:
问题: 对话中提到的两只"聪明且学习很快"的狗,分别叫什么名字?
正确答案需同时恢复分散在不同对话中的两组信息:
• Lena的马尔济斯犬Lumi
• Lucy的玩具贵宾犬Coco
图4|GraphMemix在Mem-Gallery上的证据优化过程。绿色外框表示换入节点,红色外框表示换出节点,黄色边框表示标注证据,绿色虚线表示经ECV验证后被森林采用的关系。
传统方法在此案例中暴露出不同形式的不完整性:
• A-MEM重复给出Lumi与"马尔济斯犬",未恢复第二只狗的名字;
• MemGuide与LightMem给出了犬种,而非问题要求的具体狗名;
• 独立相似度排序虽找到部分关键词证据,却未完成"名字—犬种—学习能力"的完整配对。
GraphMemix的初始候选同样不完整,但经5次有效的1-Swap与可信森林重组后:
• 目标函数从1.340单调提升至2.133;
• 最终保留6条经ECV验证的关系边;
• 换入能够补全Coco身份与属性关系的低排名证据;
• Reader最终正确回答:Lumi the Maltese and Coco the Toy Poodle。
这一案例揭示了GraphMemix的关键价值:低相似度证据未必不相关。它可能只有在与另一条记忆建立连接后,才会释放真正的回答价值。
07|总结:长期记忆需要"组织",而非仅仅"召回"
GraphMemix带来的核心启示可归纳为三点:
1. 查询触发、局部构建: 避免昂贵的全历史生成式预总结,仅在查询到达后处理有界候选图;
2. 节点与关系职责分离: 分别建模"单条记忆是否有用"与"它相对锚点增加了什么";
3. 从排序升级为组合优化: 通过最大权重证据森林,在固定Reader预算下保留互补证据,同时抑制冗余与冲突。
实验结果表明,面向长期多模态Agent,检索的终点不应只是一份相似度Top-K列表。唯有将相关记忆组织成完整、可信、预算可控的证据结构,Reader才能真正有效利用长程历史。