一个月前把钥匙放在哪、某次做饭先拿了什么、不同日期见过谁——人会把零散经历串成长期记忆,多模态模型却常在短视频问答里被高估。华为、南京大学和天津大学推出EgoMonth,收集20名参与者跨20至120天的300多小时第一视角视频,用1443道人工题考AI能否记住真实生活。
现有长视频基准通常来自电影、教学视频或人为拼接片段,时长虽长,事件却围绕明确脚本。真实生活充满重复房间、相似物品和间隔数周的微小变化,问题答案可能藏在多个日期之间,这正是个人助理真正需要处理的记忆形态。
20个人连续记录,最长时间跨度达到120天
EgoMonth让参与者佩戴第一视角设备,在自然活动中记录工作、出行、购物、做饭和社交。数据总时长超过300小时,单人跨度从20天到120天。镜头会出现晃动、遮挡、无关片段和大量相似场景,模型不能依赖影视剪辑提前知道“关键情节”在哪里。
EgoMonth从连续生活视频构建跨月记忆任务。
团队由人工提出1443道多选题,覆盖14类任务。除了“某物出现在哪里”这类定位题,还包括事件顺序、频率比较、跨日关联、人物与地点关系,以及需要汇总多段证据的生活规律。问题与答案都经过核验,减少自动生成题目把错误带进评测的风险。
不是把整月视频塞进上下文,而是先找到记忆证据
数百小时视频无法直接逐帧送进模型。典型系统需要先把视频切段,用视觉模型生成描述或向量索引,再根据问题检索相关片段,最后由大模型推理答案。EgoMonth因此同时考察“有没有存下正确线索”“能否找回来”和“找到后会不会推理”三层能力。
EgoMonth数据规模、时间跨度与问答构建流程。
当两个星期都出现同一只杯子,单帧相似度很难判断问题指向哪一次;询问“后来去了哪里”还需要先定位前置事件,再沿时间轴继续检索。基准将这种跨片段依赖保留下来,使简单的关键词匹配无法轻易拿高分。
Gemini 2.5 Pro得71.8%,人类达到94.2%
在论文评测的系统中,Gemini 2.5 Pro宏平均准确率为71.8%,人类为94.2%,相差22.4个百分点。部分任务上,模型表现接近四选一随机水平的25%,尤其容易在长时间跨度、重复活动和多证据汇总中丢失线索。
EgoMonth中的跨日期、多证据生活记忆问答示例。
71.8%是14类多选任务的宏平均,并不意味着模型已经记住七成真实生活,也不能直接外推为全天候个人助理能力。视频来自20名参与者,文化环境、设备佩戴和生活类型仍有限。但人与模型在同一批题上的22.4分差距,清楚揭示了短视频理解分数无法代表跨月记忆。
EgoMonth十四类长期记忆任务的分布与难度。
下一步走向可控、可追溯的个人记忆助手
EgoMonth最直接的应用是可检索生活日志:用户询问遗失物品、会议细节或某段经历,系统不仅给答案,还返回对应日期与视频证据。要让它真正可用,记忆模块需要分层保存人物、物体、地点和事件,把高频规律与偶发细节分开,并允许用户删除或纠正错误记忆。
隐私会成为产品化的核心设计,而非附加选项。第一视角视频包含旁人面孔、住址和屏幕信息,未来系统应优先在本地提取结构化记忆,对敏感内容加密和设定保留期限,只在回答时调取必要片段。EgoMonth提供了可量化的长期任务集合,后续研究可以围绕更高效的索引、时间推理和带证据回答继续推进,让AI从“看懂一段视频”走向“可靠记住一段生活”。
另一项值得建立的能力是记忆更新。用户今天把物品换了位置,系统应保留旧事件,却把“当前在哪里”的答案更新到最新状态;遇到相互冲突的片段,则应呈现时间线而非强行选一个。EgoMonth的多日结构正适合检验这种版本化记忆,让助理既记得过去,也不会把过去误当现在。