arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

24小时视频压缩26.1倍,南大华为让机器人记住物体去向

作者:arXivDaily编辑部 arXiv 2609.04802 cs · cs.AI · cs.CV

论文导读

南京大学、华为、天津大学与不列颠哥伦比亚大学团队提出语言轨迹编码LTE,把长视频中的物体位置、状态与语义压成可查询记忆。论文报告8.7至26.1倍压缩,24小时视频查询低于1秒;但在SMB上的两类成功率只有45.3%和48.7%,长时记忆远未稳定。

机器人若保存每一帧,很快会被一天的视频淹没

家庭或仓库机器人要回答“洗过的苹果放哪了”“昨天卧室发生过什么”,既要记住空间,也要记住物体随时间的变化。逐帧保存视觉特征成本随时长增长;每次查询再让视觉语言模型扫描所有片段,延迟和费用也会不断上升。

LTE不把视频当连续胶卷,而把每个物体的经历写成轨迹。静态房间结构用八叉树压缩;移动物体只在状态显著变化时保留语言描述、空间坐标与视觉锚点。查询先通过文字找到相关物体和事件,再回到少量视觉证据核验。

图:论文框架图分别展示静态空间压缩、动态物体轨迹和时间锚点抽样。

差分记忆只记录“发生变化的时刻”

厨房墙面、柜体和房间边界长时间不变,重复存储没有意义;苹果从水槽移到台面、钥匙从桌上被拿走,则是查询最需要的节点。LTE根据语义、位置和外观变化稀疏采样,把密集观测压成一条有时间顺序的对象记录。

这种设计支持多种问题:自然语言定位NLQ寻找描述过的片段,视觉查询VQ2D用物体图像追踪出现位置,时空推理STR回答多个对象或事件之间的关系,长范围总结LOR则概括一段时间内的活动。不同任务共享同一记忆,而不是分别建立索引。

图:论文定性结果对比LTE、真值和基线在语言定位、视觉查询与时空推理中的检索。

24小时数据亚秒查询,压缩率最高26.1倍

论文在Ego4D等第一视角数据和长时扩展设置上测试。相对密集存储,LTE实现8.7至26.1倍轨迹压缩;在24小时视频上,单次查询延迟低于1秒,示例值为0.43秒,记忆占用约134MB。数字说明稀疏对象轨迹能把查询成本与原视频时长部分解耦。

不过压缩会丢信息。在SMB评测中,两类任务成功率分别为45.3%和48.7%,意味着系统仍会漏掉物体、混淆轨迹或选错锚点。标题中的26.1倍是报告区间上界,并非所有数据都能达到,也不能与视频编码器的像素压缩率直接比较。

图:论文主图把长视频帧、房间结构、物体轨迹和自然语言查询放在同一记忆视图中。

下一步:让长时记忆学会遗忘和回溯

LTE为家庭机器人、可穿戴助手和长期巡检提供了可解释方向:回答不仅给位置,还能指出对应时间锚点和画面。稀疏记录也更方便设置保存期限,对无关片段进行删除或脱敏。

真正部署还需解决身份持续跟踪、遮挡、多人移动物品和错误累积。若早期把两个相似杯子混为一物,后续语言轨迹会持续传播错误。系统应保留不确定性、允许回溯原视频,并在隐私敏感环境中明确哪些信息可以长期记忆。

参考资料

https://arxiv.org/abs/2609.04802