arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

视频智能体看一小时后还记得什么?小红书等团队做了场硬测

arXiv 2608.05703 cs.CV

一段视频平均88.8分钟,问题没有选择项,还可能要求模型回忆半小时前的画面或主动发出提醒。香港科技大学、小红书、香港大学和香港中文大学推出StreamArena,用243段完整视频和3646个开放题测试流式视频智能体。

现有基准多用短片和选择题,模型只处理最后四帧也可能追平复杂系统。StreamArena把实时感知、历史回溯、主动交互和工具使用放进同一条连续音视频流,答案必须符合提问当时可获得的证据。

所有视频至少一小时,证据和提问分别标时间

数据覆盖影视、教程、发布会、电商直播、第一视角、体育、访谈七类内容。视频最长134.2分钟,189段为中文音轨。30名博士级标注员起草问题,两名独立标注员交叉回答和纠错,第三人盲审;约27%的草稿被淘汰。

StreamArena任务与数据总览

论文图1:红框是回答所需证据,蓝框标记提问或主动响应发生的时刻。

每个问题都记录查询时间和证据时间。模型若在事件发生前就读取未来片段,即使答对也不算合格。开放式回答还减少了从选项文字反推答案的捷径。

记最近画面、写文字摘要,都各有代价

只保留近期帧的系统响应快,却无法找回很久以前的事件。AURA的历史回溯准确率在五分钟内为25.4%,证据间隔超过30分钟后降到10.5%。把过去画面压成文字能节省存储,但颜色、位置和细节会被摘要丢掉;反复压缩视觉记忆也会积累损失。

团队设计StreamMind,把前台交互和后台记忆分开。前台处理当前请求与持续监控,后台异步写入分层事件、实体关系和关键帧,并负责召回与外部搜索。

StreamMind双层架构

论文图2:前台负责低延迟交互,后台持续构建可检索的多模态记忆。

四项能力领先,绝对成绩仍不高

在共享Qwen3.5-397B-A17B骨干的比较中,StreamMind相对各项最强流式基线提升53.7%至228.1%,汇总查询延迟降低66.2%。这些是相对增幅,基线绝对分数普遍偏低,不能解读成四类任务已接近解决。

输入规模与推理设置诊断

论文图3:诊断子集比较帧数、分辨率和推理模式变化对准确率的影响。

数据以中英文网络长视频为主,工具任务还依赖搜索环境和模型骨干。它更适合诊断系统设计取舍,尚不能代表摄像头、机器人或可穿戴设备全天运行时的可靠性。

参考资料

https://arxiv.org/abs/2608.05703