arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

视频AI太爱抢答:6个系统里4个提前响应多过漏报

作者:arXivDaily编辑部 arXiv 2609.12658 cs · cs.LG

论文导读

北京航空航天大学、阿里巴巴提出ProactiveBench,专门测试视频AI什么时候该开口。六个系统中有四个“提前响应”比“错过事件”更常见,比例从2.1倍到28倍;基准揭示的是受控视频任务中的时间判断,不等同于真实产品已造成同等风险。

答对内容,也可能答错时间

传统视频问答通常在视频结束后提问,系统只需回顾发生了什么。主动式助手更难:用户提前下达条件,比如“女孩完全踏上第一级台阶时告诉我”,AI必须持续观看,在事件真正完成的那一刻响应。

如果它在脚还没落稳时就回答,内容看起来接近正确,时机却错了;如果事件已经发生仍沉默,则是漏报。ProactiveBench把视频按时间切成连续观察点,每秒检查一次系统是否应该说话。

论文图:在人物踏上台阶的事件中,事件前应保持沉默,进入目标窗口后才应响应。

新基准把“闭嘴”也算成能力

每个样本包含视频、用户条件和一个可接受的响应窗口。窗口之前,正确行为是保持沉默;窗口内,系统应给出回应;错过窗口后再答,也不能当作完全正确。这样的设计把“是否理解内容”和“是否把握时机”分开。

团队还区分提前、窗口内和漏报三种结果。这样可以看出两个总分相近的模型究竟哪里不同:一个可能谨慎但经常错过,另一个可能积极却总爱抢答。对于实时助手,这种行为差异比单一准确率更重要。

论文图:六个受测系统在提前响应、窗口内响应和漏报三类行为上的占比。

四个系统更怕漏掉,所以先说了

论文测试六个系统,其中四个的提前响应次数多于漏报,二者比例在2.1倍到28倍之间。这个结果说明不少模型把“看到相关线索”误当成“事件已经完成”,或者训练目标鼓励它们尽快给出有帮助的答案。

这种倾向在日常提醒里可能只是烦人,但在烹饪、设备操作或无障碍辅助中,过早提醒会改变用户行为。系统说“水开了”与说“水快开了”不是同一件事,模型需要识别状态变化,而不仅是相关物体。

论文PDF:任务定义围绕主动视频理解、事件窗口和多系统时机评测展开。

实验也有边界:视频片段和指令经过基准设计,响应以固定频率检查,真实产品还会受到摄像头延迟、网络和用户表达差异影响。2.1至28倍不能直接外推为线上事故概率。

下一步要给主动助手装上时间校准

更可靠的做法,是让模型同时输出“事件发生概率”和“是否现在响应”的置信度,并允许在不确定时继续观察。产品还可以按风险分级:娱乐提醒可以积极,医疗和设备控制则必须等待更强证据。

未来基准需要加入更长视频、多个事件重叠、事件反转和用户中途改口。只有把等待、确认和纠错也纳入训练,视频AI才会从“会看”升级成“知道什么时候该说”。

参考资料

https://arxiv.org/abs/2609.12658

https://arxiv.org/html/2609.12658

https://github.com/v0yager33/ProactiveBench