arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

英伟达测17个视觉模型:固定摄像头最难看懂时间

作者:arXivDaily编辑部 arXiv 2609.09396 cs · cs.AI · cs.CV

论文导读

英伟达、克莱姆森大学研究团队发布VANTAGE-Bench,用3346个媒体素材零样本评测17个视觉语言模型,场景覆盖仓库、交通和智慧空间。结果不是“工业视频全面更难”:视频问答和二维指点差距较小,缺口集中在事件验证、指代表达与时间定位;其中时间定位最高55.71 mIoU,密集视频描述最高37.28 SODA_c。结论应限定在这套固定摄像头协议内。

消费视频榜单没有覆盖固定摄像头的工作方式

主流视频基准往往围绕人物或主体拍摄,镜头会跟随动作,问题也常被整理成选择题。仓库顶角、道路杆件和公共空间里的固定摄像头不同:主体可能很小、长时间不动,真正重要的碰撞、越界或装卸事件只占视频的一小段。系统不仅要说出“发生了什么”,还得指出事件何时发生、目标在哪,以及长时间跟踪中有没有跟丢。

VANTAGE-Bench把这种需求拆成八类任务,分属语义、空间、时间和时空四根能力支柱。从视频问答、事件验证,到目标检测、指代表达、时间定位、密集视频描述和单目标跟踪,输出不再都能靠选项猜中。它因此测的不是一个总分,而是固定摄像头应用会在哪一环断掉。

图1:论文给出的八类任务实例,分别覆盖语义、空间、时间与时空理解。

3346个素材连接三类场景和三套标注

数据集覆盖物流仓库、交通道路与智慧空间,共有3346个媒体素材。论文报告三种标注规模:3342条视频任务标注、4281条图像定位标注和27404个检测框。固定摄像头素材包含高位、广角、夜间和雨天等条件;大部分由专业人员标注,二维指点问题则由人工框坐标确定性生成。

图2:三类运营场景连接八项任务,右侧列出各任务的样本与标注规模。

约20%的视频问答与时间定位切分使用高保真合成数据,用来补充现实中罕见、又涉及隐私或安全风险的事故事件。真实视频来自两座美国城市和经许可的公开素材,并经过个人信息模糊与复核。公开数据受英伟达评测数据许可约束,只能用于评测和基准研究;这意味着企业不能把数据集直接当成训练素材库。

17个模型的差距集中在时间能力

团队把12个开放权重模型和5个闭源模型放在相同零样本协议下比较。主结果显示,最佳二维目标定位由开放权重的Cosmos3-Super取得86.97,二维指点最高为81.90;模型规模和是否闭源,并不能单独解释所有差异。相反,时间定位与密集视频描述的上限明显更低:GPT-5.6 Sol分别达到55.71 mIoU和37.28 SODA_c,仍是两个时间任务中的最高值。

图3:论文主结果表;17个模型在八项任务上的表现差异明显,时间定位和密集视频描述列的最高值较低。

与消费视频基准相比,事件验证、指代表达和时间定位在不同模型规模上约低9至24分;但视频问答与VideoMME的差距不超过5.3分,二维指点相对BLINK没有出现缺口。这组对照说明,不能把“工业固定镜头”笼统说成更难:短板集中在需要持续追踪时间边界、把语言对应到具体目标的任务上。

未来部署要按任务验收,而不是只看综合榜单

仓储安全、交通日志或门店运营系统若只拿通用视频问答成绩做选型,可能会漏掉真正影响业务的时间定位和长时跟踪问题。更稳妥的流程是先按固定机位、目标尺寸、视频长度和事件稀有度切分测试,再分别设置事件召回、定位重合度与跟踪稳定性门槛;综合分只能用于排序,不能替代逐项验收。

论文还发现,专门的目标跟踪器在短时间窗口里只比前沿模型高约5分,但窗口拉长后差距扩大。后续若加入更长视频、跨摄像头关联和真实在线流,就能进一步判断问题来自模型能力、提示与输出格式,还是训练数据里缺少密集时间标注。对部署团队而言,VANTAGE-Bench最直接的价值不是宣布谁赢,而是把固定摄像头AI的失败位置变得可测。

参考资料

https://arxiv.org/abs/2609.09396

https://arxiv.org/html/2609.09396

https://vantage-bench.org/

https://huggingface.co/datasets/nvidia/PhysicalAI-VANTAGE-Bench

https://github.com/Clemson-Capstone/VANTAGE-Bench