Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos
错误归因:第一性错误理解在第一人称视频中
机构 * University of Michigan(密歇根大学) ; Voxel51
AI总结 本文提出MATT任务,通过细粒度分析第一人称视频中的人类错误,开发MisEngine数据引擎生成带有归因注释的错误样本,并提出MisFormer模型在语义、时间和空间维度上实现统一的错误归因,实验表明其在视频语言理解等任务上优于现有方法。
Comments 12 pages, 5 figures, 7 tables. Accepted to CVPR 2026