CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering
CRAFT: 基于批评的自适应关键帧目标定位用于多模态视频问答
机构 * University at Buffalo(布法罗大学) ; New York University(纽约大学)
AI总结 该研究提出CRAFT方法,通过动态关键帧选择、每视频ASR与多语言回退以及混合批评循环,迭代验证和修复声明,最终实现多模态视频问答的准确证据聚合。
Comments Accepted at ACL 2026 Multimodal Augmented Generation via MultimodAl Retrieval Workshop