FALCONEye: Finding Answers and Localizing Content in ONE-hour-long videos with multi-modal LLMs
FALCONEye: 在一小时内视频中寻找答案并定位内容的多模态大语言模型
机构 * DIIS-I3A, University of Zaragoza(DIIS-I3A,西班牙阿利坎特大学)
专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV
AI总结 FALCONEye通过多模态大语言模型在小时长视频中高效定位内容并回答问题,超越现有模型性能并显著降低推理成本。