Reconstruction as a Bridge for Event-Based Visual Question Answering
重建作为事件驱动视觉问答的桥梁
机构 * Peking University(北京大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学)
专题命中 视觉问答 :visual question answering(title);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出基于重建的框架,通过FRT和ART方法提升事件驱动视觉问答性能,并引入EvQA基准验证其有效性。