AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
机构 * Hunan University(湖南大学) ; South China Normal University(华南师范大学)
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments 14 pages, 5 figures