AttAnchor: Guiding Cross-Modal Token Alignment in VLMs with Attention Anchors
机构 * California Institute of Technology(加州理工学院) ; Stanford University(斯坦福大学)
专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
Comments 31 pages, 17 figures