SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
SceneAlign: 在复杂视觉场景中将多模态推理对齐到场景图
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; University of Toronto(多伦多大学) ; University of New South Wales(新南威尔士大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 SceneAlign通过利用场景图进行结构干预,提升多模态推理在复杂视觉场景中的准确性和忠实性。
Comments Preprint