Question-Guided Evidence Acquisition for Multimodal Visual Question Answering
面向多模态视觉问答的问题引导式证据获取
机构 * Amazon Inc.(亚马逊公司)
AI总结 针对多模态视觉问答中模型读取文档不可靠的问题,提出Q-Guide智能体引导感知,在两个数据集上优于基线方法,且增益来自精准感知引导而非复杂控制逻辑。
大厂专区
面向多模态视觉问答的问题引导式证据获取
机构 * Amazon Inc.(亚马逊公司)
AI总结 针对多模态视觉问答中模型读取文档不可靠的问题,提出Q-Guide智能体引导感知,在两个数据集上优于基线方法,且增益来自精准感知引导而非复杂控制逻辑。