Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification
澄清或回答:基于上下文不充分的代理视觉问答强化学习
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
AI总结 CoA通过强化学习解决上下文不充分的视觉问答问题,通过生成聚焦问题澄清歧义,提升问答准确性。
高校专区
澄清或回答:基于上下文不充分的代理视觉问答强化学习
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
AI总结 CoA通过强化学习解决上下文不充分的视觉问答问题,通过生成聚焦问题澄清歧义,提升问答准确性。
具有认知启发的标记克服了多模态模型中的自我中心偏差
机构 * Department of Psychology University of Washington(心理学系华盛顿大学)
AI总结 本研究通过引入视角标记,提升多模态模型在空间推理任务中的表现,实现更人样的空间认知能力。
OmniView: 一种用于3D和4D视图合成的全视角扩散模型
机构 * University of Washington(华盛顿大学) ; Snap Inc.(Snap公司)
AI总结 OmniView是一种统一的扩散模型,能够泛化多种4D一致性任务,通过空间、时间和视图条件的灵活组合提升视频生成质量与相机控制精度。
Comments Project page: https://snap-research.github.io/OmniView/