Do-Undo Bench: Reversibility for Action Understanding in Image Generation
Do-Undo基准:图像生成中动作理解的可逆性
机构 * York University(约克大学) ; Vector Institute for AI(人工智能向量研究所) ; Qualcomm AI Research(高通人工智能研究)
AI总结 本文提出Do-Undo任务和基准,解决视觉-语言模型在理解并生成由现实动作驱动的场景变换中的关键缺口。通过要求模型模拟现实动作的后果并逆转至原始状态,测试真正的因果理解。实验表明当前模型在动作可逆性上存在困难,凸显评估动作理解的必要性。
Comments Project page: https://s-mahajan.github.io/Do-Undo-Bench/