arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

修图AI终于敢说做不到:VisTA拒绝93%的无解要求

作者:arXivDaily编辑部 arXiv 2610.07887 cs · cs.AI · cs.CL · cs.CV

论文导读

南加州大学、加州大学圣迭戈分校研究了修图AI遇到无解要求时会不会停手,并训练出VisTA-BAGEL。模型先检查要求能否成立,再决定生成图片或说明矛盾。在DoD测试中,它无须额外提醒就能拒绝93%的不可行请求,同时完成74.3%的可行编辑,让“敢说做不到”和“能把图改好”一起接受评测。

图里没有第二个人,就别假装存在

让图片中的第二个人转身,前提是画面确实有第二个人。如果只有一个人,又要求其他内容保持不变,模型无法同时满足这些条件。随便改现有角色,或先添加一个人再修改,都会偏离原请求。

研究把这种情况称为视觉弃权:模型判断没有符合全部约束的输出,明确说明不能完成,并停止生成图片。这里讨论的是任务本身是否有解,与内容审查或模型不会做某项编辑不同。

团队发现,现有模型常常继续执行。有的把不存在的物体描述得很具体,有的悄悄把原要求改成另一项能完成的编辑。输出看起来像做了事情,却没有回应输入与指令之间的冲突。

图:可通行和被墙阻断的迷宫,以及模型继续画路径或拒绝生成的示例。

1050对任务,只改能不能做成

DoD基准包含1050对可行与不可行请求,分为七类,每类150对。六类真实画面任务涵盖材质、介质互动、运动状态、姿态、空间排列和时间变化;另一类是迷宫。

真实画面配对保留同一输入图,主要改变指令。迷宫配对保留同一要求,在原本连通的路线里堵住一个格子。模型不能只凭某种表面词汇决定拒绝,必须对照画面与规则。

真实请求先经过模型交叉检查,再由人工审阅修订;迷宫连通性用程序验证。评测同时看可行任务能否编辑成功、无解任务能否拒绝,避免把“全部拒绝”当成好成绩。

图:七类任务中的输入、可行参考与不可行要求配对展示。

从0.4%拒绝到93%,可行编辑也提高

八款被测统一多模态模型在普通指令下,对无解任务的拒绝率都不超过1.7%。编辑表现最好的UniREdit-BAGEL完成68.4%的可行任务,却只拒绝0.4%的不可行请求。会修图与会发现任务无解,在这组测试中是两种能力。

VisTA使用38224对训练样本,每对都包含可行与相近的不可行例子。模型先写可行性判断,可行时继续生成目标图片,不可行时说明矛盾并结束。完成配对训练后,无提醒条件下拒绝率为93.0%,可行编辑成功率为74.3%,错误拒绝可行请求的比例为0.8%。

只用可行样本训练的对照版本能完成72.0%的编辑,却仅拒绝0.3%的无解任务。新增不可行样本才让模型学到停手。主要评测借助模型裁判,并做了人工一致性检查,结果仍限于这七类任务。

图:编辑成功率与无解请求拒绝率的散点对照,星形标出VisTA版本。

下一步,把可行性判断接到编辑流程前面

图片编辑系统可以在真正生成前,先核对目标物体、保护区域和任务规则。当条件冲突时,把原因告诉用户,用户就能改写需求或提供另一张输入,而不必反复得到看似合理的错误图。

这项研究展示了配对训练能兼顾拒绝与正常编辑。更广泛的实际请求还需要检查复杂约束、模糊指代和用户意图;当前成绩不能保证所有修图任务都能正确判断,但它提供了可分别测量编辑与拒绝的测试方式。

参考资料

https://arxiv.org/abs/2610.07887

https://visual-abstention.github.io

↑