论文导读
微软研究院、悉尼大学、复旦大学等机构提出VibeEdit,让用户在图片上圈选、涂抹并写短注释,直接告诉AI改哪里、怎么改。在419个测试案例中,自动评审得分达到79.9,未编辑区域的保真指标为32.8dB。同类物体挤在一起时,圈选能更直接地指定修改目标。
三把椅子,只改中间那一把
VibeEdit的示例把一间摆着三把椅子的房间交给AI。用户圈住中间的椅子,旁边写下要改成蓝色的要求。输出中,中间椅子的颜色改变,其他椅子和房间布置继续保留。位置不必再靠一长串描述来确认。
这套输入叫画布指令,包含空间标记和可选短注释。圆圈可以选中物体或空区域,涂抹可以指定移除对象,箭头可以表达移动的起点和终点。添加、删除、替换、属性修改、移动五类操作都使用同一个入口。
“无需单独文本提示”仍允许在画面里写字。短注释负责说明要换成什么、改成什么颜色,圈选负责说明目标在哪里。两种信息靠近同一个对象,减少在多个相似物体之间反复定位的麻烦。
图:上方展示圈选中间椅子并改色,下方列出添加、删除、替换、改属性和移动的输入输出。
原图和笔迹分开读,改完不留圈
训练模型时,团队让它分别读取干净原图和指令图层,再结合带标记图片的整体含义完成编辑。原图提供物体外观,单独的标记层提供位置关系,生成目标不应包含那些圈线、箭头和笔迹。
研究构建了约155万对编辑前后图片,每对带有目标物体范围和结构化描述。训练时重新绘制不同形状、粗细和字体的指令,使模型接触同一操作的多种写法。用户实际使用时不需要提供精准贴着边缘的物体掩码。
后续训练同时检查三项结果:要求的修改是否完成、无关区域是否保持、修改处是否自然。只奖励“改出了新东西”,容易把其他区域也带着改;同时检查周边保留,才符合局部修图的使用要求。
图:训练流程分别编码原图和标记图层,并同时检查编辑完成、区域保留与局部质量。
419例自动评分,保留区域另算
评测专门强调从相似对象里选对目标,覆盖五种操作。VibeEdit自动评审得分为79.9,FireRed以完整外部文字指令作输入时为67.4;未编辑区域的PSNR分别为32.8dB和24.0dB,后者衡量输出与原图在保留区域的像素接近程度。
79.9是固定视觉语言模型回答检查问题后汇总的分数,并非79.9%的用户满意率。五类编辑先各自统计,再等权平均;所有方法每个案例生成一个结果。不同输入形式也在表格里分开,避免把画布输入与普通文字输入混为一谈。
定性对照图可见一些常见错误:标记留在输出上、修改了旁边的同类物体、移动后旧位置还留下复制品。论文展示这些案例用于说明哪里改错,整体性能仍以完整基准统计为依据。
图:五类编辑逐行对照不同模型输出,可见部分结果保留标记或修改了错误对象。
从局部修改走向更直接的画布操作
圈选和短注释给图片编辑提供了一个可检查的操作入口。设计稿、室内布置或商品图片中,用户可以先明确选中对象,再表达修改要求;论文已展示同一接口下的五类局部操作。
后续评测可以把手写指令、复杂背景和连续多次修改放在同一套任务里,观察上一轮编辑能否稳定保留。团队已有颜色变化和字体多样性的补充实验,画布操作可以沿着这些可复核的条件继续验证。