arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

PAPERDAILY REPORTS

裁图别再套模板:华为、上交让AI在200张图上给出199种裁框

作者:arXivDaily编辑部 arXiv 2610.00582 cs · cs.CV

论文导读

上海交通大学、华为等机构提出CPIC,让裁图AI跳出固定网格,允许同一照片存在多种好构图。模型在二百张测试图上给出一百九十九种裁框。团队把人类偏好、主体保留和构图规则一起用于训练,让裁框可以在好构图附近灵活调整。

好构图不一定只有一个答案

一张照片可以紧紧框住人物,也可以留出环境,把人物放在三分线附近。训练数据却常只提供少量候选框,甚至把坐标限制在预先设定的网格上。

模型若只模仿这些标注,容易学会套用有限的裁框模板。论文在200张GAIC测试图上统计,Venus只输出43种不同坐标值、66种不同框;CPIC对应为157种坐标值、199种框。这组数据说明输出更灵活,不能单独证明每个框都更好看。

裁框轻移几像素,照片通常不会突然变坏;但一旦切掉脸或破坏主体边界,质量就可能明显下降。团队用连续偏好场描述这两种变化,同时保留多个可接受的构图方向。

图:论文图1用多组裁剪例子说明同图可有多种好构图、局部移动的连续变化和截断主体后的质量下降。

先找好构图,再教模型避开坏边界

方法先从已有高分裁框里找出几种不同构图,随后在附近小幅调整位置,综合学习到的偏好评分、构图规则与主体保留情况,寻找更合适的框。

它还主动构造坏例子:切断主体、让主体贴到不自然的边缘、丢掉有价值的背景,或反复使用低质量模板。裁框离好例子近、又远离这些坏边界时,得到更高的训练奖励。

模型先学习调整后的框,再通过强化学习尝试多个裁法,用相对奖励改进。底座是Qwen3-VL-2B-Instruct;训练使用CPC与GAIC,测试另外覆盖FLMS与FCDB,检查是否只记住了训练集标注者的口味。

图片效果和用户选择分开看

论文的日落案例里,各方法保留的天空、水面与飞鸟比例不同;狐狸案例则比较主体与周围空地的关系。CPIC给出的框保留了可见主体和适当环境,这些案例展示构图差异,不代表所有照片都有相同表现。

图:论文图4比较日落飞鸟与狐狸照片在不同方法下的裁剪结果,展示背景留白和主体保留差异。

四个基准的11列指标中,作者报告CPIC有10列排在第一或第二。GAIC的部分指标更偏好匹配原有网格,CPIC并未拿下全部指标;判断裁图效果还需要同时看跨数据集表现和人类选择。

第一项用户研究允许参与者为每张图选择一到三种喜欢的结果,CPIC获得46.3%的选择率,高于比较方法中的UNIC 42.0%。这是可多选实验的选择比例,不是二选一胜率。第二项实验比较原标注与校准后的CPICD,后者获64.5%偏好,原标注为35.5%。

交互裁图应用:用一句反馈继续改裁框

团队还在附录展示了交互裁图:第一次裁剪后,用户要求完全排除最左侧人物,并紧框三位乐手,模型再次调整画面。另一个例子要求用两句话说明构图理由,回答提到孩子剪影、围栏和明暗关系。

图:论文图5上方展示剪影照片的裁剪与解释,下方按用户反馈排除左侧人物并重新框住三位乐手。

这类展示让裁图从一次输出变成可修正的过程。输入仍是原照片,生成的是裁框与可选解释,没有凭空补出被裁掉的图像内容。

CPICD则给研究者提供另一套经连续调整的测试标注。作者的办法依赖已有评分模型、目标检测和构图约束,审美偏好仍有主观性。后续工具若接入这种反馈,仍需允许用户保留不同构图,而不能把单一评分当成唯一的摄影标准。

参考资料

https://arxiv.org/abs/2610.00582

https://arxiv.org/html/2610.00582

https://arxiv.org/pdf/2610.00582

https://github.com/zzqingz/CPIC

↑