arXivDaily arXiv每日学术速递 周一至周五更新
紧急更新!大量爬虫把网站搞的很不稳定,部分功能限制为登录后才能使用,如高级检索等

PAPERDAILY REPORTS

腾讯整理800万张风格图:15万种风格身份、100万条描述

作者:arXivDaily编辑部 arXiv 2609.01423 cs · cs.CV

同济大学、腾讯、南洋理工大学、香港科技大学联合提出MegaStyle++。团队用分层定义整理15万种整体风格身份、100万条细粒度风格提示和800万张风格化图像,希望把“风格”从模糊标签变成可解释结构。

一个风格名很难描述画面

同样被称为水彩的图像,可能在颜色、纸张纹理、笔触、光照和构图上差异很大;反过来,不同名称也可能指向相似视觉属性。只给作品一个整体标签,会把内容主体和视觉风格混在一起。

MegaStyle++从整体风格身份向下拆到细粒度属性,用层级关系描述颜色、光照、纹理、媒介和笔触等因素。系统先判断整体身份,再补充能解释视觉差异的属性提示。

图:论文数据集图展示多类风格化图像。

800万图像来自扩展后的标注流水线

团队在MegaStyle基础上改造风格标注流程,得到15万种整体风格身份和100万条细粒度提示,并据此组织800万张风格化图像。论文用覆盖度、多样性和语义范围分析新定义是否扩展了风格空间。

这些数字描述数据集规模,并不代表15万种风格都由艺术史或专业机构独立认证。风格是人为建构概念,自动生成和标注流程可能保留模型偏好、近义标签与文化覆盖不均。

图:论文框架图从整体身份拆到细粒度属性。

层级提示可以帮助生成与检索

对图像生成模型,细粒度属性能把“像某种风格”拆成可控制条件;对检索和风格迁移,研究者可以比较整体身份一致但纹理、光照不同的样本,也能检查模型是否只记住内容类别。

论文展示了多样化样例、层级定义和风格复现分析。结果支持新表示在语义广度和多样性上优于原流程,但数据集与代码在摘要页写的是后续更新,现阶段应区分论文报告与可立即下载的完整资源。

图:论文结果图展示参考风格与复现样例。

下一步:数据开放后还要检查版权与覆盖

下一步首先是发布数据卡、来源说明、许可范围和过滤规则,让使用者知道图像如何产生、哪些部分可以训练商业模型。风格数据涉及创作者和作品语境,规模扩大不能替代授权与来源透明。

研究层面还可让艺术史研究者、设计师和不同文化背景的标注者检查层级词表,寻找同义、歧义和缺失类别。若生成模型能沿属性稳定控制而不复制具体作品,分层定义才真正成为可用接口,而不只是更大的标签集合。

数据集还应提供去重策略。800万张图像若包含同一底图的大量轻微变体,规模会增长,但模型获得的视觉信息有限;按内容、构图和风格分别去重,才能区分样本数量与有效多样性。

层级标签也可以用于反事实测试:保持主体不变,只修改纹理或光照,观察生成模型是否只改变目标属性。若一句细粒度提示同时改变人物身份或构图,说明风格与内容仍没有真正解耦。

未来版本可记录标注置信度和同义词关系,而不是强迫每张图只有唯一风格。对于边界模糊的视觉文化概念,保留多个合理描述比给出过度确定的标签更符合实际,也便于跨语言检索。

训练模型时还应允许按属性采样,避免高频风格身份支配梯度。数据卡可公布每个层级的数量、生成模型来源和人工复核比例,并为稀有类别设置独立测试集;这样才能判断模型学到的是风格结构,还是数据分布中最常见的颜色与题材。

当数据用于训练时,还要设置防止复制具体参考图的检查。风格相似可以来自颜色和笔触,但若人物、构图和局部细节高度一致,就可能变成记忆;近邻检索和生成样本审计应成为发布流程的一部分。

参考资料

https://arxiv.org/abs/2609.01423

https://github.com/Tencent/MegaStyle