arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里让AI直接写出可编辑电商广告,设计图变成可执行代码

作者:arXivDaily编辑部 arXiv 2608.27893 cs · cs.CV

输入商品图、卖点文案和尺寸要求,模型不再输出一张难修改的扁平图片,而是直接写出可渲染的HTML/CSS广告。阿里巴巴、同济大学等机构提出CommerceVibe,让商品图片保持原样引用,文字以原生元素存在,运营人员可以继续换图、改字和调整布局。

模型先在28568个电商创意样本上监督微调,再用规则检查与视觉偏好组成的双反馈强化学习。1300项基准中,优化后加权分为94.0,监督微调版本为87.3。评价依赖自动规则、视觉语言模型和五位设计专家,没有真实广告投放的点击或转化数据。

扁平图片最难修的是文字和商品

扩散模型能生成有吸引力的海报,但商品包装可能被改形,文字容易拼错,卖点还可能凭空出现。结果若是一张合成图片,修改价格或替换商品需要局部重绘,品牌元素与文字也很难保持可编辑。

CommerceVibe把生成任务改写为程序合成。模型读取结构化需求,一次生成完整HTML/CSS;商品图通过文件引用嵌入,文本保留为可选择、可检查的字符,背景、装饰和布局由样式规则控制。渲染结果仍是一张广告,但背后有明确元素层级。

图1:模型从商品、文案和规格生成HTML/CSS,再渲染为可编辑电商创意。

规则反馈先抓可测错误

结构化输出让许多问题可以直接计算。规则检查器读取渲染后的元素位置与边界,检查文字是否溢出或重叠、字号是否过小、商品是否被裁切、多个商品是否互相遮挡、元素是否越出画布,以及底部是否留下异常空白。

单商品与多商品广告使用不同权重。单商品应保持视觉突出,多商品则要确保全部出现且互不遮挡。规则奖励能准确指出“哪里违反要求”,但无法独立判断配色是否协调、画面是否像广告或风格是否符合目标人群。

图2:规则反馈检查文本、商品和布局,视觉反馈评价整体感知与商业表达。

视觉模型补上审美与商业判断

第二路反馈由视觉语言模型查看渲染结果,按照六类感知与商业维度评分,包括需求一致性、视觉层级、风格相关性和整体完成度。两路信号共同进入GRPO训练:规则端惩罚明确结构错误,视觉端区分都满足规则时哪个方案更像成熟创意。

论文消融显示,只使用规则奖励能改善边界和遮挡,只使用视觉偏好更偏向整体观感;组合后两类指标同时提高。视觉裁判仍可能带有模型偏好,因此团队另外组织五位电商设计专家进行盲评,用人工结果检查自动评分方向。

下一步:把可编辑性带进真实设计流程

定性案例覆盖口红、床品等单商品与多商品需求。不同方法都能产出完整画面,但部分结果出现商品缺失、文字重叠或元素越界;CommerceVibe的结构更接近输入约束,原商品图也没有被模型重新绘制。

图3:单商品与多商品案例中,不同方法的结构错误和视觉结果对比。

专家盲评按案例比较多个系统,结果支持双反馈版本的整体提升。论文的94.0是内部加权自动指标,不是百分之九十四的真实投放成功率,也不能代表所有品类、品牌规范和中文字体环境。

图4:五位电商设计专家对多种生成方法的案例评分对比。

下一步可以把品牌色、字体许可、素材安全区和平台审核规则直接加入可执行约束,并在真实工作流测量首稿采用率、人工修改时长和投放转化。若代码输出在浏览器、设计工具和广告平台之间保持一致,模型最实用的角色会是生成可继续编辑的初稿,而非交付一张无法追溯元素来源的成片。

同时应保留字体授权、商品图来源和每次人工改动记录,避免自动化提高产量后,版权与品牌审计反而失去追踪线索。

参考资料

https://arxiv.org/abs/2608.27893

https://arxiv.org/html/2608.27893

https://arxiv.org/pdf/2608.27893