论文导读
兰州大学、中国矿业大学、深圳大学、新加坡国立大学等机构联合提出一种情绪可控图像方法,目标是只改变AI图片的情绪、不把内容一起换掉。方法用中性图作为语义锚点,在3300个提示词与情绪组合上降低情绪误差并改善CLIPScore;实验基于指定生成模型和自动指标,不能替代人对细微情感的判断。
情绪词越强,画面越容易跑偏
给同一句提示加上“悲伤”“兴奋”或“愤怒”,生成模型常会主动更换天气、人物、物体甚至构图。情绪更明显了,原本想保留的内容却消失。这种语义漂移让创作者很难制作同一场景的情绪版本,也不利于角色和广告素材保持一致。
研究先为原始提示生成一张中性图,把它当作内容参照。随后模型生成带目标情绪的图像时,不只判断情绪是否到位,还比较新图与中性图在主体、布局和语义上的接近程度。
论文源文件样例:中性条件下的画面为后续情绪控制提供内容参照。
一张中性图像给内容踩刹车
可以把训练目标理解为两条同时生效的反馈。第一条要求图像更符合目标情绪,第二条要求它不要偏离中性锚点的核心内容。强化学习根据两类反馈更新生成策略,避免模型只追求“感觉强烈”而牺牲语义。
锚点不是要求像素完全相同。光照、颜色和人物表情可以改变,关键物体、场景关系与提示含义应尽量保留。这给模型留下视觉创作空间,同时为“别换题”提供约束。
论文源文件样例:目标情绪改变画面氛围和人物状态,用于观察内容是否随情绪控制发生漂移。
论文还比较有无锚点和多种奖励组合,确认改善并非只来自让情绪更弱。若模型简单把所有画面调回中性,情绪误差会变差;方法要在情绪强度和内容保持之间找到平衡。
3300组组合同时测感觉和内容
实验覆盖3300个提示词与情绪组合,并使用情绪识别误差和CLIPScore等指标。论文报告,方法降低了情绪误差,同时相对EmotiCrafter提高CLIPScore,说明目标情绪更接近要求时,文字与图像的语义匹配没有被同等牺牲。
论文源文件定性结果:在海滩主题中调整情绪氛围,同时保留主要场景元素。
自动指标仍有边界。CLIPScore更擅长判断大体语义,不一定捕捉角色身份、物体数量和局部构图的一致;情绪分类器也可能受色调或天气线索影响。3300组结果说明方法在该测试范围内有效,不代表每一种文化语境和复合情绪都能准确控制。
下一步是支持连续情绪和角色一致性
这类控制可用于故事分镜、游戏美术、营销素材和心理教育内容。下一步需要让用户连续调节情绪强度,处理“紧张但 hopeful”这类混合状态,并在多张图中保持同一角色和场景。
产品化时还应保留中性原图、目标描述和每次修改记录,让创作者能回退并比较。情绪控制不应变成暗中重写内容,而应像一个可解释、可撤销的视觉旋钮。