Human-Aligned Generative Perception: Bridging Psychophysics and Generative Models
人类对齐的生成感知:连接心理学物理与生成模型
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出通过轻量级判别器引导生成模型,实现几何与风格的可控分离,提升文本到图像合成的语义对齐度。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
人类对齐的生成感知:连接心理学物理与生成模型
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出通过轻量级判别器引导生成模型,实现几何与风格的可控分离,提升文本到图像合成的语义对齐度。
多智能体语义情感对齐的音乐到图像生成与音乐衍生标题
专题命中 可控生成 :image generation(title);分类 cs.MM
AI总结 MESA MIG通过多智能体协作生成音乐到图像,实现语义和情感对齐,提升生成图像的审美质量和情感一致性。
Comments 10 pages,3 figures.Under review for ICME 2026
反向个性化
机构 * University of Trento(特伦托大学) ; University of Oulu(奥卢大学)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出反向个性化框架,通过条件扩散反向技术实现面部匿名化,支持属性可控的匿名化,平衡身份移除、属性保留和图像质量。
Comments WACV 2026
单目深度估计的视觉自回归建模
机构 * Friedrich-Alexander University Erlangen-Nuremberg, Germany(埃朗根-纽伦堡弗里德里希-亚历山大大学) ; Technical University of Munich, Germany(慕尼黑技术大学) ; University of Surrey, United Kingdom(萨里大学)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出基于视觉自回归先验的单目深度估计方法,通过自回归阶段和分类器自由引导实现高效深度估计,适用于室内和户外场景。
姿态引导的残差细化用于可解释的文本到运动生成与编辑
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 姿态引导的残差细化(PGR$^2$M)通过结合可解释姿态代码和残差代码提升文本到运动生成与编辑的保真度和可控性。