Object-level Visual Prompts for Compositional Image Generation
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments Project: https://snap-research.github.io/visual-composer/
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments Project: https://snap-research.github.io/visual-composer/
专题命中 可控生成 :inpainting(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM
Comments ECCV 2024. Source code is available at https://github.com/Nnn-s/CATdiffusion
专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments 12 pages, 8 figures
专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV、cs.GR
Comments Accepted at CVPR'24
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments CVPR 2023. Project page available at: https://omriavrahami.com/spatext
专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR
Comments 44 pages
PoseAdapter:面向复杂多目标场景的双流2.5D可控图像生成
机构 * Tsinghua University(清华大学) ; National University of Defense Technology(国防科技大学)
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 PoseAdapter是一种轻量2.5D可控图像生成框架,通过双流表示解决多目标场景属性泄漏问题,构建OrientLayout数据集,在空间精度等指标上优于现有最优方法。
Comments 10 pages, 5 figures
语义引导用于可控生成:多模态扩散Transformer中的无调优概念擦除
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 该研究针对MM-DiTs的安全风险,提出一种无调优的概念擦除方法,通过在MM-DiT中间模块构建引导向量注入模型,实现高效鲁棒的概念擦除,性能优于现有方法。
Comments Accepted to ACM MM 2026
EmoScene:用于可控情感图像生成的双空间数据集
机构 * Fudan University(复旦大学) ; East China Normal University(华东师范大学)
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出EmoScene数据集,通过双空间编码情感维度与感知属性,提升文本到图像模型对场景语义和情感调制的控制能力。
WaterGen:水下图像生成中的场景与介质解耦
机构 * University of Maryland(马里兰大学) ; University of South Florida(南佛罗里达大学) ; University of Florida(佛罗里达大学)
专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 提出WaterGen方法,通过解耦场景生成和介质建模,在潜在扩散框架下生成大规模、真实、多样的水下图像,提升下游恢复和分割性能。
将人物组合在一起:面向多人交互场景的迭代姿态-图像生成
机构 * Cornell University(康奈尔大学)
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出一种双姿态-图像表示方法,将人物结构先验引入预训练扩散Transformer,通过跨模态对齐和迭代场景构建,提升多人交互图像生成的提示对齐度和场景多样性。
Comments Accepted to SIGGRAPH Conference Papers 2026. 22 pages, 12 figures. Project page: https://cornell-vailab.github.io/PeopleComposer/
姿态物体拼接:考虑装配关系的异常图像生成
机构 * Beijing Institute of Technology(北京理工大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Tsinghua University(清华大学)
专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出PostureObjectStitch方法,通过解耦多视角图像特征和引入条件损失与几何先验,实现工业场景中考虑装配关系的准确异常图像生成。
通过组合并行令牌预测实现可控图像生成
机构 * Durham University(杜伦大学)
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出一种理论指导的离散生成过程组合方法,通过掩码生成(吸收扩散)实现多输入条件的精确组合,提升图像生成的可控性和效率。
Comments 8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF)
CFG-Ctrl: 基于控制的分类器自由扩散引导
专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 CFG-Ctrl通过引入滑模控制方法改进分类器自由扩散引导,提升语义对齐和鲁棒性。
Comments Accepted by CVPR 2026; Project Page: https://hanyang-21.github.io/CFG-Ctrl
通过细粒度语义解耦实现视觉引导的可控医学图像生成
机构 * Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程系,中国沈阳) ; Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室,东北大学,中国沈阳) ; National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心,中国沈阳) ; AiShiWeiLai AI Research, China(艾世维来人工智能研究,中国) ; Amii, University of Alberta, Edmonton, Alberta, Canada(阿尔伯塔大学艾米人工智能研究所,加拿大埃德蒙顿,阿尔伯塔)
专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)
AI总结 本文提出视觉引导的文本解耦框架,通过细粒度语义解耦提升医学图像生成的可控性和生成质量。
Comments 10 pages, 7 figures. Currently under review
基于组件意识的草图到图像生成:使用自注意力编码和坐标保持融合
专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出了一种基于自注意力编码和坐标保持融合的组件意识框架,用于提升草图到图像生成的逼真度和一致性。
通过潜在向量预测实现扩散模型中的局部控制
专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出通过潜在向量预测实现扩散模型的局部控制,使模型能精准控制用户定义区域并自主生成剩余部分。
Sissi:通过语义-风格整合实现零样本风格引导图像合成
专题命中 可控生成 :image synthesis(title);image generation(abstract);diffusion(abstract);inpainting(abstract)
AI总结 Sissi通过语义-风格整合实现零样本风格引导图像合成,采用上下文学习框架提升风格化效果与语义一致性。
Adapter Shield: 一种集成了认证机制的统一框架,用于防止未经授权的零样本图像到图像生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shandong University(山东大学) ; Hefei University of Technology(合肥工业大学) ; East China Normal University(华东师范大学)
专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 Adapter Shield通过集成认证机制的统一框架,防止未经授权的零样本图像生成,实现安全的图像访问控制。
画布到图像:利用多模态控制的组合图像生成
机构 * Snap Inc. ; UC Merced(加州大学默塞德分校) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 Canvas-to-Image通过统一框架整合多模态控制,提升图像生成的组合性和控制精度。
Comments 24 pages; webpage: https://snap-research.github.io/canvas-to-image/
BideDPO:基于文本和条件对齐的同时图像生成
机构 * Zhejiang University(浙江大学) ; Harvard University(哈佛大学) ; Huawei Technologies Ltd., China(华为技术有限公司)
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV
AI总结 BideDPO通过双向解耦的DPO框架解决文本与条件间的冲突,提升图像生成的准确性和一致性。
Comments 29 pages
条件扩散中的后门:对负责任的合成数据管道的威胁
机构 * Raz Lapid ; Almog Dubin
专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出了一种针对ControlNet的模型污染攻击,通过后门生成攻击者指定内容,并提出CFT方法作为防御措施。
Comments Accepted at RDS @ AAAI 2026
Journal ref AAAI 2026 Workshop on Shaping Responsible Synthetic Data in the Era of Foundation Models
专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV
Comments Accepted by AAAI 2026
机构 * Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学)
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
Comments Accepted in NeurIPS 2025
机构 * National University of Singapore(国立新加坡大学) ; Sichuan University(四川大学)
专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV
Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025). Code is available at https://github.com/Lexiang-Xiong/Semantic-Surgery
机构 * Obvious Research(Obvious研究)
专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)
Comments Technical report after open-source release
机构 * Arizona State University(亚利桑那州立大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Google Deepmind(谷歌DeepMind)
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
机构 * Snap Inc.
专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)
Comments Accepted to SIGGRAPH Asia 2025, webpage: https://snap-research.github.io/composeme/