Large Scale GAN Training for High Fidelity Natural Image Synthesis
专题命中 文生图 :image synthesis(title,abstract)
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 文生图 :image synthesis(title,abstract)
专题命中 文生图 :image synthesis(title,abstract)
Comments This is a Masters Thesis read at the University of Malta
专题命中 文生图 :image synthesis(title,abstract)
Comments the text is written in Russian in AMSTEX with cyrillic fonts, 3 pages
GuardPaint:文本到图像生成的推测性安全解码
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 GuardPaint是一种无需修改基础模型的文本到图像生成安全防护框架,可在扩散轨迹内干预,通过轻量级审计器定位并修复不安全区域,在多类越狱提示词和主流T2I模型上显著降低有害内容生成且对图像质量影响极小。
CASCADE:基于上下文的放松方法用于推测图像解码
机构 * AMD(AMD公司)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出CASCADE方法,通过捕捉目标模型隐藏状态中的冗余性,在不额外训练的情况下实现接受放松,提升推测解码效率,实验表明在多模态模型中达到3.6倍加速,保持图像质量和提示一致性。
伪统一:熵探测揭示统一多模态模型中分歧的信息模式
专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV
AI总结 研究揭示统一多模态模型中伪统一现象的根源,通过信息论方法分析输入编码和输出生成,发现模态不对称编码和响应模式分裂是导致分歧的主要原因,强调信息流一致性对真实多模态协同的重要性。
PRADA:基于概率比的自回归生成图像归因与检测
机构 * Ruhr University Bochum(波鸿鲁尔大学)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出PRADA方法,通过分析自回归生成图像的概率比特征,实现对生成图像的可靠检测和归因,适用于多种图像生成模型。
Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition - Findings Track (CVPRF 2026)
ViHOI:基于视觉先验的人-物交互合成
机构 * South China University of Technology(华南理工大学)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 ViHOI通过从2D图像中提取丰富的交互先验,利用扩散模型提升生成质量,实现人-物交互的高质量合成。
Comments Accepted to CVPR 2026
ADAPT:基于注意力的自适应提示调度与稀有概念生成的插值正交补集
机构 * Hanyang University(翰阳大学)
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 ADAPT框架通过确定性提示调度和语义对齐,提升稀有概念生成效果,无需额外训练,在RareBench基准上表现优异。
Comments Accepted in CVPR 2026 (findings). 10 pages, 4 figures; supplementary material included (8 pages, 10 figures)
BitDance: 通过二进制令牌扩展自回归生成模型
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 BitDance通过二进制令牌生成高熵表示,结合二进制扩散头和next-patch扩散方法,实现高效图像生成,达到最佳FID分数并显著提升推理速度。
Comments Code and models: https://github.com/shallowdream204/BitDance
Delta-K: 通过交叉注意力增强提升多实例生成
机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) ; Nanjing University(南京大学) ; College of Management and Economics, Tianjin University(天津大学管理学院)
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 Delta-K通过在交叉注意力键空间中直接操作,解决扩散模型在多实例生成中的概念遗漏问题,提升生成质量且无需额外训练或架构修改。
ClimaOoD: 通过物理真实合成数据提升异常分割
机构 * Beijing University of Chemical Technology(北京化工大学) ; Southwest Minzu University(西南民族大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 ClimaOoD通过生成物理真实且语义连贯的合成数据,提升异常分割的鲁棒性和泛化能力。
Comments Accepted by CVPR2026
RealHD:一个高质量数据集,用于鲁棒检测最新AI生成图像
机构 * Institute of Cyberspace Security, Zhejiang University of Technology(网络安全研究院,浙江工业大学) ; Intel Corporation(英特尔公司) ; College of Information Engineering, Zhejiang University of Technology(信息工程学院,浙江工业大学) ; Binjiang Institute of Artificial Intelligence, ZJUT(滨江人工智能研究所,浙江工业大学)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);inpainting(abstract);分类 cs.CV
AI总结 RealHD数据集通过高质量图像和先进生成方法,提升AI生成图像检测的鲁棒性和泛化能力,并提出基于噪声熵的轻量级检测方法。
Comments Published in the Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025)
Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACM MM 2025), 2025, pp. 11394--11403
弥合词汇歧义与视觉:关于视觉词义消歧的简要综述
机构 * School of Computing Informatics(计算与信息学学院) ; Institute of Technology(技术研究所)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文综述了视觉词义消歧的发展,探讨了对比模型和LLM在解决词汇歧义中的作用,并指出未来发展方向。
Comments 2 figures, 2 Tables, Accepted at IEEE TIC 2026
弥合安全鸿沟:视觉自回归模型中的手术概念擦除
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Jilin University(吉林大学) ; Peng Cheng Laboratory(鹏城实验室) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出S-VARE方法,通过过滤交叉熵损失和保留损失实现VAR模型中的精确概念擦除,有效解决安全性和生成质量之间的平衡问题。
Comments Accepted toICLR 2026
统一的多模态理解和生成模型:进展、挑战与机遇
机构 * Alibaba Group(阿里巴巴集团) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Nanjing University(南京大学) ; Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文探讨了多模态理解和生成模型的统一进展、挑战与机遇,分析了不同架构范式及未来研究方向。
Comments In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models
APEX: 为视觉-语言生成中的多目标对齐学习自适应优先级
机构 * East China Normal University(东华师范大学)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 APEX通过双阶段自适应归一化和P^3自适应优先级,提升视觉-语言生成中多目标对齐的稳定性与性能平衡。
FluencyVE:将时间感知Mamba与旁路注意力相结合用于视频编辑
机构 * Waseda University, Japan(早稻田大学,日本) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 FluencyVE通过结合时间感知Mamba与旁路注意力,实现高效的视频编辑,减少计算成本并提升生成能力。
Comments Accepted by IEEE Transactions on Multimedia (TMM)
学习两个图像数据集之间的共同和显著生成因素
机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)
专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出了一种新的对比分析框架,用于学习两个图像数据集之间的共同和显著生成因素,适用于GAN和扩散模型,提升了生成质量与分离能力。
Comments This is the author's version of a work submitted to IEEE for possible publication. The final version may differ from this version
BitMark: 图像生成模型中位级水印技术
机构 * CISPA Helmholtz Center for Information Security(CISPA 河岸信息安全中心)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 BitMark通过位级水印技术防止图像生成模型中的模型崩溃,确保生成内容可检测。
Comments Accepted as a Conference Paper at NeurIPS 2025
DICE: 将分类器无关引导 distilling 进文本嵌入
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 DICE通过减少计算开销,在保持生成质量的同时,将基于CFG的文本到图像扩散模型转换为无CFG版本,提升图像生成效率。
Comments AAAI 2026 (Oral)
SYNAPSE: 适配器与微调协同实现高保真EEG信号到图像的合成
机构 * The Catholic University of Korea(韩国天主大学)
专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 SYNAPSE通过结合适配器与微调技术,实现了高保真EEG信号到图像的合成,提升了EEG数据的图像生成质量和跨受体泛化能力。
LightFusion: 一种轻量级、双融合框架用于统一多模态理解和生成
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; Tsinghua University(清华大学) ; Monash University(墨尔本大学) ; ByteDance Seed Project(字节跳动种子项目)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 LightFusion通过双融合机制实现轻量级多模态理解和生成,仅用350亿个标记训练即在多个基准测试中取得优异成绩。
Comments Preprint. Work in progress
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
Comments AAAI 2026, Project Page: https://henghuiding.com/FFSE/
机构 * Xidian University(西安电子科技大学) ; Shanghai Jiaotong University(上海交通大学)
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV
机构 * University of California Santa Cruz(加州大学圣克ruz分校) ; Northeastern University(东北大学) ; Accenture(Accenture公司)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * Computer Science Department University of Southern Maine Portland, United States(计算机科学系 俄亥俄州立大学 帕斯托市 美国) ; The Department of Computer Science University of Central Oklahoma Edmond, United States(计算机科学系 中央俄克拉荷马大学 埃德蒙德 美国)
专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
机构 * Tulane University(路易斯安那州立大学)
专题命中 文生图 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025
机构 * University of Surrey(塞雷尔大学) ; Simon Fraser University(西蒙弗雷泽大学) ; University of Copenhagen(哥本哈根大学)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments Accepted at NeurIPS 2025