arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-09 至 2026-02-09 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 5 篇

2506.11924 2026-02-09 cs.CV 77%

Aligned Novel View Image and Geometry Synthesis via Cross-modal Attention Instillation

通过跨模态注意力安装实现对齐的新视角图像和几何合成

Min-Seop Kwak, Junho Kim, Sangdoo Yun, Dongyoon Han, Taekyung Kim, Seungryong Kim, Jin-Hwa Kim

机构 * NAVER AI Lab(NAVER AI实验室) KAIST AI(韩国科学技术院人工智能学院) SNU AIIS(首尔国立大学人工智能研究所)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散的框架,通过跨模态注意力蒸馏实现新视角图像和几何的对齐生成,提升几何鲁棒性和重建质量。

Comments Project page at https://cvlab-kaist.github.io/MoAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06850 2026-02-09 cs.CV cs.AI cs.MM 73%

Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping

重新思考多条件DiTs:通过位置对齐和关键词范围消除冗余注意力

Chao Zhou, Tianyi Wei, Yiling Chen, Wenbo Zhou, Nenghai Yu

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出PKA框架,通过位置对齐和关键词范围注意力消除多条件生成中的冗余,提升效率并减少资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13486 2026-02-09 cs.CV cs.CL cs.GR 73%

T$^3$-S2S: Training-free Triplet Tuning for Sketch to Scene Synthesis in Controllable Concept Art Generation

T$^3$-S2S:无训练三元组微调用于可控概念艺术生成中的草图到场景合成

Zhenhong Sun, Yifu Wang, Yonhon Ng, Yongzhi Xu, Daoyi Dong, Hongdong Li, Pan Ji

机构 * Australian National University(澳大利亚国立大学) Vertex Lab(Vertex实验室) University of Technology Sydney(悉尼大学)

专题命中 可控生成 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 本文提出T3-S2S方法,通过三元组微调实现可控概念艺术生成中的草图到场景合成,提升多实例场景生成的可控性和细节精度。

Comments https://openreview.net/forum?id=lyn2BgKQ8F

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06101 2026-02-09 eess.IV cs.CV cs.MM 62%

ALIEN: Analytic Latent Watermarking for Controllable Generation

ALIEN: 基于可控生成的分析潜在水印

Liangqi Lei, Keke Gai, Jing Yu, Qi Wu

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) School of Information Engineering, Minzu University of China, Beijing, China(中国民族大学信息工程学院) School of Computer Science, The University of Adelaide, Adelaide, Australia(阿德莱德大学计算机科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 ALIEN提出了一种基于可控生成的分析潜在水印方法,通过时间依赖调节系数实现可控的水印嵌入,实验结果显示其在多个质量指标和鲁棒性方面均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06419 2026-02-09 cs.CV 57%

Learning Human Visual Attention on 3D Surfaces through Geometry-Queried Semantic Priors

通过几何查询的语义先验学习人类在3D表面上的视觉注意

Soham Pahari, Sandeep C. Kumain

机构 * UPES Dehradun(德里敦大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SemGeo-AttentionNet,通过几何查询语义先验,有效建模人类在3D表面的视觉注意,实现了显著性检测与扫描路径生成的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏