arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-01 至 2025-12-01 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 6 篇

2511.23105 2025-12-01 cs.CV 88%

NumeriKontrol: Adding Numeric Control to Diffusion Transformers for Instruction-based Image Editing

NumeriKontrol: 为基于指令的图像编辑添加数字控制

Zhenyu Xu, Xiaoqi Shen, Haotian Nan, Xinyu Zhang

机构 * East China Normal University(华东师范大学) South China University of Technology(华南理工大学)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 NumeriKontrol通过引入数字控制框架,实现基于指令的图像编辑中对编辑强度的精确控制,提升交互编辑的灵活性和精度。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24657 2025-12-01 cs.CV 83%

Group Relative Attention Guidance for Image Editing

基于组相对注意力的图像编辑

Xuanpu Zhang, Xuesong Niu, Ruidong Chen, Dan Song, Jianhao Zeng, Penghui Du, Haoxiang Cao, Kai Wu, An-an Liu

机构 * Tianjin University(天津大学) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 GRAG通过组相对注意力机制实现对图像编辑强度的连续精细控制,无需额外调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23240 2025-12-01 cs.CV 79%

Autoregressive Styled Text Image Generation, but Make it Reliable

自回归风格文本图像生成,但使其更可靠

Carmine Zaccagnino, Fabio Quattrini, Vittorio Pippi, Silvia Cascianelli, Alessio Tonioni, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) Google(谷歌)

专题命中 图像编辑 :image generation(title);image editing(abstract);分类 cs.CV

AI总结 本文提出Eruku方法,通过多模态提示条件生成任务和分类器自由引导策略,改进自回归模型以生成更可靠、更忠实于文本提示的风格化文本图像。

Comments Accepted at WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23199 2025-12-01 cs.CV cs.AI 70%

Vision Bridge Transformer at Scale

大规模 Vision Bridge Transformer

Zhenxiong Tan, Zeqing Wang, Xingyi Yang, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 ViBT 是一种大规模 Bridge 模型,通过 Transformer 架构和方差稳定的速度匹配目标,实现高效图像和视频翻译任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22688 2025-12-01 cs.LG cs.AI 67%

Test-time scaling of diffusions with flow maps

扩散模型测试时间缩放与流映射

Amirmojtaba Sabour, Michael S. Albergo, Carles Domingo-Enrich, Nicholas M. Boffi, Sanja Fidler, Karsten Kreis, Eric Vanden-Eijnden

机构 * NVIDIA(NVIDIA公司) University of Toronto(多伦多大学) Vector Institute(向量研究所) Harvard University(哈佛大学) Kempner Institute(凯姆纳研究所) IAIFI(IAIFI机构) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学) Courant Institute, New York University(纽约大学应用数学学院) ML Lab at Capital Fund Management (CFM)(Capital Fund Management (CFM)机器学习实验室)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract)

AI总结 本文提出通过流映射改进扩散模型测试时间性能,通过流映射与速度场关系构建FMTT算法,实现更优奖励上升并支持复杂图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22237 2025-12-01 cs.CV 57%

Creating Blank Canvas Against AI-enabled Image Forgery

对抗AI图像伪造的空白画布创建

Qi Song, Ziyuan Luo, Renjie Wan

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出了一种基于Segment Anything Model的对抗性方法,通过将图像转换为空白画布来检测AI图像伪造,利用频率感知优化策略提升篡改定位能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏