arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3486 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3486 篇

2510.06827 2025-10-09 cs.CV 77%

StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance

Jaeseok Jeong, Junho Kim, Gayoung Lee, Yunjey Choi, Youngjung Uh

机构 * Yonsei University(延世大学) NAVER AI Lab(NAVER AI实验室)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICCV 2025; CVPRW AI4CC 2024 (Best Paper + Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18639 2025-09-26 cs.CV 77%

Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation

Yuanhuiyi Lyu, Chi Kit Wong, Chenfei Liao, Lutao Jiang, Xu Zheng, Zexin Lu, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Hong Kong Research Center(华为香港研究中心)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16197 2025-09-22 cs.CV cs.CL cs.LG 77%

MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer

Yanghao Li, Rui Qian, Bowen Pan, Haotian Zhang, Haoshuo Huang, Bowen Zhang, Jialing Tong, Haoxuan You, Xianzhi Du, Zhe Gan, Hyunjik Kim, Chao Jia, Zhenbang Wang, Yinfei Yang, Mingfei Gao, Zi-Yi Dou, Wenze Hu, Chang Gao, Dongxu Li, Philipp Dufter, Zirui Wang, Guoli Yin, Zhengdong Zhang, Chen Chen, Yang Zhao, Ruoming Pang, Zhifeng Chen

机构 * Apple(苹果公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15537 2025-09-05 cs.CV 77%

MUNBa: Machine Unlearning via Nash Bargaining

Jing Wu, Mehrtash Harandi

机构 * Department of Data Science & AI(数据科学与人工智能系) Department of Electrical and Computer Systems Engineering(电气与计算机系统工程系)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08505 2025-08-26 cs.CV eess.IV 77%

Yuan: Yielding Unblemished Aesthetics Through A Unified Network for Visual Imperfections Removal in Generated Images

Zhenyu Yu, Chee Seng Chan

专题命中 文生图 :text-to-image(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

Journal ref AAAI 2025, Vol. 39, No. 9, pp. 9716-9724

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03320 2025-08-06 cs.CV 77%

Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation

Peiyu Wang, Yi Peng, Yimeng Gan, Liang Hu, Tianyidan Xie, Xiaokun Wang, Yichen Wei, Chuanxin Tang, Bo Zhu, Changshi Li, Hongyang Wei, Eric Li, Xuchen Song, Yang Liu, Yahui Zhou

机构 * Multimodality Team, Skywork AI(Skywork AI 多模态团队)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02324 2025-08-05 cs.CV 77%

Qwen-Image Technical Report

Chenfei Wu, Jiahao Li, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kun Yan, Sheng-ming Yin, Shuai Bai, Xiao Xu, Yilei Chen, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhengyi Wang, An Yang, Bowen Yu, Chen Cheng, Dayiheng Liu, Deqing Li, Hang Zhang, Hao Meng, Hu Wei, Jingyuan Ni, Kai Chen, Kuan Cao, Liang Peng, Lin Qu, Minggang Wu, Peng Wang, Shuting Yu, Tingkun Wen, Wensen Feng, Xiaoxiao Xu, Yi Wang, Yichang Zhang, Yongqiang Zhu, Yujia Wu, Yuxuan Cai, Zenan Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

Comments https://github.com/QwenLM/Qwen-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12283 2025-07-17 cs.CV 77%

FADE: Adversarial Concept Erasure in Flow Models

Zixuan Fu, Yan Ren, Finn Carter, Chenyue Wang, Ze Niu, Dacheng Yu, Emily Davis, Bo Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21356 2025-07-16 cs.CV cs.AI 77%

Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space

Hong Zhang, Zhongjie Duan, Xingjun Wang, Yuze Zhao, Weiyi Lu, Zhipeng Di, Yixuan Xu, Yingda Chen, Yu Zhang

专题命中 文生图 :diffusion(abstract);image editing(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09595 2025-07-15 cs.CV 77%

Demystifying Flux Architecture

Or Greenberg

机构 * Hebrew University of Jerusalem(耶路撒冷希伯来大学) General Motors R&D(通用汽车研发)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00751 2025-06-24 cs.CV 77%

InstructAttribute: Fine-grained Object Attributes editing with Instruction

Xingxi Yin, Jingfeng Zhang, Yue Deng, Zhi Li, Yicheng Li, Yin Zhang

机构 * Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08991 2025-06-11 cs.CV cs.CR 77%

Do Concept Replacement Techniques Really Erase Unacceptable Concepts?

Anudeep Das, Gurjot Singh, Prach Chantasantitam, N. Asokan

机构 * University of Waterloo(滑铁卢大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23161 2025-06-05 cs.CV cs.AI cs.LG 77%

Implicit Inversion turns CLIP into a Decoder

Antonio D'Orazio, Maria Rosaria Briglia, Donato Crisostomi, Dario Loi, Emanuele Rodolà, Iacopo Masi

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16039 2025-05-30 cs.CV 77%

SafeCFG: Controlling Harmful Features with Dynamic Safe Guidance for Safe Generation

Jiadong Pan, Liang Li, Hongcheng Gao, Zheng-Jun Zha, Qingming Huang, Jiebo Luo

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) University of Rochester(罗切斯特大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11131 2025-05-27 cs.CV cs.AI 77%

One Image is Worth a Thousand Words: A Usability Preservable Text-Image Collaborative Erasing Framework

Feiran Li, Qianqian Xu, Shilong Bao, Zhiyong Yang, Xiaochun Cao, Qingming Huang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments This paper has been accepeted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10297 2025-05-13 cs.CV cs.AI 77%

On Synthetic Texture Datasets: Challenges, Creation, and Curation

Blaine Hoak, Patrick McDaniel

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03667 2025-05-07 cs.CV 77%

Distribution-Conditional Generation: From Class Distribution to Creative Generation

Fu Feng, Yucheng Xie, Xu Yang, Jing Wang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(计算机科学与工程学院,东南大学,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用重点实验室(东南大学),教育部,中国)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14260 2025-04-22 cs.CV cs.CL 77%

Cross-attention for State-based model RWKV-7

Liu Xiao, Li Zhiyuan, Lin Yueyu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11104 2025-04-16 cs.CL cs.CV cs.CY 77%

Using LLMs as prompt modifier to avoid biases in AI image generators

René Peinl

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05838 2025-04-09 cs.CV cs.AI cs.CR 77%

Mind the Trojan Horse: Image Prompt Adapter Enabling Scalable and Deceptive Jailbreaking

Junxi Chen, Junhao Dong, Xiaohua Xie

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR2025 as Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19867 2025-04-02 cs.CV cs.AI cs.LG 77%

Data-Free Group-Wise Fully Quantized Winograd Convolution via Learnable Scales

Shuokai Pan, Gerti Tuzi, Sudarshan Sreeram, Dibakar Gope

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06143 2025-04-01 cs.CV cs.AI 77%

Precise, Fast, and Low-cost Concept Erasure in Value Space: Orthogonal Complement Matters

Yuan Wang, Ouxiang Li, Tingting Mu, Yanbin Hao, Kuien Liu, Xiang Wang, Xiangnan He

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19262 2025-03-26 cs.CV 77%

Learning Hazing to Dehazing: Towards Realistic Haze Generation for Real-World Image Dehazing

Ruiyi Wang, Yushuo Zheng, Zicheng Zhang, Chunyi Li, Shuaicheng Liu, Guangtao Zhai, Xiaohong Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17728 2025-03-25 cs.CV cs.AI 77%

DynASyn: Multi-Subject Personalization Enabling Dynamic Action Synthesis

Yongjin Choi, Chanhun Park, Seung Jun Baek

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17076 2025-03-24 cs.CV 77%

Halton Scheduler For Masked Generative Image Transformer

Victor Besnier, Mickael Chen, David Hurych, Eduardo Valle, Matthieu Cord

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16322 2025-03-21 cs.CV 77%

Ultra-Resolution Adaptation with Ease

Ruonan Yu, Songhua Liu, Zhenxiong Tan, Xinchao Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Technical Report. Codes are available \href{https://github.com/Huage001/URAE}{here}

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10639 2025-03-14 cs.CV 77%

GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing

Rongyao Fang, Chengqi Duan, Kun Wang, Linjiang Huang, Hao Li, Shilin Yan, Hao Tian, Xingyu Zeng, Rui Zhao, Jifeng Dai, Xihui Liu, Hongsheng Li

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Dataset and models are released in https://github.com/rongyaofang/GoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04229 2025-03-07 cs.CV cs.LG 77%

Synthetic Data is an Elegant GIFT for Continual Vision-Language Models

Bin Wu, Wuxuan Shi, Jinqiao Wang, Mang Ye

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments This work is accepted by CVPR 2025. Modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03664 2025-03-06 cs.CV cs.AI 77%

A Generative Approach to High Fidelity 3D Reconstruction from Text Data

Venkat Kumar R, Deepak Saravanan

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06751 2025-03-04 cs.CL cs.CV 77%

Padding Tone: A Mechanistic Analysis of Padding Tokens in T2I Models

Michael Toker, Ido Galil, Hadas Orgad, Rinon Gal, Yoad Tewel, Gal Chechik, Yonatan Belinkov

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Published in: NAACL 2025. Project webpage: https://padding-tone.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏