arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4221 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4221 篇

2512.22272 2025-12-30 cs.CV 77%

Human-Aligned Generative Perception: Bridging Psychophysics and Generative Models

人类对齐的生成感知:连接心理学物理与生成模型

Antara Titikhsha, Om Kulkarni, Dharun Muthaiah

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出通过轻量级判别器引导生成模型,实现几何与风格的可控分离,提升文本到图像合成的语义对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14882 2025-10-17 cs.CV 77%

ScaleWeaver: Weaving Efficient Controllable T2I Generation with Multi-Scale Reference Attention

Keli Liu, Zhendong Wang, Wengang Zhou, Shaodong Xu, Ruixiao Dong, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17757 2025-09-23 cs.CV cs.MA 77%

Multi-Agent Amodal Completion: Direct Synthesis with Fine-Grained Semantic Guidance

Hongxing Fan, Lipeng Wang, Haohua Chen, Zehuan Huang, Jiangtao Wu, Lu Sheng

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北京航空航天大学) School of Software(软件学院)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16806 2025-09-23 cs.CV 77%

FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation

Fan Yang, Yousong Zhu, Xin Li, Yufei Zhan, Hongyin Zhao, Shurong Zheng, Yaowei Wang, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Wuhan AI Research, Wuhan, China(武汉人工智能研究所)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01405 2025-09-03 cs.CV 77%

Neural Scene Designer: Self-Styled Semantic Image Manipulation

Jianman Lin, Tianshui Chen, Chunmei Qing, Zhijing Yang, Shuangping Huang, Yuheng Ren, Liang Lin

机构 * South China University of Technology(南方科技大学) Guangdong University of Technology(广东工业大学) Jimei University(集美大学) Xiamen Kunlu AI Research Institute(厦门鲲 lun AI 研究院) Sun Yat-sen University(中山大学)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14440 2025-08-21 cs.CV 77%

MUSE: Multi-Subject Unified Synthesis via Explicit Layout Semantic Expansion

Fei Peng, Junqiang Wu, Yan Li, Tingting Gao, Di Zhang, Huiyuan Fu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Kuaishou Technology(快手科技)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments This paper is accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16978 2025-08-08 cs.CV cs.AI 77%

PromptDresser: Improving the Quality and Controllability of Virtual Try-On via Generative Textual Prompt and Prompt-aware Mask

Jeongho Kim, Hoiyeong Jin, Sunghyun Park, Jaegul Choo

机构 * KAIST(韩国科学技术院)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08654 2025-07-30 cs.CV 77%

ZeroStereo: Zero-shot Stereo Matching from Single Images

Xianqi Wang, Hao Yang, Gangwei Xu, Junda Cheng, Min Lin, Yong Deng, Jinliang Zang, Yurui Chen, Xin Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Autel Robotics(Autel机器人公司) Optics Valley Laboratory(光学谷实验室)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15010 2025-07-01 cs.CV 77%

DepthART: Monocular Depth Estimation as Autoregressive Refinement Task

Bulat Gabdullin, Nina Konovalova, Nikolay Patakin, Dmitry Senushkin, Anton Konushin

机构 * AIRI HSE University(俄罗斯伏尔加格勒国立大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15563 2025-06-19 cs.CV 77%

Control and Realism: Best of Both Worlds in Layout-to-Image without Training

Bonan Li, Yinhan Hu, Songhua Liu, Xinchao Wang

机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09363 2025-06-12 cs.CV cs.AI cs.CR 77%

SAGE: Exploring the Boundaries of Unsafe Concept Domain with Semantic-Augment Erasing

Hongguang Zhu, Yunchao Wei, Mengyu Wang, Siyu Jiao, Yan Fang, Jiannan Huang, Yao Zhao

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Beijing Key Laboratory of Advanced Information Science and Network Technology(北京先进信息科学与网络技术重点实验室)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05501 2025-06-09 cs.CV 77%

FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL

Kaihang Pan, Wendong Bu, Yuruo Wu, Yang Wu, Kai Shen, Yunfei Li, Hang Zhao, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 15 pages, 8 figures. Project Page: https://focusdiff.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22523 2025-05-29 cs.CV 77%

PrismLayers: Open Data for High-Quality Multi-Layer Transparent Image Generative Models

Junwen Chen, Heyang Jiang, Yanbin Wang, Keming Wu, Ji Li, Chao Zhang, Keiji Yanai, Dong Chen, Yuhui Yuan

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Homepage: https://prism-layers.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19724 2025-04-29 cs.CV 77%

RepText: Rendering Visual Text via Replicating

Haofan Wang, Yujia Xu, Yimeng Li, Junchen Li, Chaowei Zhang, Jing Wang, Kejia Yang, Zhibo Chen

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Technical Report. https://reptext.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04185 2025-04-08 cs.CV 77%

SDEIT: Semantic-Driven Electrical Impedance Tomography

Dong Liu, Yuanchao Wu, Bowen Tong, Jiansong Deng

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09227 2025-04-03 cs.CV 77%

DreamScape: 3D Scene Creation via Gaussian Splatting joint Correlation Modeling

Yueming Zhao, Xuening Yuan, Hongyu Yang, Di Huang

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17064 2025-03-17 cs.CV cs.AI cs.LG 77%

Continuous, Subject-Specific Attribute Control in T2I Models by Identifying Semantic Directions

Stefan Andreas Baumann, Felix Krause, Michael Neumayr, Nick Stracke, Melvin Sevi, Vincent Tao Hu, Björn Ommer

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://compvis.github.io/attribute-control

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04391 2025-02-10 cs.CV cs.AI 77%

Towards Fair and Robust Face Parsing for Generative AI: A Multi-Objective Approach

Sophia J. Abraham, Jonathan D. Hauenstein, Walter J. Scheirer

专题命中 可控生成 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12635 2025-02-03 cs.CV 77%

RealCraft: Attention Control as A Tool for Zero-Shot Consistent Video Editing

Shutong Jin, Ruiyu Wang, Florian T. Pokorny

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12173 2025-01-22 cs.CV 77%

ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions

Shiyue Zhang, Zheng Chong, Xi Lu, Wenqing Zhang, Haoxiang Li, Xujie Zhang, Jiehui Huang, Xiao Dong, Xiaodan Liang

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11473 2025-01-06 cs.CV 77%

InvSeg: Test-Time Prompt Inversion for Semantic Segmentation

Jiayi Lin, Jiabo Huang, Jian Hu, Shaogang Gong

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09656 2024-12-16 cs.CV cs.AI 77%

From Noise to Nuance: Advances in Deep Generative Image Models

Benji Peng, Chia Xin Liang, Ziqian Bi, Ming Liu, Yichao Zhang, Tianyang Wang, Keyu Chen, Xinyuan Song, Pohsun Feng

专题命中 可控生成 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00306 2024-12-03 cs.CV 77%

Refine-by-Align: Reference-Guided Artifacts Refinement through Semantic Alignment

Yizhi Song, Liu He, Zhifei Zhang, Soo Ye Kim, He Zhang, Wei Xiong, Zhe Lin, Brian Price, Scott Cohen, Jianming Zhang, Daniel Aliaga

专题命中 可控生成 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00548 2024-11-04 cs.CV cs.AI cs.LG 77%

Generative AI-based Pipeline Architecture for Increasing Training Efficiency in Intelligent Weed Control Systems

Sourav Modak, Anthony Stein

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10792 2024-10-15 cs.LG cs.CV stat.ML 77%

Semantic Image Inversion and Editing using Rectified Stochastic Differential Equations

Litu Rout, Yujia Chen, Nataniel Ruiz, Constantine Caramanis, Sanjay Shakkottai, Wen-Sheng Chu

专题命中 可控生成 :diffusion(abstract);image editing(abstract);image synthesis(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04439 2024-10-08 cs.CV cs.AI 77%

Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training

Wenbo Li, Guohao Li, Zhibin Lan, Xue Xu, Wanru Zhuang, Jiachen Liu, Xinyan Xiao, Jinsong Su

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06183 2024-10-04 cs.CV 77%

EDADepth: Enhanced Data Augmentation for Monocular Depth Estimation

Nischal Khanal, Shivanand Venkanna Sheshappanavar

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06937 2024-07-10 cs.CV 77%

HumanRefiner: Benchmarking Abnormal Human Generation and Refining with Coarse-to-fine Pose-Reversible Guidance

Guian Fang, Wenbiao Yan, Yuanfan Guo, Jianhua Han, Zutao Jiang, Hang Xu, Shengcai Liao, Xiaodan Liang

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00272 2024-06-04 cs.CV 77%

Temporally Consistent Object Editing in Videos using Extended Attention

AmirHossein Zamani, Amir G. Aghdam, Tiberiu Popa, Eugene Belilovsky

专题命中 可控生成 :image generation(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07697 2024-05-24 cs.CV 77%

ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation

Bo Peng, Xinyuan Chen, Yaohui Wang, Chaochao Lu, Yu Qiao

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏