arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-08-19 至 2025-08-19 共收录 78 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2508.10711 2025-08-19 cs.CV 89%

NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale

NextStep Team, Chunrui Han, Guopeng Li, Jingwei Wu, Quan Sun, Yan Cai, Yuang Peng, Zheng Ge, Deyu Zhou, Haomiao Tang, Hongyu Zhou, Kenkun Liu, Ailin Huang, Bin Wang, Changxin Miao, Deshan Sun, En Yu, Fukun Yin, Gang Yu, Hao Nie, Haoran Lv, Hanpeng Hu, Jia Wang, Jian Zhou, Jianjian Sun, Kaijun Tan, Kang An, Kangheng Lin, Liang Zhao, Mei Chen, Peng Xing, Rui Wang, Shiyu Liu, Shutao Xia, Tianhao You, Wei Ji, Xianfang Zeng, Xin Han, Xuelin Zhang, Yana Wei, Yanming Xu, Yimin Jiang, Yingming Wang, Yu Zhou, Yucheng Han, Ziyang Meng, Binxing Jiao, Daxin Jiang, Xiangyu Zhang, Yibo Zhu

机构 * NextStep-Team(NextStep团队)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

Comments Code: https://github.com/stepfun-ai/NextStep-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12396 2025-08-19 cs.CV 88%

DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language Models

Xiaochuan Lin, Xiangyong Chen, Xuan Li, Yichen Su

机构 * Henan Polytechnic University(河南理工大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10407 2025-08-19 cs.CV 88%

Translation of Text Embedding via Delta Vector to Suppress Strongly Entangled Content in Text-to-Image Diffusion Models

Eunseo Koh, Seunghoo Hong, Tae-Young Kim, Simon S. Woo, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19103 2025-08-19 cs.CV cs.AI cs.CL cs.LG 88%

Automated Black-box Prompt Engineering for Personalized Text-to-Image Generation

Yutong He, Alexander Robey, Naoki Murata, Yiding Jiang, Joshua Nathaniel Williams, George J. Pappas, Hamed Hassani, Yuki Mitsufuji, Ruslan Salakhutdinov, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团) Bosch Center for AI(博世人工智能中心)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

Journal ref Transactions on Machine Learning Research (TMLR), 2025. ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11695 2025-08-19 cs.GR cs.AI 83%

RefAdGen: High-Fidelity Advertising Image Generation

Yiyun Chen, Weikai Yang

专题命中 文生图 :image generation(title,abstract);image synthesis(abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2508.11961 2025-08-19 cs.CV 57%

PEdger++: Practical Edge Detection via Assembling Cross Information

Yuanbin Fu, Liang Li, Xiaojie Guo

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 59 篇

2506.12853 2025-08-19 cs.CV 88%

EraserDiT: Fast Video Inpainting with Diffusion Transformer Model

Jie Liu, Zheng Hui

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

Comments technical report project page:https://jieliu95.github.io/EraserDiT_demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03546 2025-08-19 cs.CV cs.LG 86%

CCDM: Continuous Conditional Diffusion Models for Image Generation

Xin Ding, Yongwei Wang, Kao Zhang, Z. Jane Wang

机构 * School of Artificial Intelligence/School of Future Technology, Nanjing University of Information Science & Technology (NUIST)(人工智能学院/未来技术学院,南京信息工程大学) Perceptual and Generative AI Lab (PGAI Lab) at NUIST(南京信息工程大学感知与生成人工智能实验室) Zhejiang University(浙江大学) Department of Electrical and Computer Engineering, University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12718 2025-08-19 cs.CV 85%

Single-Reference Text-to-Image Manipulation with Dual Contrastive Denoising Score

Syed Muhmmad Israr, Feng Zhao

机构 * Department of Automation, School of Information Science and Technology, University of Science and Technology of China(自动化系、信息科学与技术学院、中国科学技术大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20094 2025-08-19 cs.CV cs.AI cs.MA 85%

Local Prompt Adaptation for Style-Consistent Multi-Object Generation in Diffusion Models

Ankit Sanjyal

机构 * Fordham University(福特汉姆大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 10 Pages,10 figures, pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13077 2025-08-19 eess.IV cs.AI 82%

From Transthoracic to Transesophageal: Cross-Modality Generation using LoRA Diffusion

Emmanuel Oladokun, Yuxuan Ou, Anna Novikova, Daria Kulikova, Sarina Thomas, Jurica Šprem, Vicente Grau

机构 * University of Oxford GE HealthCare, Cardiovascular Ultrasound R\&D

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

Comments MICCAI 2025; ASMUS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12701 2025-08-19 eess.SY cs.SY 82%

Deadline-Aware Bandwidth Allocation for Semantic Generative Communication with Diffusion Models

Jinhyuk Choi, Jihong Park, Seungeun Oh, Seong-Lyun Kim

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12361 2025-08-19 cs.LG cs.AI math.ST stat.TH 82%

Navigating the Exploration-Exploitation Tradeoff in Inference-Time Scaling of Diffusion Models

Xun Su, Jianming Huang, Yang Yusen, Zhongxi Fang, Hiroyuki Kasai

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13091 2025-08-19 cs.CV 79%

DMS:Diffusion-Based Multi-Baseline Stereo Generation for Improving Self-Supervised Depth Estimation

Zihua Liu, Yizhou Li, Songyan Zhang, Masatoshi Okutomi

机构 * Institute of Science Tokyo, Japan(东京科学研究所) Sony Semiconductor Solutions Group, Japan(日本索尼半导体解决方案集团) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12784 2025-08-19 cs.CV 79%

Leveraging Diffusion Models for Stylization using Multiple Style Images

Dan Ruta, Abdelaziz Djelouah, Raphael Ortiz, Christopher Schroers

机构 * DisneyResearch|Studios(迪士尼研究|工作室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12663 2025-08-19 cs.CV 79%

Stable Diffusion-Based Approach for Human De-Occlusion

Seung Young Noh, Ju Yong Chang

机构 * Kwangwoon University(韩国成均馆大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12603 2025-08-19 cs.CV 79%

ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving

Can Cui, Yupeng Zhou, Juntong Peng, Sung-Yeon Park, Zichong Yang, Prashanth Sankaranarayanan, Jiaru Zhang, Ruqi Zhang, Ziran Wang

机构 * College of Engineering, Purdue University(普渡大学工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12148 2025-08-19 cs.CV cs.AI 79%

Demystifying Foreground-Background Memorization in Diffusion Models

Jimmy Z. Di, Yiwei Lu, Yaoliang Yu, Gautam Kamath, Adam Dziedzic, Franziska Boenisch

机构 * Cheriton School of Computer Science, University of Waterloo and Vector Institute(查尔顿计算机科学学院,滑铁卢大学和向量研究所) University of Ottawa(渥太华大学) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍茨中心CISPA)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12084 2025-08-19 cs.CV cs.AI 79%

Generic Event Boundary Detection via Denoising Diffusion

Jaejun Hwang, Dayoung Gong, Manjin Kim, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学) GenGenAI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10905 2025-08-19 cs.CV cs.HC 79%

InterAnimate: Taming Region-aware Diffusion Model for Realistic Human Interaction Animation

Yukang Lin, Yan Hong, Zunnan Xu, Xindi Li, Chao Xu, Chuanbiao Song, Ronghui Li, Haoxing Chen, Jun Lan, Huijia Zhu, Weiqiang Wang, Jianfu Zhang, Xiu Li

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accept to ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05977 2025-08-19 cs.CV 79%

Diffusion Based Ambiguous Image Segmentation

Jakob Lønborg Christensen, Morten Rieger Hannemose, Anders Bjorholm Dahl, Vedrana Andersen Dahl

机构 * The Technical University of Denmark, Department of Applied Mathematics and Computer Science (DTU Compute)(丹麦技术大学应用数学与计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted at SCIA25

Journal ref SCIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04860 2025-08-19 cs.RO cs.AI cs.CV cs.LG 79%

D-CODA: Diffusion for Coordinated Dual-Arm Data Augmentation

I-Chun Arthur Liu, Jason Chen, Gaurav Sukhatme, Daniel Seita

机构 * Department of Computer Science, University of Southern California(计算机科学系,南加州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted to the Conference on Robot Learning (CoRL) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01521 2025-08-19 cs.LG cs.AI cs.CV 79%

Improving Diffusion Inverse Problem Solving with Decoupled Noise Annealing

Bingliang Zhang, Wenda Chu, Julius Berner, Chenlin Meng, Anima Anandkumar, Yang Song

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) OpenAI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Journal ref 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13097 2025-08-19 cs.CE cs.LG 78%

Denoising diffusion models for inverse design of inflatable structures with programmable deformations

Sara Karimi, Nikolaos N. Vlassis

机构 * Department of Mechanical and Aerospace Engineering, Rutgers University(机械与航空航天工程系,罗格斯大学)

专题命中 扩散模型 :diffusion(title,abstract)

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12706 2025-08-19 cs.IR cs.AI 78%

Asymmetric Diffusion Recommendation Model

Yongchun Zhu, Guanyu Jiang, Jingwu Chen, Feng Zhang, Xiao Yang, Zuotao Liu

机构 * ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract)

Comments Accepted by CIKM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12189 2025-08-19 cs.RO cs.AI 78%

Self-Guided Action Diffusion

Rhea Malhotra, Yuejiang Liu, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12155 2025-08-19 stat.ME math.DS stat.CO 78%

A Systematic Particle Filter for Estimating Time-Varying Parameters in Advection-Diffusion Equations with Source Terms

Andrea Arnold

专题命中 扩散模型 :diffusion(title,abstract)

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12033 2025-08-19 physics.chem-ph cond-mat.mtrl-sci physics.comp-ph 78%

Load-Balanced Diffusion Monte Carlo Method with Lattice Regularization

Kousuke Nakano, Sandro Sorella, Michele Casula

专题命中 扩散模型 :diffusion(title,abstract)

Comments 36 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10995 2025-08-19 cs.CL cs.LG 78%

Improving Text Style Transfer using Masked Diffusion Language Models with Inference-time Scaling

Tejomay Kishor Padole, Suyash P Awate, Pushpak Bhattacharyya

机构 * Dept. of Computer Science and Engineering, Indian Institute of Technology, Bombay(计算机科学与工程系,印度理工学院,孟买)

专题命中 扩散模型 :diffusion(title,abstract)

Comments Accepted as a main conference submission in the European Conference on Artificial Intelligence (ECAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00819 2025-08-19 cs.CL 78%

Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models

Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract)

Comments Code is available at https://github.com/Li-Jinsong/DAEDAL

详情

展开后加载摘要…

URL PDF HTML 收藏