arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-10-07 至 2025-10-07 共收录 126 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2410.02710 2025-10-07 cs.CV cs.AI cs.CR 89%

SteerDiff: Steering towards Safe Text-to-Image Diffusion Models

Hongxiang Zhang, Yifeng He, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04201 2025-10-07 cs.CV cs.AI 86%

World-To-Image: Grounding Text-to-Image Generation with Agent-Driven World Knowledge

Moo Hyun Son, Jintaek Oh, Sun Bin Mun, Jaechul Roh, Sehyun Choi

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Georgia Institute of Technology(佐治亚理工学院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) TwelveLabs

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04576 2025-10-07 cs.LG cs.AI cs.CV stat.ML 70%

SONA: Learning Conditional, Unconditional, and Mismatching-Aware Discriminator

Yuhta Takida, Satoshi Hayakawa, Takashi Shibuya, Masaaki Imaizumi, Naoki Murata, Bac Nguyen, Toshimitsu Uesaka, Chieh-Hsin Lai, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团) The University of Tokyo(东京大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 24 pages with 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10575 2025-10-07 cs.CV 57%

A Survey of Defenses Against AI-Generated Visual Media: Detection,Disruption, and Authentication

Jingyi Deng, Chenhao Lin, Zhengyu Zhao, Shuai Liu, Zhe Peng, Qian Wang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学计算机科学与工程学院) Interdisciplinary Research Center of Frontier science and technology, Xi'an Jiaotong University(西安交通大学前沿科学与技术交叉研究中心) School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) Department of Industrial and Systems Engineering, Hong Kong Polytechnic University(香港理工大学工业与系统工程系) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Accepted by ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2510.05081 2025-10-07 cs.GR cs.AI cs.CV 88%

SAEdit: Token-level control for continuous image editing via Sparse AutoEncoder

Ronen Kamenetsky, Sara Dorfman, Daniel Garibi, Roni Paiss, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

Comments Project page at: https://ronen94.github.io/SAEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04034 2025-10-07 cs.CV cs.AI 83%

Prompt-to-Prompt: Text-Based Image Editing Via Cross-Attention Mechanisms -- The Research of Hyperparameters and Novel Mechanisms to Enhance Existing Frameworks

Linn Bieske, Carla Lorente

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01921 2025-10-07 cs.CV cs.AI 79%

MedEBench: Diagnosing Reliability in Text-Guided Medical Image Editing

Minghao Liu, Zhitao He, Zhiyuan Fan, Qingyun Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

Comments Project website: https://mliuby.github.io/MedEBench_Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04738 2025-10-07 cs.SD cs.AI cs.CL cs.LG eess.AS 50%

Speak, Edit, Repeat: High-Fidelity Voice Editing and Zero-Shot TTS with Cross-Attentive Mamba

Baher Mohammad, Magauiya Zhussip, Stamatios Lefkimmiatis

机构 * MTS AI(MTS人工智能公司) ITMO University(ITMO大学)

专题命中 图像编辑 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 98 篇

2510.04797 2025-10-07 cs.CV cs.AI 89%

DiT-VTON: Diffusion Transformer Framework for Unified Multi-Category Virtual Try-On and Virtual Try-All with Integrated Image Editing

Qi Li, Shuwen Qiu, Julien Han, Xingzi Xu, Mehmet Saygin Seyfioglu, Kee Kiat Koo, Karim Bouyarmane

机构 * Amazon(亚马逊) University of California, Los Angeles(加州大学洛杉矶分校) Duke University(杜克大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);分类 cs.CV

Comments Submitted to CVPR 2025 and Published at CVPR 2025 AI for Content Creation workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07389 2025-10-07 cs.CV cs.AI 89%

TRCE: Towards Reliable Malicious Concept Erasure in Text-to-Image Diffusion Models

Ruidong Chen, Honglin Guo, Lanjun Wang, Chenyu Zhang, Weizhi Nie, An-An Liu

机构 * The School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18804 2025-10-07 cs.CV cs.LG 87%

Fast constrained sampling in pre-trained diffusion models

Alexandros Graikos, Nebojsa Jojic, Dimitris Samaras

机构 * Stony Brook University(石溪大学) Microsoft Research(微软研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14815 2025-10-07 cs.LG cs.AI cs.CR cs.CV 85%

What Lurks Within? Concept Auditing for Shared Diffusion Models at Scale

Xiaoyong Yuan, Xiaolong Ma, Linke Guo, Lan Zhang

机构 * Clemson University(克莱姆森大学) The University of Arizona(亚利桑那大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Extended version of the paper accepted at CCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02296 2025-10-07 cs.LG cs.CV 85%

Continual Personalization for Diffusion Models

Yu-Chien Liao, Jr-Jen Chen, Chi-Pin Huang, Ci-Siang Lin, Meng-Lin Wu, Yu-Chiang Frank Wang

机构 * National Taiwan University(国立台湾大学) Qualcomm Technologies, Inc.(高通技术公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Journal ref ICCV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03886 2025-10-07 cs.AI 85%

Rare Text Semantics Were Always There in Your Diffusion Transformer

Seil Kang, Woojung Han, Dayun Ju, Seong Jae Hwang

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract)

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04668 2025-10-07 cs.CV 83%

ConceptSplit: Decoupled Multi-Concept Personalization of Diffusion Models via Token-wise Adaptation and Attention Disentanglement

Habin Lim, Yeongseob Won, Juwon Seo, Gyeong-Moon Park

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments 14 pages, 13 figures, to be published in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23614 2025-10-07 cs.LG stat.ML 83%

Inference-time Scaling of Diffusion Models through Classical Search

Xiangcheng Zhang, Haowei Lin, Haotian Ye, James Zou, Jianzhu Ma, Yitao Liang, Yilun Du

机构 * Helixon US Inc.(Helixon US公司) Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

Comments Website at https://diffusion-inference-scaling.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04153 2025-10-07 cs.CR cs.LG 82%

ObCLIP: Oblivious CLoud-Device Hybrid Image Generation with Privacy Preservation

Haoqi Wu, Wei Dai, Ming Xu, Li Wang, Qiang Yan

机构 * TikTok Inc.(TikTok公司) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09253 2025-10-07 cs.DC 82%

PATCHEDSERVE: A Patch Management Framework for SLO-Optimized Hybrid Resolution Diffusion Serving

Desen Sun, Zepeng Zhao, Yuke Wang

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04712 2025-10-07 cs.CV cs.HC cs.MM 81%

ReactDiff: Fundamental Multiple Appropriate Facial Reaction Diffusion Model

Luo Cheng, Song Siyang, Yan Siyuan, Yu Zhen, Ge Zongyuan

机构 * Monash University(墨尔本大学) University of Exeter(埃克塞特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

Comments Accepted to ACM Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18671 2025-10-07 cs.SD cs.CV cs.GR eess.AS 81%

TCDiff++: An End-to-end Trajectory-Controllable Diffusion Model for Harmonious Music-Driven Group Choreography

Yuqin Dai, Wanlu Zhu, Ronghui Li, Xiu Li, Zhenyu Zhang, Jun Li, Jian Yang

机构 * PCA Lab, Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, School of Computer Science and Engineering, Nanjing University of Science and Technology, Nanjing, China(教育部高维信息智能感知与系统重点实验室,南京理工大学计算机科学与工程学院) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) Nanjing University, Suzhou, China(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04947 2025-10-07 cs.CV cs.AI 79%

Bidirectional Mammogram View Translation with Column-Aware and Implicit 3D Conditional Diffusion

Xin Li, Kaixiang Yang, Qiang Li, Zhiwei Wang

机构 * Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(光学电子国家重点实验室,华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments BIBM2025 accept, 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04706 2025-10-07 cs.CV 79%

ID-Consistent, Precise Expression Generation with Blendshape-Guided Diffusion

Foivos Paraperas Papantoniou, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments ICCVW 2025, Code: https://github.com/foivospar/Arc2Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05993 2025-10-07 cs.CV cs.AI eess.IV 79%

A Modular Conditional Diffusion Framework for Image Reconstruction

Magauiya Zhussip, Iaroslav Koshelev, Stamatis Lefkimmiatis

机构 * MTS AI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04365 2025-10-07 cs.CV 79%

Diffusion^2: Dual Diffusion Model with Uncertainty-Aware Adaptive Noise for Momentary Trajectory Prediction

Yuhao Luo, Yuang Zhang, Kehua Chen, Xinyu Zheng, Shucheng Zhang, Sikai Chen, Yinhai Wang

机构 * Civil and Environmental Engineering Department, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Civil and Environmental Engineering Department, University of Washington(华盛顿大学土木与环境工程系) College of Transportation, Tongji University(同济大学交通运输学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments 13 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04188 2025-10-07 cs.CV 79%

Let Features Decide Their Own Solvers: Hybrid Feature Caching for Diffusion Transformers

Shikang Zheng, Guantao Chen, Qinming Zhou, Yuqi Lin, Lixuan He, Chang Zou, Peiliang Cai, Jiacheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(南方科技大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04125 2025-10-07 cs.CV 79%

Joint Learning of Pose Regression and Denoising Diffusion with Score Scaling Sampling for Category-level 6D Pose Estimation

Seunghyun Lee, Tae-Kyun Kim

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04069 2025-10-07 cs.CV 79%

Diffusion Low Rank Hybrid Reconstruction for Sparse View Medical Imaging

Zongyin Deng, Qing Zhou, Yuhao Fang, Zijian Wang, Yao Lu, Ye Zhang, Chun Li

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) China Media Group(中国媒体集团) School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03675 2025-10-07 cs.CV 79%

A Novel Cloud-Based Diffusion-Guided Hybrid Model for High-Accuracy Accident Detection in Intelligent Transportation Systems

Siva Sai, Saksham Gupta, Vinay Chamola, Rajkumar Buyya

机构 * Department of Electrical and Electronics Engineering, BITS-Pilani, Pilani Campus(比特学院电子与电子工程系) The Quantum Cloud Computing and Distributed Systems (qCLOUDS) Laboratory, School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算机与信息系统学院量子云计算与分布式系统实验室) qCLOUDS Laboratory(qCLOUDS实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03545 2025-10-07 cs.CV cs.RO 79%

SketchPlan: Diffusion Based Drone Planning From Human Sketches

Sixten Norelius, Aaron O. Feldman, Mac Schwager

机构 * EECS, KTH Royal Institute of Technology(皇家理工学院电子工程与计算机科学系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空与航天系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Code available at https://github.com/sixnor/SketchPlan

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22728 2025-10-07 cs.SD cs.AI cs.MM eess.AS 79%

Prompt-aware classifier free guidance for diffusion models

Xuanhao Zhang, Chang Li

机构 * China Pharmaceutical University(中国药科大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏