arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-08-26 至 2025-08-26 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2505.15313 2025-08-26 cs.CV 83%

FaceCrafter: Identity-Conditional Diffusion with Disentangled Control over Facial Pose, Expression, and Emotion

Kazuaki Mishima, Antoni Bigata Casademunt, Stavros Petridis, Maja Pantic, Kenji Suzuki

机构 * Institute of Science Tokyo(东京科学研究所) Imperial College London(伦敦帝国学院)

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 9 pages(excluding references), 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08736 2025-08-26 cs.CV 79%

GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation

Tianwei Xiong, Jun Hao Liew, Zilong Huang, Jiashi Feng, Xihui Liu

机构 * The University of Hong Kong(香港大学) ByteDance Seed Project(字节跳动种子项目)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

Comments ICCV 2025. Project page: https://silentview.github.io/GigaTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16783 2025-08-26 cs.CV cs.AI 70%

Improving Performance, Robustness, and Fairness of Radiographic AI Models with Finely-Controllable Synthetic Data

Stefania L. Moroianu, Christian Bluethgen, Pierre Chambon, Mehdi Cherti, Jean-Benoit Delbrouck, Magdalini Paschali, Brandon Price, Judy Gichoya, Jenia Jitsev, Curtis P. Langlotz, Akshay S. Chaudhari

机构 * Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学人工智能医学与成像中心) Department of Radiology, Stanford University(斯坦福大学放射科) Department of Applied Physics, Stanford University(斯坦福大学应用物理系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Institute for Diagnostic and Interventional Radiology, University Hospital Zurich, University of Zurich(苏黎世大学医院诊断与介入放射学研究所) LAION Juelich Supercomputing Center (JSC), Research Center Juelich (FZJ)(耶鲁超级计算中心(JSC)、耶鲁研究中心(FZJ)) Department of Radiology & Imaging Sciences, Emory University(埃默里大学放射科与成像科学系) Department of Radiology, University of Florida College of Medicine(佛罗里达大学医学院放射科)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17062 2025-08-26 cs.CV cs.AI 57%

SSG-Dit: A Spatial Signal Guided Framework for Controllable Video Generation

Peng Hu, Yu Gu, Liang Luo, Fuji Ren

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17029 2025-08-26 cs.CV 57%

A Novel Local Focusing Mechanism for Deepfake Detection Generalization

Mingliang Li, Lin Yuanbo Wu, Changhong Liu, Hanxi Li

机构 * Jiangxi Normal University, China(江西师范大学) Swansea University, United Kingdom(斯旺西大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20439 2025-08-26 cs.CV 57%

Image Augmentation Agent for Weakly Supervised Semantic Segmentation

Wangyu Wu, Xianglin Qiu, Siqi Song, Zhenhong Chen, Xiaowei Huang, Fei Ma, Jimin Xiao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Microsoft(微软公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted at Neurocomputing 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06602 2025-08-26 cs.CL cs.AI cs.LG cs.MM cs.SD eess.AS 57%

Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey

Tianxin Xie, Yan Rong, Pengfei Zhang, Wenwu Wang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Surrey(萨里大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

Comments The first comprehensive survey on controllable TTS. Accepted to the EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22979 2025-08-26 cs.CV 57%

LumiSculpt: Enabling Consistent Portrait Lighting in Video Generation

Yuxin Zhang, Dandan Zheng, Biao Gong, Shiwen Wang, Jingdong Chen, Ming Yang, Weiming Dong, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciecnes(MAIS,自动化研究所,中国科学院) Ant Group(蚂蚁集团)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏