arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2511.10074 2025-11-14 cs.CV cs.SY eess.SY 57%

VLF-MSC: Vision-Language Feature-Based Multimodal Semantic Communication System

Gwangyeon Ahn, Jiwan Seo, Joonhyuk Kang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments To appear in the AI4NextG Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08036 2025-11-12 cs.CV 57%

WEDepth: Efficient Adaptation of World Knowledge for Monocular Depth Estimation

Gongshu Wang, Zhirui Wang, Kan Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01292 2025-11-12 eess.IV cs.AI cs.CV 57%

CoCoLIT: ControlNet-Conditioned Latent Image Translation for MRI to Amyloid PET Synthesis

Alec Sargood, Lemuel Puglisi, James H. Cole, Neil P. Oxtoby, Daniele Ravì, Daniel C. Alexander

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Article accepted at AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06709 2025-11-11 cs.CV 57%

K-Stain: Keypoint-Driven Correspondence for H&E-to-IHC Virtual Staining

Sicheng Yang, Zhaohu Xing, Haipeng Zhou, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18232 2025-11-11 cs.CV 57%

Free-T2M: Robust Text-to-Motion Generation for Humanoid Robots via Frequency-Domain

Wenshuo Chen, Haozhe Jia, Songning Lai, Lei Wang, Yuqi Lin, Hongru Xiao, Lijie Hu, Yutao Yue

机构 * Shandong University(山东大学) Griffith University(格里菲斯大学) Data61/CSIRO Tongji University(同济大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06271 2025-11-11 cs.CV 57%

RelightMaster: Precise Video Relighting with Multi-plane Light Images

Weikang Bian, Xiaoyu Shi, Zhaoyang Huang, Jianhong Bai, Qinghe Wang, Xintao Wang, Pengfei Wan, Kun Gai, Hongsheng Li

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) CPII under InnoHK(创新香港 CPII) Zhejiang University(浙江大学) Dalian University of Technology(大连理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://wkbian.github.io/Projects/RelightMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20358 2025-11-11 cs.CV 57%

PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation

Chen Wang, Chuhao Chen, Yiming Huang, Zhiyang Dou, Yuan Liu, Jiatao Gu, Lingjie Liu

机构 * University of Pennsylvania(宾夕法尼亚大学) HKU(香港大学) HKUST(香港科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09649 2025-11-11 cs.AI cs.CV cs.LG cs.RO 57%

ImitDiff: Transferring Foundation-Model Priors for Distraction Robust Visuomotor Policy

Yuhang Dong, Haizhou Ge, Yupei Zeng, Jiangning Zhang, Beiwen Tian, Hongrui Zhu, Yufei Jia, Ruixiang Wang, Zhucun Xue, Guyue Zhou, Longhua Ma, Guanzhong Tian

机构 * Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Tsinghua University(清华大学) Youtu, Tencent(腾讯优图) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05219 2025-11-10 cs.CV 57%

FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction

Jiang Lin, Xinyu Chen, Song Wu, Zhiqiu Zhang, Jizhi Zhang, Ye Wang, Qiang Tang, Qian Wang, Jian Yang, Zili Yi

机构 * Nanjing University(南京大学) JIUTIAN Research(JIUTIAN研究) University of British Columbia(不列颠哥伦比亚大学) Jilin University(吉林大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by NIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13816 2025-11-10 cs.CV 57%

MOSAIC: Generating Consistent, Privacy-Preserving Scenes from Multiple Depth Views in Multi-Room Environments

Zhixuan Liu, Haokun Zhu, Rui Chen, Jonathan Francis, Soonmin Hwang, Ji Zhang, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for AI(博世人工智能中心) Hanyang University(翰阳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08186 2025-11-10 cs.GR 57%

City Street Layout Generation via Conditional Adversarial Learning

Lehao Yang, Cui Zhu, Tian Feng

专题命中 可控生成 :image synthesis(abstract);分类 cs.GR

Comments in Chinese language

Journal ref Bulletin of Science and Technology, 2025, 41(10):83-90+115

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04317 2025-11-07 cs.CV 57%

RISE-T2V: Rephrasing and Injecting Semantics with LLM for Expansive Text-to-Video Generation

Xiangjun Zhang, Litong Gong, Yinglin Zheng, Yansong Liu, Wentao Jiang, Mingyi Xu, Biao Wang, Tiezheng Ge, Ming Zeng

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15980 2025-11-07 cs.CV cs.AI 57%

Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization

Cong Wang, Zexuan Deng, Zhiwei Jiang, Yafeng Yin, Fei Shen, Zifeng Cheng, Shiping Ge, Shiwei Gan, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04123 2025-11-07 cs.CV 57%

Text to Sketch Generation with Multi-Styles

Tengjie Li, Shikui Tu, Lei Xu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21529 2025-11-07 cs.CV 57%

Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance

Mengling Xu, Ming Tao, Bing-Kun Bao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03425 2025-11-06 cs.SD cs.LG cs.MM 57%

SyMuPe: Affective and Controllable Symbolic Music Performance

Ilya Borovik, Dmitrii Gavrilev, Vladimir Viro

机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺科学与技术研究所) Peachnote GmbH(Peachnote公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.MM

Comments ACM Multimedia 2025. Extended version with supplementary material

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (MM '25), October 27-31, 2025, Dublin, Ireland, pp. 10699-10708

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01678 2025-11-04 cs.CV 57%

UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback

Ropeway Liu, Hangjie Yuan, Bo Dong, Jiazheng Xing, Jinwang Wang, Rui Zhao, Yan Xing, Weihua Chen, Fan Wang

机构 * Zhejiang University(浙江大学) DAMO Academy Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25173 2025-11-04 cs.CV 57%

D$^2$GS: Dense Depth Regularization for LiDAR-free Urban Scene Reconstruction

Kejing Xia, Jidong Jia, Ke Jin, Yucai Bai, Li Sun, Dacheng Tao, Youjian Zhang

机构 * Wuhan University(武汉大学) Shanghai Jiaotong University(上海交通大学) TongJi University(同济大学) Bosch(博世) Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27452 2025-11-03 cs.CV 57%

From Pixels to Paths: A Multi-Agent Framework for Editable Scientific Illustration

Jianwen Sun, Fanrui Zhang, Yukang Feng, Chuanhao Li, Zizhen Li, Jiaxin Ai, Yifan Chang, Yu Dai, Kaipeng Zhang

机构 * Nankai University(南开大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18637 2025-11-03 cs.CV cs.AI cs.LG 57%

ε-Seg: Sparsely Supervised Semantic Segmentation of Microscopy Data

Sheida Rahnamai Kordasiabi, Damian Dalle Nogare, Florian Jug

机构 * Human Technopole, Milan, Italy(米兰人类技术极地) Technical University of Dresden, Germany(德累斯顿技术大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 10 pages main text, 17 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08325 2025-10-31 cs.CV 57%

GameFactory: Creating New Games with Generative Interactive Videos

Jiwen Yu, Yiran Qin, Xintao Wang, Pengfei Wan, Di Zhang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Kuaishou Technology(快手科技)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025 Highlight, Project Page: https://yujiwen.github.io/gamefactory

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03318 2025-10-30 cs.CV 57%

Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning

Yibin Wang, Zhimin Li, Yuhang Zang, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Hunyuan, Tencent(腾讯 Hunyuan)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments [NeurIPS2025] Project Page: https://codegoat24.github.io/UnifiedReward/think

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22981 2025-10-28 cs.AI cs.CV 57%

Exploring Semantic-constrained Adversarial Example with Instruction Uncertainty Reduction

Jin Hu, Jiakai Wang, Linna Jing, Haolin Li, Haodong Liu, Haotong Qin, Aishan Liu, Ke Xu, Xianglong Liu

机构 * State Key Laboratory of Complex & Critical Software Environment (CCSE), Beihang University(复杂与关键软件环境国家重点实验室,北京航空航天大学) Zhongguancun Laboratory(中关村实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Department of Information Technology and Electrical Engineering, ETH Zurich(苏黎世联邦理工学院信息科技与电气工程系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22534 2025-10-28 cs.CV 57%

SRSR: Enhancing Semantic Accuracy in Real-World Image Super-Resolution with Spatially Re-Focused Text-Conditioning

Chen Chen, Majid Abdolshah, Violetta Shevchenko, Hongdong Li, Chang Xu, Pulak Purkait

机构 * Amazon(亚马逊公司) The University of Sydney(悉尼大学) Australian National University(澳大利亚国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21887 2025-10-28 cs.CV cs.AI cs.LG 57%

Generative AI in Depth: A Survey of Recent Advances, Model Variants, and Real-World Applications

Shamim Yazdani, Akansha Singh, Nripsuta Saxena, Zichong Wang, Avash Palikhe, Deng Pan, Umapada Pal, Jie Yang, Wenbin Zhang

机构 * Florida International University(佛罗里达国际大学) Manipal Institute of Technology(曼海姆技术学院) University of Southern California(南加州大学) Indian Statistical Institute(印度统计研究所) University of Wollongong(沃林根大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by the Journal of Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21391 2025-10-27 cs.CV 57%

TerraGen: A Unified Multi-Task Layout Generation Framework for Remote Sensing Data Augmentation

Datao Tang, Hao Wang, Yudeng Xin, Hui Qiao, Dongsheng Jiang, Yin Li, Zhiheng Yu, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) University of Melbourne(墨尔本大学) China Telecom Shaanxi Branch(中国电信陕西分公司) Huawei Technologies Ltd(华为技术有限公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20888 2025-10-27 cs.CV cs.AI 57%

Video-As-Prompt: Unified Semantic Control for Video Generation

Yuxuan Bian, Xin Chen, Zenan Li, Tiancheng Zhi, Shen Sang, Linjie Luo, Qiang Xu

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Website: https://bytedance.github.io/Video-As-Prompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21491 2025-10-27 cs.CV 57%

Frame In-N-Out: Unbounded Controllable Image-to-Video Generation

Boyang Wang, Xuweiyi Chen, Matheus Gadelha, Zezhou Cheng

机构 * University of Virginia(弗吉尼亚大学) Adobe Research(Adobe研究)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17452 2025-10-23 cs.CV cs.AI 57%

Training-Free Label Space Alignment for Universal Domain Adaptation

Dujin Lee, Sojung An, Jungmyung Wi, Kuniaki Saito, Donghyun Kim

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18345 2025-10-22 cs.CV 57%

GPTFace: Generative Pre-training of Facial-Linguistic Transformer by Span Masking and Weakly Correlated Text-image Data

Yudong Li, Hao Li, Xianxu Hou, Linlin Shen

机构 * Shenzhen University(深圳大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments This work was initially drafted in November 2022

详情

展开后加载摘要…

URL PDF HTML 收藏