arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2510.15873 2025-10-21 cs.GR 57%

Two-Stage Sketch-Based Smoke Illustration Generation using Stream Function

Hengyuan Chang, Xiaoxuan Xie, Syuhei Sato, Haoran Xie

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

Comments 3 pages, 4 figures. SIGGRAPH 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10780 2025-10-21 cs.CV 57%

MaskControl: Spatio-Temporal Control for Masked Motion Synthesis

Ekkasit Pinyoanuntapong, Muhammad Usama Saleem, Korrawe Karunratanakul, Pu Wang, Hongfei Xue, Chen Chen, Chuan Guo, Junli Cao, Jian Ren, Sergey Tulyakov

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) ETH Zürich(苏黎世联邦理工学院) University of Central Florida(中央佛罗里达大学) Snap Inc.(Snap公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Camera Ready Version. ICCV2025 (Oral). Change name from ControlMM to MaskControl. project page https://exitudio.github.io/ControlMM-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15783 2025-10-20 cs.CV 57%

ReCon: Region-Controllable Data Augmentation with Rectification and Alignment for Object Detection

Haowei Zhu, Tianxiang Pan, Rui Qin, Jun-Hai Yong, Bin Wang

机构 * Tsinghua University(清华大学) Li Auto Inc.(力汽车公司) BNRist(BNR机构)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15564 2025-10-20 cs.CV 57%

Imaginarium: Vision-guided High-Quality 3D Scene Layout Generation

Xiaoming Zhu, Xu Huang, Qinghongbing Xie, Zhi Deng, Junsheng Yu, Yirui Guan, Zhongyuan Liu, Lin Zhu, Qijun Zhao, Ligang Liu, Long Zeng

机构 * Tsinghua University(清华大学) Tencent(腾讯) Southeast University(东南大学) University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14952 2025-10-20 cs.RO cs.CV 57%

From Language to Locomotion: Retargeting-free Humanoid Control via Motion Latent Guidance

Zhe Li, Cheng Chi, Yangyang Wei, Boan Zhu, Yibo Peng, Tao Huang, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang, Chang Xu

机构 * University of Sydney(悉尼大学) BAAI(北京人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14874 2025-10-17 cs.CV 57%

TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions

Guangyi Han, Wei Zhai, Yuhang Yang, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14536 2025-10-17 cs.CV 57%

Exploring Image Representation with Decoupled Classical Visual Descriptors

Chenyuan Qu, Hao Chen, Jianbo Jiao

机构 * The MIx Group University of Birmingham, UK(米克斯小组英国伯明翰大学) University of Cambridge Cambridge, UK(剑桥大学) Allsee Technologies Ltd Birmingham, UK(Allsee技术有限公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted by The 36th British Machine Vision Conference (BMVC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01912 2025-10-16 cs.CV 57%

Unconditional CNN denoisers contain sparse semantic representation of images

Zahra Kadkhodaie, Stéphane Mallat, Eero Simoncelli

机构 * New York University(纽约大学) Flatiron Institute(Flatiron研究所) Collège de France(法兰西学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12069 2025-10-15 cs.CV 57%

VIDMP3: Video Editing by Representing Motion with Pose and Position Priors

Sandeep Mishra, Oindrila Saha, Alan C. Bovik

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11649 2025-10-14 cs.CV 57%

PhySIC: Physically Plausible 3D Human-Scene Interaction and Contact from a Single Image

Pradyumna Yalandur Muralidhar, Yuxuan Xue, Xianghui Xie, Margaret Kostyrko, Gerard Pons-Moll

机构 * University of Tübingen, Zuse School ELIZA(图宾根大学Zuse学校ELIZA) University of Tübingen, Tübingen AI Center(图宾根大学图宾根人工智能中心) University of Tübingen, Tübingen AI Center, MPI for Informatics, SIC(图宾根大学图宾根人工智能中心、马克斯·普朗克信息研究所、SIC)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Accepted to ACM SIGGraphAsia 2025. Project website: https://yuxuan-xue.com/physic

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10650 2025-10-14 cs.CV cs.AI 57%

DEMO: Disentangled Motion Latent Flow Matching for Fine-Grained Controllable Talking Portrait Synthesis

Peiyin Chen, Zhuowei Yang, Hui Feng, Sheng Jiang, Rui Yan

机构 * College of Artificial Intelligence and Automation, Hohai University(人工智能与自动化学院,河海大学) College of DaYu, Hohai University(大禹学院,河海大学) College of Water Conserwancy and Hydropower Engineering, Hohai University(水利水电工程学院,河海大学) College of Computer Science and Technology, Zhejiang University of Technology(计算机科学与技术学院,浙江工业大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09817 2025-10-14 cs.RO cs.CV 57%

Cross-Sensor Touch Generation

Samanta Rodriguez, Yiming Dou, Miquel Oller, Andrew Owens, Nima Fazeli

机构 * University of Michigan(密歇根大学) Cornell University(康奈尔大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08561 2025-10-14 cs.CV 57%

MultiCOIN: Multi-Modal COntrollable Video INbetweening

Maham Tanveer, Yang Zhou, Simon Niklaus, Ali Mahdavi Amiri, Hao Zhang, Krishna Kumar Singh, Nanxuan Zhao

机构 * Simon Fraser University(西蒙弗雷泽大学) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project website: https://multicoinx.github.io/multicoin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01298 2025-10-13 q-bio.QM cs.CV cs.LG 57%

MorphGen: Controllable and Morphologically Plausible Generative Cell-Imaging

Berker Demirel, Marco Fumero, Theofanis Karaletsos, Francesco Locatello

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24893 2025-10-09 cs.CV 57%

HBSplat: Robust Sparse-View Gaussian Reconstruction with Hybrid-Loss Guided Depth and Bidirectional Warping

Yu Ma, Guoliang Wei, Haihong Xiao, Yue Cheng

机构 * University of Shanghai for Science and Technology(上海理工大学) Hefei University of Technology(合肥工业大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 14 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04438 2025-10-07 cs.CV cs.CL 57%

The Telephone Game: Evaluating Semantic Drift in Unified Models

Sabbir Mollah, Rohit Gupta, Sirnam Swetha, Qingyang Liu, Ahnaf Munir, Mubarak Shah

机构 * Center For Research in Computer Vision, University of Central Florida, USA(计算机视觉研究中心,中央佛罗里达大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02268 2025-10-03 cs.RO cs.CV 57%

Do You Know Where Your Camera Is? View-Invariant Policy Learning with Camera Conditioning

Tianchong Jiang, Jingtian Ji, Xiangshan Tan, Jiading Fang, Anand Bhattad, Vitor Guizilini, Matthew R. Walter

机构 * Toyota Technological Institute at Chicago(丰田技术研究所芝加哥分所) Waymo Johns Hopkins University(约翰霍普金斯大学) Toyota Research Institute(丰田研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Code and project materials are available at ripl.github.io/know_your_camera

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26599 2025-10-01 cs.CV 57%

DiffCamera: Arbitrary Refocusing on Images

Yiyang Wang, Xi Chen, Xiaogang Xu, Yu Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23643 2025-10-01 cs.CV 57%

Griffin: Generative Reference and Layout Guided Image Composition

Aryan Mikaeili, Amirhossein Alimohammadi, Negar Hassanpour, Ali Mahdavi-Amiri, Andrea Tagliasacchi

机构 * Simon Fraser University(西蒙弗雷泽大学) Huawei(华为) University of Toronto(多伦多大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24823 2025-09-30 cs.CR cs.AI cs.CV cs.LG 57%

Of-SemWat: High-payload text embedding for semantic watermarking of AI-generated images with arbitrary size

Benedetta Tondi, Andrea Costanzo, Mauro Barni

机构 * University of Siena(锡耶纳大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23911 2025-09-30 cs.CV 57%

MoReact: Generating Reactive Motion from Textual Descriptions

Xiyan Xu, Sirui Xu, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23736 2025-09-30 cs.CV cs.AI 57%

HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation

Cong Chen, Ziyuan Huang, Cheng Zou, Muzhi Zhu, Kaixiang Ji, Jiajia Liu, Jingdong Chen, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University of Technology(浙江工业大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23708 2025-09-30 cs.CV cs.AI 57%

CrimEdit: Controllable Editing for Counterfactual Object Removal, Insertion, and Movement

Boseong Jeon, Junghyuk Lee, Jimin Park, Kwanyoung Kim, Jingi Jung, Sangwon Lee, Hyunbo Shim

机构 * Samsung Research(三星研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12341 2025-09-30 cs.CV cs.AI 57%

Semantic Discrepancy-aware Detector for Image Forgery Identification

Ziye Wang, Minghang Yu, Chunyan Xu, Zhen Cui

机构 * Nanjing University of Science and Technology(南京理工大学) Beijing Normal University(北京师范大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13838 2025-09-30 eess.SP cs.CV cs.IT eess.IV math.IT 57%

Generative Video Semantic Communication via Multimodal Semantic Fusion with Large Model

Hang Yin, Li Qiao, Yu Ma, Shuo Sun, Kan Li, Zhen Gao, Dusit Niyato

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22169 2025-09-29 cs.CV cs.LG 57%

DragGANSpace: Latent Space Exploration and Control for GANs

Kirsten Odendaal, Neela Kaushik, Spencer Halverson

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments 6 pages with 7 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22432 2025-09-29 cs.CV 57%

Shape-for-Motion: Precise and Consistent Video Editing with 3D Proxy

Yuhao Liu, Tengfei Wang, Fang Liu, Zhenwei Wang, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by Siggraph Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21119 2025-09-26 cs.CV 57%

MotionFlow:Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation

Guojun Lei, Chi Wang, Yikai Wang, Hong Li, Ying Song, Weiwei Xu

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Beihang University(北航) Zhejiang Gongshang University(浙江工商大学) ShengShu(盛舒)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15269 2025-09-26 cs.CV cs.AI 57%

Conditional Video Generation for High-Efficiency Video Compression

Fangqiu Yi, Jingyu Xu, Jiawei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08705 2025-09-26 cs.CV cs.AI 57%

Instance-aware Image Colorization with Controllable Textual Descriptions and Segmentation Masks

Yanru An, Ling Gui, Chunlei Cai, Tianxiao Ye, JIangchao Yao, Guangtao Zhai, Qiang Hu, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏