arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2503.08714 2025-07-29 cs.CV cs.AI 57%

Versatile Multimodal Controls for Expressive Talking Human Animation

Zheng Qin, Ruobing Zheng, Yabing Wang, Tianqi Li, Zixin Zhu, Sanping Zhou, Ming Yang, Le Wang

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University, Ant Group(人机混合增强智能国家级实验室,西安交通大学,蚂蚁集团) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University(人机混合增强智能国家级实验室,西安交通大学) University at Buffalo(布法罗大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ACM MM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06438 2025-07-29 cs.CV 57%

Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning

Maomao Li, Lijian Lin, Yunfei Liu, Ye Zhu, Yu Li

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 19 pages

Journal ref TVCG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19071 2025-07-28 cs.CV 57%

Cross-Subject Mind Decoding from Inaccurate Representations

Yangyang Xu, Bangzhen Liu, Wenqi Shao, Yong Du, Shengfeng He, Tingting Zhu

机构 * The University of Oxford(牛津大学) South China University of Technology(华南理工大学) Shanghai AI Lab(上海人工智能实验室) Ocean University of China(中国海洋大学) Singapore Management University(新加坡管理大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15265 2025-07-28 cs.CV cs.AI cs.CR 57%

Blind Spot Navigation: Evolutionary Discovery of Sensitive Semantic Concepts for LVLMs

Zihao Pan, Yu Tong, Weibin Wu, Jingyi Wang, Lifeng Chen, Zhe Zhao, Jiajia Wei, Yitong Qiao, Zibin Zheng

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

Comments The paper needs major revisions, so it is being withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13807 2025-07-28 cs.CV 57%

MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control

Ruiyuan Gao, Kai Chen, Bo Xiao, Lanqing Hong, Zhenguo Li, Qiang Xu

机构 * CUHK(中文大学) HKUST(香港科技大学) Huawei Cloud(华为云) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025 camera-ready version, Project Website: https://flymin.github.io/magicdrive-v2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17388 2025-07-24 cs.CV eess.IV 57%

EndoGen: Conditional Autoregressive Endoscopic Video Generation

Xinyu Liu, Hengyu Liu, Cheng Wang, Tianming Liu, Yixuan Yuan

机构 * The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) University of Georgia(佐治亚大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17083 2025-07-24 cs.CV cs.AI 57%

SDGOCC: Semantic and Depth-Guided Bird's-Eye View Transformation for 3D Multimodal Occupancy Prediction

Zaipeng Duan, Chenxu Dang, Xuzhong Hu, Pei An, Junfeng Ding, Jie Zhan, Yunbiao Xu, Jie Ma

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15728 2025-07-22 cs.CV 57%

TokensGen: Harnessing Condensed Tokens for Long Video Generation

Wenqi Ouyang, Zeqi Xiao, Danni Yang, Yifan Zhou, Shuai Yang, Lei Yang, Jianlou Si, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://vicky0522.github.io/tokensgen-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15064 2025-07-22 cs.CV cs.AI 57%

StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation

Shuyuan Tu, Zhen Xing, Xintong Han, Zhi-Qi Cheng, Qi Dai, Chong Luo, Zuxuan Wu, Yu-Gang Jiang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Tencent Inc.(腾讯公司) University of Washington(华盛顿大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2411.17697

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01425 2025-07-22 cs.CV 57%

Free-Form Motion Control: Controlling the 6D Poses of Camera and Objects in Video Generation

Xincheng Shuai, Henghui Ding, Zhenyuan Qin, Hao Luo, Xingjun Ma, Dacheng Tao

机构 * Fudan University(复旦大学) DAMO Academy, Alibaba group(阿里集团 DAMO 院) Hupan Lab(虎派实验室) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

Comments ICCV 2025, Project Page: https://henghuiding.github.io/SynFMC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03021 2025-07-22 cs.CV cs.AI 57%

PEMF-VTO: Point-Enhanced Video Virtual Try-on via Mask-free Paradigm

Tianyu Chang, Xiaohao Chen, Zhichao Wei, Xuanpu Zhang, Qing-Guo Chen, Weihua Luo, Peipei Song, Xun Yang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) School of Electrical and Information Engineering, Tianjin University(电气与信息工程学院,天津大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01729 2025-07-21 cs.CV 57%

PosePilot: Steering Camera Pose for Generative World Models with Self-supervised Depth

Bu Jin, Weize Li, Baihan Yang, Zhenxin Zhu, Junpeng Jiang, Huan-ang Gao, Haiyang Sun, Kun Zhan, Hengtong Hu, Xueyang Zhang, Peng Jia, Hao Zhao

机构 * The Hong Kong University of Science and Technology(香港科技大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Li Auto BAAI(北京人工智能研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted at IEEE/RSJ IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10059 2025-07-15 cs.CV 57%

RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control

Teng Li, Guangcong Zheng, Rui Jiang, Shuigen Zhan, Tao Wu, Yehao Lu, Yining Lin, Chuanyun Deng, Yepan Xiong, Min Chen, Lin Cheng, Xi Li

机构 * College of Computer Science & Technology, Zhejiang University(浙江大学计算机科学与技术学院) Central Media Technology Institute, 2012 Lab, Huawei(华为2012实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05426 2025-07-09 cs.CV 57%

Mastering Regional 3DGS: Locating, Initializing, and Editing with Diverse 2D Priors

Lanqing Guo, Yufei Wang, Hezhen Hu, Yan Zheng, Yeying Jin, Siyu Huang, Zhangyang Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Snap Research Tencent(腾讯) Clemson University(克莱姆森大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18364 2025-07-09 cs.CV 57%

MaSS13K: A Matting-level Semantic Segmentation Benchmark

Chenxi Xie, Minghan Li, Hui Zeng, Jun Luo, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04961 2025-07-08 cs.CV 57%

InterGSEdit: Interactive 3D Gaussian Splatting Editing with 3D Geometry-Consistent Attention Prior

Minghao Wen, Shengjie Wu, Kangkan Wang, Dong Liang

机构 * MIIT Key Laboratory of Pattern Analysis and Machine Intelligence, College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(信息产业部模式分析与机器智能重点实验室,计算机科学与技术学院,南京航空航天大学) The Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, School of Computer Science and Engineering, Nanjing University of Science and Technology(教育部高维信息智能感知与系统重点实验室,计算机科学与工程学院,南京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08553 2025-07-08 cs.CV 57%

DynamicFace: High-Quality and Consistent Face Swapping for Image and Video using Composable 3D Facial Priors

Runqi Wang, Yang Chen, Sijie Xu, Tianyao He, Wei Zhu, Dejia Song, Nemo Chen, Xu Tang, Yao Hu

机构 * Xiaohongshu(小红书) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2025. Project page: https://dynamic-face.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14419 2025-07-08 cs.CV 57%

HOTS3D: Hyper-Spherical Optimal Transport for Semantic Alignment of Text-to-3D Generation

Zezeng Li, Weimin Wang, Yuming Zhao, Wenhai Li, Na Lei, Xianfeng Gu

机构 * School of Software, Dalian University of Technology(大连理工大学软件学院) Department of Computer Science and Applied Mathematics, State University of New York at Stony Brook(石溪大学计算机科学与应用数学系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments accepted by tvcg

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07759 2025-07-08 cs.CV 57%

3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation

Xiao Fu, Xian Liu, Xintao Wang, Sida Peng, Menghan Xia, Xiaoyu Shi, Ziyang Yuan, Pengfei Wan, Di Zhang, Dahua Lin

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICLR 2025. Project Page & Code & Data: http://fuxiao0719.github.io/projects/3dtrajmaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02857 2025-07-04 cs.CV 57%

AnyI2V: Animating Any Conditional Image with Motion Control

Ziye Li, Hao Luo, Xincheng Shuai, Henghui Ding

机构 * Fudan University(复旦大学) DAMO Academy, Alibaba group(阿里达摩院) Hupan Lab(虎扑实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025, Project Page: https://henghuiding.com/AnyI2V/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02217 2025-07-04 cs.CV cs.AI 57%

Understanding Trade offs When Conditioning Synthetic Data

Brandon Trabucco, Qasim Wani, Benjamin Pikus, Vasu Sharma

机构 * Carnegie Mellon University(卡内基梅隆大学) Advex AI Facebook AI Research(脸书人工智能研究)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01409 2025-07-03 cs.CV 57%

CaptionSmiths: Flexibly Controlling Language Pattern in Image Captioning

Kuniaki Saito, Donghyun Kim, Kwanyong Park, Atsushi Hashimoto, Yoshitaka Ushiku

机构 * University of Seoul(首尔大学)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

Comments Accepted to ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17301 2025-07-03 cs.GR 57%

FramePrompt: In-context Controllable Animation with Zero Structural Changes

Guian Fang, Yuchao Gu, Mike Zheng Shou

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

Comments Project page: https://frameprompt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17269 2025-07-02 cs.CV 57%

Towards Generalized and Training-Free Text-Guided Semantic Manipulation

Yu Hong, Xiao Cai, Pengpeng Zeng, Shuai Zhang, Jingkuan Song, Lianli Gao, Heng Tao Shen

机构 * Tongji University(同济大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://ayanami-yu.github.io/GTF-Project-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23618 2025-07-01 cs.CV 57%

TurboVSR: Fantastic Video Upscalers and Where to Find Them

Zhongdao Wang, Guodongfang Zhao, Jingjing Ren, Bailan Feng, Shifeng Zhang, Wenbo Li

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22065 2025-06-30 cs.CV 57%

MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation

Dechao Meng, Steven Xiao, Xindi Zhang, Guangyuan Wang, Peng Zhang, Qi Wang, Bang Zhang, Liefeng Bo

机构 * Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21276 2025-06-27 cs.CV 57%

WordCon: Word-level Typography Control in Scene Text Rendering

Wenda Shi, Yiren Song, Zihan Rao, Dengming Zhang, Jiaming Liu, Xingxing Zou

机构 * The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18369 2025-06-24 cs.RO cs.AI cs.CV cs.SY eess.SY 57%

G3Flow: Generative 3D Semantic Flow for Pose-aware and Generalizable Object Manipulation

Tianxing Chen, Yao Mu, Zhixuan Liang, Zanxin Chen, Shijia Peng, Qiangyu Chen, Mingkun Xu, Ruizhen Hu, Hongyuan Zhang, Xuelong Li, Ping Luo

机构 * The University of Hong Kong(香港大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Shenzhen University(深圳大学) AgileX Robotics(AgileX机器人) GDIIST HKU Shanghai Intelligent Computing Research Center(香港大学上海智能计算研究中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Webpage: https://tianxingchen.github.io/G3Flow/, accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17383 2025-06-24 cs.CV 57%

AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation

Ziyi Xu, Ziyao Huang, Juan Cao, Yong Zhang, Xiaodong Cun, Qing Shuai, Yuchen Wang, Linchao Bao, Jintao Li, Fan Tang

机构 * Institute of Computing Technique, Chinese Academy of Sciences(中国科学院计算技术研究所) Meituan(美团) Great Bay University(大湾区大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19186 2025-06-24 cs.CV cs.LG 57%

Disentangling representations of retinal images with generative models

Sarah Müller, Lisa M. Koch, Hendrik P. A. Lensch, Philipp Berens

机构 * Hertie Institute for AI in Brain Health, Faculty of Medicine, University of Tübingen(人工智能与脑健康赫特研究所,医学院,图宾根大学) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心,图宾根,德国) Department of Diabetes, Endocrinology, Nutritional Medicine and Metabolism UDEM, Inselspital, Bern University Hospital, University of Bern, Bern, Switzerland(糖尿病、内分泌学、营养医学和代谢学部门UDEM,伯尔尼大学医院,伯尔尼大学,伯尔尼,瑞士) Department of Computer Science, University of Tübingen, Tübingen, Germany(计算机科学系,图宾根大学,图宾根,德国)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Final journal paper version for Medical Image Analysis (MedIA)

详情

展开后加载摘要…

URL PDF HTML 收藏