arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2505.20861 2025-05-28 cs.CV 57%

Exploring Timeline Control for Facial Motion Generation

Yifeng Ma, Jinwei Qi, Chaonan Ji, Peng Zhang, Bang Zhang, Zhidong Deng, Liefeng Bo

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025, Project Page: https://humanaigc.github.io/facial-motion-timeline-control/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20814 2025-05-28 cs.RO cs.CV 57%

Spatial RoboGrasp: Generalized Robotic Grasping Control Policy

Yiqi Huang, Travis Davies, Jiahuan Yan, Jiankai Sun, Xiang Chen, Luhui Hu

机构 * Stanford University(斯坦福大学) Peking University(北京大学) ZhiCheng AI(智城AI)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00396 2025-05-28 cs.CV 57%

SPF-Portrait: Towards Pure Text-to-Portrait Customization with Semantic Pollution-Free Fine-Tuning

Xiaole Xian, Zhichao Liao, Qingyu Li, Wenyu Qin, Pengfei Wan, Weicheng Xie, Long Zeng, Linlin Shen, Pingfa Feng

机构 * Shenzhen University(深圳大学) Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19569 2025-05-27 cs.CV 57%

What You Perceive Is What You Conceive: A Cognition-Inspired Framework for Open Vocabulary Image Segmentation

Jianghang Lin, Yue Hu, Jiangtao Shen, Yunhang Shen, Liujuan Cao, Shengchuan Zhang, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19239 2025-05-27 cs.CV 57%

DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving

Chen Shi, Shaoshuai Shi, Kehua Sheng, Bo Zhang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18650 2025-05-27 cs.CV 57%

ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos

Xiaodong Wang, Peixi Peng

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05721 2025-05-27 cs.CV 57%

Semantic-Space-Intervened Diffusive Alignment for Visual Classification

Zixuan Li, Lei Meng, Guoqing Chao, Wei Wu, Xiaoshuo Yan, Yimeng Yang, Zhuang Qi, Xiangxu Meng

机构 * School of Software, Shandong University(软件学院,山东大学) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13548 2025-05-27 cs.CV cs.AI 57%

Beyond One-Hot Labels: Semantic Mixing for Model Calibration

Haoyang Luo, Linwei Tao, Minjing Dong, Chang Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17358 2025-05-26 cs.CV 57%

Repurposing Marigold for Zero-Shot Metric Depth Estimation via Defocus Blur Cues

Chinmay Talegaonkar, Nikhil Gandudi Suresh, Zachary Novack, Yash Belhe, Priyanka Nagasamudra, Nicholas Antipa

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17256 2025-05-26 cs.CV 57%

ExpertGen: Training-Free Expert Guidance for Controllable Text-to-Face Generation

Liang Shi, Yun Fu

机构 * Northeastern University(东北大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12199 2025-05-20 cs.CV cs.AI 57%

Always Clear Depth: Robust Monocular Depth Estimation under Adverse Weather

Kui Jiang, Jing Cao, Zhaocheng Yu, Junjun Jiang, Jingchun Zhou

机构 * Harbin Institute of Technology(哈尔滨工业大学) Dalian Maritime University(大连海事大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05530 2025-05-20 cs.RO cs.AI cs.CV 57%

This&That: Language-Gesture Controlled Video Generation for Robot Planning

Boyang Wang, Nikhil Sridhar, Chao Feng, Mark Van der Merwe, Adam Fishman, Nima Fazeli, Jeong Joon Park

机构 * University of Michigan(密歇根大学) University of Washington(华盛顿大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10565 2025-05-16 cs.CV 57%

Depth Anything with Any Prior

Zehan Wang, Siyu Chen, Lihe Yang, Jialei Wang, Ziang Zhang, Hengshuang Zhao, Zhou Zhao

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Home page: https://prior-depth-anything.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10405 2025-05-16 eess.IV cs.AI cs.CV cs.LG 57%

Visual Fidelity Index for Generative Semantic Communications with Critical Information Embedding

Jianhao Huang, Qunsong Zeng, Kaibin Huang

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(电子与电气工程系,香港大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09723 2025-05-16 cs.RO cs.CV 57%

EnerVerse-AC: Envisioning Embodied Environments with Action Condition

Yuxin Jiang, Shengcong Chen, Siyuan Huang, Liliang Chen, Pengfei Zhou, Yue Liao, Xindong He, Chiming Liu, Hongsheng Li, Maoqing Yao, Guanghui Ren

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Website: https://annaj2178.github.io/EnerverseAC.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08607 2025-05-14 cs.CV 57%

Boosting Zero-shot Stereo Matching using Large-scale Mixed Images Sources in the Real World

Yuran Wang, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08234 2025-05-14 cs.CV cs.AI cs.CR 57%

Removing Watermarks with Partial Regeneration using Semantic Information

Krti Tallam, John Kevin Cava, Caleb Geniesse, N. Benjamin Erichson, Michael W. Mahoney

机构 * International Computer Science Institute(国际计算机科学研究所) School of Computing and Augmented Intelligence(计算与增强智能学院) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) Department of Statistics(统计学系) University of California at Berkeley(加州大学伯克利分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02240 2025-05-14 cs.CV cs.AI 57%

SCA: Improve Semantic Consistent in Unrestricted Adversarial Attacks via DDPM Inversion

Zihao Pan, Lifeng Chen, Weibin Wu, Yuhang Cao, Zibin Zheng

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) Computer Science, Beijing Jiaotong University(北京交通大学计算机科学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07747 2025-05-13 cs.CV 57%

Step1X-3D: Towards High-Fidelity and Controllable Generation of Textured 3D Assets

Weiyu Li, Xuanyang Zhang, Zheng Sun, Di Qi, Hao Li, Wei Cheng, Weiwei Cai, Shihao Wu, Jiarui Liu, Zihao Wang, Xiao Chen, Feipeng Tian, Jianxiong Pan, Zeming Li, Gang Yu, Xiangyu Zhang, Daxin Jiang, Ping Tan

机构 * Step1X-3D Team(Step1X-3D 团队) LightIllusions Team(LightIllusions 团队)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11936 2025-05-06 cs.GR cs.HC eess.SP 57%

Mind2Matter: Creating 3D Models from EEG Signals

Xia Deng, Shen Chen, Jiale Zhou, Lei Li

专题命中 可控生成 :image generation(abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00135 2025-05-02 cs.CV 57%

Eye2Eye: A Simple Approach for Monocular-to-Stereo Video Synthesis

Michal Geyer, Omer Tov, Linyi Jin, Richard Tucker, Inbar Mosseri, Tali Dekel, Noah Snavely

机构 * Google DeepMind(谷歌DeepMind) Weizmann Institute of Science(魏茨曼科学研究院) University of Michigan(密歇根大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18416 2025-05-02 cs.CV 57%

3D StreetUnveiler with Semantic-aware 2DGS -- a simple baseline

Jingwei Xu, Yikai Wang, Yiqun Zhao, Yanwei Fu, Shenghua Gao

机构 * ShanghaiTech University(上海科技大学) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学) HKU Shanghai Intelligent Computing Research Center(香港大学上海智能计算研究中心) Fudan University(复旦大学) Fudan ISTBI–ZJNU Algorithm Centre for Brain-inspired Intelligence, Zhejiang Normal University(复旦大学脑启发式智能算法中心,浙江师范大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Project page: https://streetunveiler.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21814 2025-05-01 cs.CV 57%

Why Compress What You Can Generate? When GPT-4o Generation Ushers in Image Compression Fields

Yixin Gao, Xiaohan Pan, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15032 2025-05-01 cs.CV 57%

DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation

Weijie He, Mushui Liu, Yunlong Yu, Zhao Wang, Chao Wu

机构 * Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20042 2025-04-29 cs.CV 57%

CompleteMe: Reference-based Human Image Completion

Yu-Ju Tsai, Brian Price, Qing Liu, Luis Figueroa, Daniil Pakhomov, Zhihong Ding, Scott Cohen, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) Adobe Research(Adobe研究院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Project page: https://liagm.github.io/CompleteMe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19645 2025-04-29 cs.RO cs.AI cs.CV cs.LG 57%

Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success

Moo Jin Kim, Chelsea Finn, Percy Liang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to Robotics: Science and Systems (RSS) 2025. Project website: https://openvla-oft.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11934 2025-04-29 cs.CV cs.AI 57%

SpatialDreamer: Self-supervised Stereo Video Synthesis from Monocular Input

Zhen Lv, Yangqi Long, Congzhentao Huang, Cao Li, Chengfei Lv, Hao Ren, Dian Zheng

机构 * Alibaba Group(阿里巴巴集团) Sun Yat-sen University(中山大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments website, see https://spatialdreamer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20332 2025-04-29 eess.IV cs.CV 57%

Devil is in Details: Locality-Aware 3D Abdominal CT Volume Generation for Self-Supervised Organ Segmentation

Yuran Wang, Zhijing Wan, Yansheng Qiu, Zheng Wang

机构 * National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) Hubei Key Laboratory of Multimedia and Network Communication Engineering(湖北省多媒体与网络通信工程重点实验室) Institute of Artificial Intelligence(人工智能研究院) School of Computer Science(计算机科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ACM MM 2024. Code is available at https://github.com/Ryann-Ran/Lad

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18332 2025-04-28 cs.CV cs.HC 57%

SSD-Poser: Avatar Pose Estimation with State Space Duality from Sparse Observations

Shuting Zhao, Linxin Bai, Liangjing Shao, Ye Zhang, Xinrong Chen

机构 * Academy for Engineering & Technology, Fudan University(复旦大学工程与技术学院) College of Vocational and Technical Teacher Education, Shanghai Polytechnic University(上海理工大学职业技术与教师教育学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 9 pages, 6 figures, conference ICMR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16874 2025-04-28 cs.CV 57%

CoCoGesture: Toward Coherent Co-speech 3D Gesture Generation in the Wild

Xingqun Qi, Hengyuan Zhang, Yatian Wang, Jiahao Pan, Chen Liu, Peng Li, Xiaowei Chi, Mengfei Li, Wei Xue, Shanghang Zhang, Wenhan Luo, Qifeng Liu, Yike Guo

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments After the submission of the paper, we realized that the study still has room for expansion. In order to make the research findings more profound and comprehensive, we have decided to withdraw the paper so that we can conduct further research and expansion

详情

展开后加载摘要…

URL PDF HTML 收藏