arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2502.08639 2025-02-13 cs.CV 57%

CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation

Qinghe Wang, Yawen Luo, Xiaoyu Shi, Xu Jia, Huchuan Lu, Tianfan Xue, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07711 2025-02-12 eess.AS cs.MM 57%

RenderBox: Expressive Performance Rendering with Text Control

Huan Zhang, Akira Maezawa, Simon Dixon

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07323 2025-02-12 cs.CV 57%

Semantic to Structure: Learning Structural Representations for Infringement Detection

Chuanwei Huang, Zexi Jia, Hongyan Fei, Yeshuang Zhu, Zhiqiang Yuan, Jinchao Zhang, Jie Zhou

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02929 2025-02-12 cs.CV cs.LG 57%

ZeroDiff: Solidified Visual-Semantic Correlation in Zero-Shot Learning

Zihan Ye, Shreyank N. Gowda, Xiaowei Huang, Haotian Xu, Yaochu Jin, Kaizhu Huang, Xiaobo Jin

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06338 2025-02-11 cs.CV 57%

Zero-shot Depth Completion via Test-time Alignment with Affine-invariant Depth Prior

Lee Hyoseok, Kyeong Seon Kim, Kwon Byung-Ki, Tae-Hyun Oh

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments AAAI 2025, Project page: https://hyoseok1223.github.io/zero-shot-depth-completion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09981 2025-02-11 cs.CV 57%

Controllable Text-to-3D Generation via Surface-Aligned Gaussian Splatting

Zhiqi Li, Yiming Chen, Lingzhe Zhao, Peidong Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 3DV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04299 2025-02-07 cs.CV 57%

MotionCanvas: Cinematic Shot Design with Controllable Image-to-Video Generation

Jinbo Xing, Long Mai, Cusuh Ham, Jiahui Huang, Aniruddha Mahapatra, Chi-Wing Fu, Tien-Tsin Wong, Feng Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments It is best viewed in Acrobat. Project page: https://motion-canvas25.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03836 2025-02-07 cs.CV 57%

Adapting Human Mesh Recovery with Vision-Language Feedback

Chongyang Xu, Buzhen Huang, Chengfang Zhang, Ziliang Feng, Yangang Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03493 2025-02-07 eess.IV cs.CV 57%

MetaFE-DE: Learning Meta Feature Embedding for Depth Estimation from Monocular Endoscopic Images

Dawei Lu, Deqiang Xiao, Danni Ai, Jingfan Fan, Tianyu Fu, Yucong Lin, Hong Song, Xujiong Ye, Lei Zhang, Jian Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03072 2025-02-06 cs.RO cs.CV 57%

RoboGrasp: A Universal Grasping Policy for Robust Robotic Control

Yiqi Huang, Travis Davies, Jiahuan Yan, Xiang Chen, Yu Tian, Luhui Hu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02676 2025-02-06 cs.CV cs.CR cs.LG 57%

Blind Visible Watermark Removal with Morphological Dilation

Preston K. Robinette, Taylor T. Johnson

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08948 2025-02-06 cs.CV cs.CL 57%

Mojito: Motion Trajectory and Intensity Control for Video Generation

Xuehai He, Shuohang Wang, Jianwei Yang, Xiaoxia Wu, Yiping Wang, Kuan Wang, Zheng Zhan, Olatunji Ruwase, Yelong Shen, Xin Eric Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01675 2025-02-05 cs.CV cs.AI cs.LG 57%

Semantic Communication based on Generative AI: A New Approach to Image Compression and Edge Optimization

Francesco Pezone

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06006 2025-02-03 cs.CV 57%

CamCtrl3D: Single-Image Scene Exploration with Precise 3D Camera Control

Stefan Popov, Amit Raj, Michael Krainin, Yuanzhen Li, William T. Freeman, Michael Rubinstein

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments To be published in 3DV 2025. Project page at https://camctrl3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18801 2025-02-03 cs.CV cs.AI 57%

Every Image Listens, Every Image Dances: Music-Driven Image Animation

Zhikang Dong, Weituo Hao, Ju-Chiang Wang, Peng Zhang, Pawel Polak

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18726 2025-02-03 cs.CV 57%

Strong and Controllable 3D Motion Generation

Canxuan Gang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15839 2025-01-28 cs.CV 57%

Controllable Hand Grasp Generation for HOI and Efficient Evaluation Methods

Ishant, Rongliang Wu, Joo Hwee Lim

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15648 2025-01-28 cs.CV cs.AI cs.LG 57%

Can Pose Transfer Models Generate Realistic Human Motion?

Vaclav Knapp, Matyas Bohacek

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Data and code available at https://github.com/matyasbohacek/pose-transfer-human-motion

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14533 2025-01-27 cs.CV 57%

CheapNVS: Real-Time On-Device Narrow-Baseline Novel View Synthesis

Konstantinos Georgiadis, Mehmet Kerim Yucel, Albert Saa-Garriga

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Accepted to ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10021 2025-01-22 cs.CV 57%

X-Dyna: Expressive Dynamic Human Image Animation

Di Chang, Hongyi Xu, You Xie, Yipeng Gao, Zhengfei Kuang, Shengqu Cai, Chenxu Zhang, Guoxian Song, Chao Wang, Yichun Shi, Zeyuan Chen, Shijie Zhou, Linjie Luo, Gordon Wetzstein, Mohammad Soleymani

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page:https://x-dyna.github.io/xdyna.github.io/ Code:https://github.com/bytedance/X-Dyna Model:https://huggingface.co/Boese0601/X-Dyna

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09393 2025-01-17 cs.CV 57%

SVIA: A Street View Image Anonymization Framework for Self-Driving Applications

Dongyu Liu, Xuhong Wang, Cen Chen, Yanhao Wang, Shengyue Yao, Yilun Lin

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 8 pages, 6 figures, 3 tables. Accepted by IEEE ITSC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08649 2025-01-16 cs.CV cs.LG 57%

Joint Learning of Depth and Appearance for Portrait Image Animation

Xinya Ji, Gaspard Zoss, Prashanth Chandran, Lingchen Yang, Xun Cao, Barbara Solenthaler, Derek Bradley

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03335 2025-01-15 cs.SD cs.CV cs.LG eess.AS 57%

Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition

Zixuan Wang, Chi-Keung Tang, Yu-Wing Tai

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02962 2025-01-08 cs.CV 57%

SceneVTG++: Controllable Multilingual Visual Text Generation in the Wild

Jiawei Liu, Yuanzhi Zhu, Feiyu Gao, Zhibo Yang, Peng Wang, Junyang Lin, Xinggang Wang, Wenyu Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02706 2025-01-07 cs.CV 57%

Multilevel Semantic-Aware Model for AI-Generated Video Quality Assessment

Jiaze Li, Haoran Xu, Shiding Zhu, Junwei He, Haozhao Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02264 2025-01-07 cs.CV 57%

Unsupervised Class Generation to Expand Semantic Segmentation Datasets

Javier Montalvo, Álvaro García-Martín, Pablo Carballeira, Juan C. SanMiguel

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11475 2025-01-07 cs.CV 57%

TrackGo: A Flexible and Efficient Method for Controllable Video Generation

Haitao Zhou, Chuang Wang, Rui Nie, Jinlin Liu, Dongdong Yu, Qian Yu, Changhu Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00816 2025-01-03 cs.CV 57%

MixSA: Training-free Reference-based Sketch Extraction via Mixture-of-Self-Attention

Rui Yang, Xiaojun Wu, Shengfeng He

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 25 pages, 25 figures; Accepted by IEEE IEEE Transactions on Visualization and Computer Graphics, 2024 (TVCG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08394 2025-01-03 cs.CV 57%

VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks

Jiannan Wu, Muyan Zhong, Sen Xing, Zeqiang Lai, Zhaoyang Liu, Zhe Chen, Wenhai Wang, Xizhou Zhu, Lewei Lu, Tong Lu, Ping Luo, Yu Qiao, Jifeng Dai

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20901 2024-12-31 cs.CV cs.AI 57%

ILDiff: Generate Transparent Animated Stickers by Implicit Layout Distillation

Ting Zhang, Zhiqiang Yuan, Yeshuang Zhu, Jinchao Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏