arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4228 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4228 篇

2502.02063 2025-02-05 cs.CV cs.AI cs.GR 62%

CASIM: Composite Aware Semantic Injection for Text to Motion Generation

Che-Jui Chang, Qingze Tony Liu, Honglu Zhou, Vladimir Pavlovic, Mubbasir Kapadia

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16778 2025-01-29 cs.CV cs.AI cs.GR cs.LG 62%

FlexMotion: Lightweight, Physics-Aware, and Controllable Human Motion Generation

Arvin Tashakori, Arash Tashakori, Gongbo Yang, Z. Jane Wang, Peyman Servati

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16177 2025-01-28 cs.CV cs.AI cs.GR 62%

BAG: Body-Aligned 3D Wearable Asset Generation

Zhongjin Luo, Yang Li, Mingrui Zhang, Senbo Wang, Han Yan, Xibin Song, Taizhang Shang, Wei Mao, Hongdong Li, Xiaoguang Han, Pan Ji

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments video: https://youtu.be/XJtG82LjQKc

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01407 2025-01-03 cs.CV cs.GR cs.LG 62%

Nested Attention: Semantic-aware Attention Values for Concept Personalization

Or Patashnik, Rinon Gal, Daniil Ostashev, Sergey Tulyakov, Kfir Aberman, Daniel Cohen-Or

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR

Comments Project page at https://snap-research.github.io/NestedAttention/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14158 2024-12-31 cs.CV cs.AI cs.MM 62%

AKiRa: Augmentation Kit on Rays for optical video generation

Xi Wang, Robin Courant, Marc Christie, Vicky Kalogeiton

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20378 2024-12-31 cs.CV cs.MM cs.SD eess.AS 62%

Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control

Bingliang Li, Fengyu Yang, Yuxin Mao, Qingwen Ye, Hongkai Chen, Yiran Zhong

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

Comments AAAI 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05551 2024-12-30 cs.CV cs.MM cs.SD eess.AS 62%

Read, Watch and Scream! Sound Generation from Text and Video

Yujin Jeong, Yunji Kim, Sanghyuk Chun, Jiyoung Lee

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

Comments AAAI2025, Project page: https://naver-ai.github.io/rewas

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12206 2024-12-18 cs.MM cs.CR cs.CV 62%

Provably Secure Robust Image Steganography via Cross-Modal Error Correction

Yuang Qi, Kejiang Chen, Na Zhao, Zijin Yang, Weiming Zhang

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

Comments 7 pages. Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09597 2024-12-13 cs.CV cs.GR 62%

LiftImage3D: Lifting Any Single Image to 3D Gaussians with Video Generation Priors

Yabo Chen, Chen Yang, Jiemin Fang, Xiaopeng Zhang, Lingxi Xie, Wei Shen, Wenrui Dai, Hongkai Xiong, Qi Tian

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page: https://liftimage3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01106 2024-12-03 cs.CV cs.GR 62%

One Shot, One Talk: Whole-body Talking Avatar from a Single Image

Jun Xiang, Yudong Guo, Leipeng Hu, Boyang Guo, Yancheng Yuan, Juyong Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Project Page: https://ustc3dv.github.io/OneShotOneTalk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02095 2024-12-02 cs.CV cs.AI cs.GR 62%

DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos

Wenbo Hu, Xiangjun Gao, Xiaoyu Li, Sijie Zhao, Xiaodong Cun, Yong Zhang, Long Quan, Ying Shan

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Project webpage: https://depthcrafter.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10818 2024-11-19 cs.GR cs.CV 62%

FlipSketch: Flipping Static Drawings to Text-Guided Sketch Animations

Hmrishav Bandyopadhyay, Yi-Zhe Song

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Code: https://github.com/hmrishavbandy/FlipSketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05003 2024-11-08 cs.CV cs.AI cs.GR cs.LG 62%

ReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-Tuning

David Junhao Zhang, Roni Paiss, Shiran Zada, Nikhil Karnad, David E. Jacobs, Yael Pritch, Inbar Mosseri, Mike Zheng Shou, Neal Wadhwa, Nataniel Ruiz

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments project page: https://generative-video-camera-controls.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09728 2024-11-05 cs.CV cs.GR 62%

Neural Pose Representation Learning for Generating and Transferring Non-Rigid Object Poses

Seungwoo Yoo, Juil Koo, Kyeongmin Yeo, Minhyuk Sung

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09313 2024-10-30 cs.SE cs.AI cs.CV cs.HC cs.MM 62%

Less Cybersickness, Please: Demystifying and Detecting Stereoscopic Visual Inconsistencies in Virtual Reality Apps

Shuqing Li, Cuiyun Gao, Jianping Zhang, Yujia Zhang, Yepang Liu, Jiazhen Gu, Yun Peng, Michael R. Lyu

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

Comments This work has been accepted at the ACM International Conference on the Foundations of Software Engineering (FSE) 2024, Porto de Galinhas, Brazil. DOI: https://doi.org/10.1145/3660803

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17137 2024-10-17 cs.CV cs.AI cs.GR cs.LG 62%

Generative Models: What Do They Know? Do They Know Things? Let's Find Out!

Xiaodan Du, Nicholas Kolkin, Greg Shakhnarovich, Anand Bhattad

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments https://intrinsic-lora.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06985 2024-10-10 cs.CV cs.GR 62%

Jointly Generating Multi-view Consistent PBR Textures using Collaborative Control

Shimon Vainer, Konstantin Kutsy, Dante De Nigris, Ciara Rowles, Slava Elizarov, Simon Donné

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01592 2024-09-12 cs.CV cs.AI cs.CL cs.GR cs.LG 62%

Text-guided Controllable Mesh Refinement for Interactive 3D Modeling

Yun-Chun Chen, Selena Ling, Zhiqin Chen, Vladimir G. Kim, Matheus Gadelha, Alec Jacobson

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH Asia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06648 2024-09-11 cs.CV cs.GR 62%

Image Vectorization with Depth: convexified shape layers with depth ordering

Ho Law, Sung Ha Kang

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02657 2024-09-05 cs.CV cs.AI cs.MM 62%

PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation

Jun Ling, Yiwen Wang, Han Xue, Rong Xie, Li Song

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

Comments 7+5 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01502 2024-09-04 cs.CV cs.AI cs.GR 62%

AMG: Avatar Motion Guided Video Generation

Zhangsihao Yang, Mengyi Shan, Mohammad Farazi, Wenhui Zhu, Yanxi Chen, Xuanzhao Dong, Yalin Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments The project page is at https://github.com/zshyang/amg

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16210 2024-09-02 cs.CV cs.AI cs.GR 62%

Frankenstein: Generating Semantic-Compositional 3D Scenes in One Tri-Plane

Han Yan, Yang Li, Zhennan Wu, Shenzhou Chen, Weixuan Sun, Taizhang Shang, Weizhe Liu, Tian Chen, Xiaqiang Dai, Chao Ma, Hongdong Li, Pan Ji

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH Asia 2024 Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10195 2024-08-20 cs.CV cs.AI cs.GR 62%

SpaRP: Fast 3D Object Reconstruction and Pose Estimation from Sparse Views

Chao Xu, Ang Li, Linghao Chen, Yulin Liu, Ruoxi Shi, Hao Su, Minghua Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09787 2024-08-20 cs.CL cs.CV cs.MM 62%

Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation

Yunxin Li, Haoyuan Shi, Baotian Hu, Longyue Wang, Jiashun Zhu, Jinyi Xu, Zhen Zhao, Min Zhang

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

Comments Accepted by SIGGRAPH Asia 2024, Project and Codes: https://github.com/HITsz-TMG/Anim-Director

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06975 2024-08-14 cs.CV cs.AI cs.GR 62%

SpectralGaussians: Semantic, spectral 3D Gaussian splatting for multi-spectral scene representation, visualization and analysis

Saptarshi Neil Sinha, Holger Graf, Michael Weinmann

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14709 2024-05-29 cs.CV cs.MM 62%

OpFlowTalker: Realistic and Natural Talking Face Generation via Optical Flow Guidance

Shuheng Ge, Haoyu Xing, Li Zhang, Xiangqian Wu

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16008 2024-05-28 cs.CV cs.GR 62%

Intensity and Texture Correction of Omnidirectional Image Using Camera Images for Indirect Augmented Reality

Hakim Ikebayashi, Norihiko Kawai

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

Comments International Workshop on Frontiers of Computer Vision (IW-FCV2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08559 2024-05-27 cs.CV cs.GR cs.LG 62%

Multi-Track Timeline Control for Text-Driven 3D Human Motion Generation

Mathis Petrovich, Or Litany, Umar Iqbal, Michael J. Black, Gül Varol, Xue Bin Peng, Davis Rempe

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments CVPR 2024, HuMoGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19204 2024-05-01 cs.CV cs.AI cs.GR 62%

NeRF-Insert: 3D Local Editing with Multimodal Control Signals

Benet Oriol Sabat, Alessandro Achille, Matthew Trager, Stefano Soatto

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06310 2024-04-25 cs.CV cs.GR 62%

Structure-Guided Image Completion with Image-level and Object-level Semantic Discriminators

Haitian Zheng, Zhe Lin, Jingwan Lu, Scott Cohen, Eli Shechtman, Connelly Barnes, Jianming Zhang, Qing Liu, Yuqian Zhou, Sohrab Amirghodsi, Jiebo Luo

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

Comments 18 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏