arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2410.18079 2024-10-24 cs.CV 57%

FreeVS: Generative View Synthesis on Free Driving Trajectory

Qitai Wang, Lue Fan, Yuqi Wang, Yuntao Chen, Zhaoxiang Zhang

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments Project Page: https://freevs24.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11965 2024-10-23 cs.CV 57%

UrbanWorld: An Urban World Model for 3D City Generation

Yu Shang, Yuming Lin, Yu Zheng, Hangyu Fan, Jingtao Ding, Jie Feng, Jiansheng Chen, Li Tian, Yong Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.04785 2024-10-22 cs.CV cs.LG eess.IV 57%

Generating Physically-Consistent Satellite Imagery for Climate Visualizations

Björn Lütjens, Brandon Leshchinskiy, Océane Boulais, Farrukh Chishtie, Natalia Díaz-Rodríguez, Margaux Masson-Forsythe, Ana Mata-Payerro, Christian Requena-Mesa, Aruna Sankaranarayanan, Aaron Piña, Yarin Gal, Chedy Raïssi, Alexander Lavin, Dava Newman

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2010.08103

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09414 2024-10-22 cs.CV 57%

Depth Anything V2

Lihe Yang, Bingyi Kang, Zilong Huang, Zhen Zhao, Xiaogang Xu, Jiashi Feng, Hengshuang Zhao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024. Project page: https://depth-anything-v2.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14540 2024-10-21 cs.CV 57%

Multi-modal Pose Diffuser: A Multimodal Generative Conditional Pose Prior

Calvin-Khang Ta, Arindam Dutta, Rohit Kundu, Rohit Lal, Hannah Dela Cruz, Dripta S. Raychaudhuri, Amit Roy-Chowdhury

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13830 2024-10-18 cs.CV 57%

DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control

Yujie Wei, Shiwei Zhang, Hangjie Yuan, Xiang Wang, Haonan Qiu, Rui Zhao, Yutong Feng, Feng Liu, Zhizhong Huang, Jiaxin Ye, Yingya Zhang, Hongming Shan

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://dreamvideo2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13030 2024-10-18 cs.CV cs.CL cs.LG 57%

Sensitivity of Generative VLMs to Semantically and Lexically Altered Prompts

Sri Harsha Dumpala, Aman Jaiswal, Chandramouli Sastry, Evangelos Milios, Sageev Oore, Hassan Sajjad

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12501 2024-10-17 cs.CV cs.AI 57%

DH-VTON: Deep Text-Driven Virtual Try-On via Hybrid Attention Learning

Jiabao Wei, Zhiyuan Ma

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 5 pages, 6 figures, ICASSP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11963 2024-10-17 cs.CV cs.AI 57%

CtrlSynth: Controllable Image Text Synthesis for Data-Efficient Multimodal Learning

Qingqing Cao, Mahyar Najibi, Sachin Mehta

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11878 2024-10-17 cs.CV cs.AI cs.LG 57%

Neural Metamorphosis

Xingyi Yang, Xinchao Wang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments in ECCV2024, https://adamdad.github.io/neumeta/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10817 2024-10-15 cs.CV cs.LG 57%

When Does Perceptual Alignment Benefit Vision Representations?

Shobhita Sundaram, Stephanie Fu, Lukas Muttenthaler, Netanel Y. Tamir, Lucy Chai, Simon Kornblith, Trevor Darrell, Phillip Isola

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments S.S. and S.F. contributed equally. Website: percep-align.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10751 2024-10-15 cs.CV 57%

DragEntity: Trajectory Guided Video Generation using Entity and Positional Relationships

Zhang Wan, Sheng Tang, Jiawei Wei, Ruize Zhang, Juan Cao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ACM MM2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10745 2024-10-15 cs.CV cs.AI 57%

FlexGen: Flexible Multi-View Generation from Text and Image Inputs

Xinli Xu, Wenhang Ge, Jiantao Lin, Jiawei Feng, Lie Xu, HanFeng Zhao, Shunsi Zhang, Ying-Cong Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.15812 2024-10-15 cs.CV 57%

LatentKeypointGAN: Controlling Images via Latent Keypoints

Xingzhe He, Bastian Wandt, Helge Rhodin

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Journal ref Conference on Robots and Vision 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06044 2024-10-10 cs.CV 57%

HyperDet: Generalizable Detection of Synthesized Images by Generating and Merging A Mixture of Hyper LoRAs

Huangsen Cao, Yongwei Wang, Yinfeng Liu, Sixian Zheng, Kangtao Lv, Zhimeng Zhang, Bo Zhang, Xin Ding, Fei Wu

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05791 2024-10-10 cs.GR cs.AI cs.SD eess.AS 57%

FürElise: Capturing and Physically Synthesizing Hand Motions of Piano Performance

Ruocheng Wang, Pei Xu, Haochen Shi, Elizabeth Schumann, C. Karen Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

Comments SIGGRAPH Asia 2024. Project page: https://for-elise.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07875 2024-10-10 cs.RO cs.AI cs.CL cs.CV cs.LG 57%

Generative Image as Action Models

Mohit Shridhar, Yat Long Lo, Stephen James

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments CoRL 2024. Website, code, checkpoints: https://genima-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09964 2024-10-10 cs.CV 57%

KPNDepth: Depth Estimation of Lane Images under Complex Rainy Environment

Zhengxu Shi

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04965 2024-10-08 cs.CV 57%

Revealing Directions for Text-guided 3D Face Editing

Zhuo Chen, Yichao Yan, Sehngqi Liu, Yuhao Cheng, Weiming Zhao, Lincheng Li, Mengxiao Bi, Xiaokang Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04671 2024-10-08 cs.CV 57%

CAR: Controllable Autoregressive Modeling for Visual Generation

Ziyu Yao, Jialin Li, Yifeng Zhou, Yong Liu, Xi Jiang, Chengjie Wang, Feng Zheng, Yuexian Zou, Lei Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Code available at: https://github.com/MiracleDance/CAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04511 2024-10-08 cs.CV cs.CL 57%

Realizing Video Summarization from the Path of Language-based Semantic Understanding

Kuan-Chen Mu, Zhi-Yi Chin, Wei-Chen Chiu

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04298 2024-10-08 cs.CV 57%

Test-Time Adaptation for Keypoint-Based Spacecraft Pose Estimation Based on Predicted-View Synthesis

Juan Ignacio Bravo Pérez-Villar, Álvaro García-Martín, Jesús Bescós, Juan C. SanMiguel

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments Preprint

Journal ref IEEE Transactions on Aerospace and Electronic Systems (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04148 2024-10-04 cs.CV 57%

Representation Synthesis by Probabilistic Many-Valued Logic Operation in Self-Supervised Learning

Hiroki Nakamura, Masashi Okada, Tadahiro Taniguchi

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted to the IEEE Open Journal of Signal Processing (ICIP2024 track)

Journal ref IEEE Open Journal of Signal Processing, vol. 5, pp. 831-840, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00464 2024-10-02 cs.CV 57%

Enabling Synergistic Full-Body Control in Prompt-Based Co-Speech Motion Generation

Bohong Chen, Yumeng Li, Yao-Xiang Ding, Tianjia Shao, Kun Zhou

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://robinwitch.github.io/SynTalker-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00337 2024-10-02 cs.CV 57%

SyntheOcc: Synthesize Geometric-Controlled Street View Images through 3D Semantic MPIs

Leheng Li, Weichao Qiu, Yingjie Cai, Xu Yan, Qing Lian, Bingbing Liu, Ying-Cong Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00309 2024-10-02 cs.CV cs.AI cs.LG 57%

Ask, Pose, Unite: Scaling Data Acquisition for Close Interactions with Vision Language Models

Laura Bravo-Sánchez, Jaewoo Heo, Zhenzhen Weng, Kuan-Chieh Wang, Serena Yeung-Levy

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project webpage: https://laubravo.github.io/apu_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19946 2024-10-01 cs.CV 57%

Illustrious: an Open Advanced Illustration Model

Sang Hyun Park, Jun Young Koh, Junha Lee, Joy Song, Dongha Kim, Hoyeon Moon, Hyunju Lee, Min Song

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19580 2024-10-01 cs.CV 57%

High Quality Human Image Animation using Regional Supervision and Motion Blur Condition

Zhongcong Xu, Chaoyue Song, Guoxian Song, Jianfeng Zhang, Jun Hao Liew, Hongyi Xu, You Xie, Linjie Luo, Guosheng Lin, Jiashi Feng, Mike Zheng Shou

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17486 2024-10-01 cs.CV 57%

TextGaze: Gaze-Controllable Face Generation with Natural Language

Hengfei Wang, Zhongqun Zhang, Yihua Cheng, Hyung Jin Chang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ACM MM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16538 2024-10-01 cs.CV 57%

OpenDlign: Open-World Point Cloud Understanding with Depth-Aligned Images

Ye Mao, Junpeng Jing, Krystian Mikolajczyk

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 17 pages (Accepted by NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏