arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2503.22941 2025-04-01 cs.AI cs.LG cs.MM 57%

Identifying Multi-modal Knowledge Neurons in Pretrained Transformers via Two-stage Filtering

Yugen Sato, Tomohiro Takagi

专题命中 可控生成 :inpainting(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15214 2025-03-31 cs.CV 57%

LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Ka Leong Cheng, Qifeng Chen, Yujun Shen, Limin Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page available at https://github.com/ant-research/LeviTor

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20523 2025-03-27 cs.CV cs.AI cs.RO 57%

GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving

Lloyd Russell, Anthony Hu, Lorenzo Bertoni, George Fedoseev, Jamie Shotton, Elahe Arani, Gianluca Corrado

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05874 2025-03-27 cs.CV cs.AI cs.LG 57%

MMGDreamer: Mixed-Modality Graph for Geometry-Controllable 3D Indoor Scene Generation

Zhifei Yang, Keyang Lu, Chao Zhang, Jiaxing Qi, Hanqi Jiang, Ruifei Ma, Shenglin Yin, Yifan Xu, Mingzhe Xing, Zhen Xiao, Jieyi Long, Guangyao Zhai

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by AAAI 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00777 2025-03-27 cs.CV eess.SP q-bio.NC 57%

CATD: Unified Representation Learning for EEG-to-fMRI Cross-Modal Generation

Weiheng Yao, Zhihan Lyu, Mufti Mahmud, Ning Zhong, Baiying Lei, Shuqiang Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 11 pages, 9 figures, Accepted by IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19383 2025-03-26 cs.CV 57%

MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait Animation

Yukang Lin, Hokit Fung, Jianjin Xu, Zeping Ren, Adela S. M. Lau, Guosheng Yin, Xiu Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18860 2025-03-26 cs.CV 57%

HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation

Zunnan Xu, Zhentao Yu, Zixiang Zhou, Jun Zhou, Xiaoyu Jin, Fa-Ting Hong, Xiaozhong Ji, Junwei Zhu, Chengfei Cai, Shiyu Tang, Qin Lin, Xiu Li, Qinglin Lu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09826 2025-03-26 cs.CV 57%

Boosting Few-Shot Semantic Segmentation Via Segment Anything Model

Chen-Bin Feng, Qi Lai, Kangdao Liu, Houcheng Su, Chi-Man Vong

专题命中 可控生成 :image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18874 2025-03-25 cs.LG cs.CV 57%

A semantic communication-based workload-adjustable transceiver for wireless AI-generated content (AIGC) delivery

Runze Cheng, Yao Sun, Lan Zhang, Lei Feng, Lei Zhang, Muhammad Ali Imran

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20085 2025-03-25 cs.CV 57%

Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language

Yicheng Chen, Xiangtai Li, Yining Li, Yanhong Zeng, Jianzong Wu, Xiangyu Zhao, Kai Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18386 2025-03-25 cs.CV cs.AI 57%

Resource-Efficient Motion Control for Video Generation via Dynamic Mask Guidance

Sicong Feng, Jielong Yang, Li Peng

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08295 2025-03-25 cs.CV 57%

LayerAnimate: Layer-level Control for Animation

Yuxue Yang, Lue Fan, Zuzeng Lin, Feng Wang, Zhaoxiang Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://layeranimate.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05892 2025-03-25 cs.CV 57%

Beyond Flat Text: Dual Self-inherited Guidance for Visual Text Generation

Minxing Luo, Zixun Xia, Liaojun Chen, Zhenhang Li, Weichao Zeng, Jianye Wang, Wentao Cheng, Yaxing Wang, Yu Zhou, Jian Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08601 2025-03-25 cs.SD cs.MM eess.AS 57%

STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment

Yong Ren, Chenxing Li, Manjie Xu, Wei Liang, Yu Gu, Rilin Chen, Dong Yu

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

Comments ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07685 2025-03-24 cs.CV 57%

Matrix3D: Large Photogrammetry Model All-in-One

Yuanxun Lu, Jingyang Zhang, Tian Fang, Jean-Daniel Nahmias, Yanghai Tsin, Long Quan, Xun Cao, Yao Yao, Shiwei Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments CVPR 2025 camera ready. Project Page: https://nju-3dv.github.io/projects/matrix3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06699 2025-03-24 cs.CV 57%

You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale

Baorui Ma, Huachen Gao, Haoge Deng, Zhengxiong Luo, Tiejun Huang, Lulu Tang, Xinlong Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025, Project Page: https://vision.baai.ac.cn/see3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14517 2025-03-20 cs.CV cs.AI 57%

Cafe-Talk: Generating 3D Talking Face Animation with Multimodal Coarse- and Fine-grained Control

Hejia Chen, Haoxian Zhang, Shoulong Zhang, Xiaoqiang Liu, Sisi Zhuang, Yuan Zhang, Pengfei Wan, Di Zhang, Shuai Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICLR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14272 2025-03-20 cs.CV eess.IV 57%

CTSR: Controllable Fidelity-Realness Trade-off Distillation for Real-World Image Super Resolution

Runyi Li, Bin Chen, Jian Zhang, Radu Timofte

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13265 2025-03-20 cs.CV 57%

FlexWorld: Progressively Expanding 3D Scenes for Flexiable-View Synthesis

Luxi Chen, Zihan Zhou, Min Zhao, Yikai Wang, Ge Zhang, Wenhao Huang, Hao Sun, Ji-Rong Wen, Chongxuan Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14129 2025-03-19 cs.CV 57%

SketchFusion: Learning Universal Sketch Features through Fusing Foundation Models

Subhadeep Koley, Tapas Kumar Dutta, Aneeshan Sain, Pinaki Nath Chowdhury, Ayan Kumar Bhunia, Yi-Zhe Song

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted in CVPR 2025. Project page available at https://subhadeepkoley.github.io/SketchFusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13721 2025-03-19 cs.CV 57%

SED-MVS: Segmentation-Driven and Edge-Aligned Deformation Multi-View Stereo with Depth Restoration and Occlusion Constraint

Zhenlong Yuan, Zhidong Yang, Yujun Cai, Kuangxin Wu, Mufan Liu, Dapeng Zhang, Hao Jiang, Zhaoxin Li, Zhaoqi Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02009 2025-03-19 cs.CV 57%

Morpheus: Text-Driven 3D Gaussian Splat Shape and Color Stylization

Jamie Wynn, Zawar Qureshi, Jakub Powierza, Jamie Watson, Mohamed Sayed

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11040 2025-03-19 eess.IV cs.CV 57%

Co-Learning Semantic-aware Unsupervised Segmentation for Pathological Image Registration

Yang Liu, Shi Gu

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 13 pages, 7 figures, published in Medical Image Computing and Computer Assisted Intervention (MICCAI) 2023

Journal ref International Conference on Medical Image Computing and Computer-Assisted Intervention, pp. 537-547. Cham: Springer Nature Switzerland, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12450 2025-03-18 cs.CV 57%

LazyMAR: Accelerating Masked Autoregressive Models via Feature Caching

Feihong Yan, Qingyan Wei, Jiayi Tang, Jiajun Li, Yulin Wang, Xuming Hu, Huiqi Li, Linfeng Zhang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19189 2025-03-18 cs.CV 57%

Video Depth without Video Models

Bingxin Ke, Dominik Narnhofer, Shengyu Huang, Lei Ke, Torben Peters, Katerina Fragkiadaki, Anton Obukhov, Konrad Schindler

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: rollingdepth.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17048 2025-03-18 cs.CV 57%

PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation

Hengjia Li, Haonan Qiu, Shiwei Zhang, Xiang Wang, Yujie Wei, Zekun Li, Yingya Zhang, Boxi Wu, Deng Cai

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17555 2025-03-18 cs.CV 57%

Scribble Hides Class: Promoting Scribble-Based Weakly-Supervised Semantic Segmentation with Its Class Label

Xinliang Zhang, Lei Zhu, Hangzhou He, Lujia Jin, Yanye Lu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11038 2025-03-17 cs.CV 57%

ACMo: Attribute Controllable Motion Generation

Mingjie Wei, Xuemei Xie, Guangming Shi

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02101 2025-03-17 cs.CV 57%

CameraCtrl: Enabling Camera Control for Text-to-Video Generation

Hao He, Yinghao Xu, Yuwei Guo, Gordon Wetzstein, Bo Dai, Hongsheng Li, Ceyuan Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://hehao13.github.io/projects-CameraCtrl/ Code: https://github.com/hehao13/CameraCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09733 2025-03-14 cs.CV 57%

I2V3D: Controllable image-to-video generation with 3D guidance

Zhiyuan Zhang, Dongdong Chen, Jing Liao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://bestzzhang.github.io/I2V3D

详情

展开后加载摘要…

URL PDF HTML 收藏