arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2504.17234 2025-04-25 cs.CV 57%

Scene Perceived Image Perceptual Score (SPIPS): combining global and local perception for image quality assessment

Zhiqiang Lao, Heather Yu

机构 * Futurewei Technologies Inc(未来科技公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17067 2025-04-25 cs.CV 57%

PPS-Ctrl: Controllable Sim-to-Real Translation for Colonoscopy Depth Estimation

Xinqi Xiong, Andrea Dunn Beltran, Jun Myeong Choi, Marc Niethammer, Roni Sengupta

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21979 2025-04-23 cs.CV 57%

Harmonizing Visual Representations for Unified Multimodal Understanding and Generation

Size Wu, Wenwei Zhang, Lumin Xu, Sheng Jin, Zhonghua Wu, Qingyi Tao, Wentao Liu, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory Research(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) SenseTime Research and Tetras.AI(SenseTime研究部和Tetras.AI) SenseTime Research(商汤科技研究院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14606 2025-04-22 cs.CV 57%

MP-Mat: A 3D-and-Instance-Aware Human Matting and Editing Framework with Multiplane Representation

Siyi Jiao, Wenzheng Zeng, Yerong Li, Huayu Zhang, Changxin Gao, Nong Sang, Mike Zheng Shou

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(图像处理与智能控制重点实验室,人工智能与自动化学院,华中科技大学) Show Lab, National University of Singapore(Show实验室,新加坡国立大学)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00387 2025-04-22 cs.CV 57%

Scene4U: Hierarchical Layered 3D Scene Reconstruction from Single Panoramic Image for Your Immerse Exploration

Zilong Huang, Jun He, Junyan Ye, Lihan Jiang, Weijia Li, Yiping Chen, Ting Han

机构 * Sun Yat-sen University(中山大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments CVPR 2025, 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19204 2025-04-22 cs.CV 57%

Distill Any Depth: Distillation Creates a Stronger Monocular Depth Estimator

Xiankang He, Dongyan Guo, Hongji Li, Ruibo Li, Ying Cui, Chi Zhang

机构 * Zhejiang University of Technology(浙江工业大学) AGI Lab, Westlake University(西湖大学AGI实验室) Lanzhou University(兰州大学) Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments project page: https://distill-any-depth-official.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14548 2025-04-22 cs.CV cs.AI 57%

VGNC: Reducing the Overfitting of Sparse-view 3DGS via Validation-guided Gaussian Number Control

Lifeng Lin, Rongfeng Lu, Quan Chen, Haofan Ren, Ming Lu, Yaoqi Sun, Chenggang Yan, Anke Xue

机构 * Hangzhou Dianzi University(杭州电子科技大学) Intel Labs China(英特尔中国实验室) Lishui University(丽水大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 10 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13172 2025-04-18 cs.IR cs.CL cs.MM 57%

SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs

Haoxuan Li, Yi Bin, Yunshan Ma, Guoqing Wang, Yang Yang, See-Kiong Ng, Tat-Seng Chua

专题命中 可控生成 :text-to-image(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12245 2025-04-17 cs.CV eess.IV 57%

SIDME: Self-supervised Image Demoiréing via Masked Encoder-Decoder Reconstruction

Xia Wang, Haiyang Sun, Tiantian Cao, Yueying Sun, Min Feng

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12048 2025-04-17 cs.CV 57%

Modular-Cam: Modular Dynamic Camera-view Video Generation with LLM

Zirui Pan, Xin Wang, Yipeng Zhang, Hong Chen, Kwan Man Cheng, Yaofei Wu, Wenwu Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments AAAI 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09887 2025-04-15 cs.CV 57%

Enhanced Semantic Extraction and Guidance for UGC Image Super Resolution

Yiwen Wang, Ying Liang, Yuxuan Zhang, Xinning Chai, Zhengxue Cheng, Yingsheng Qin, Yucai Yang, Rong Xie, Li Song

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07224 2025-04-15 cs.CV 57%

Painting 3D Nature in 2D: View Synthesis of Natural Scenes from a Single Semantic Mask

Shangzan Zhang, Sida Peng, Tianrun Chen, Linzhan Mou, Haotong Lin, Kaicheng Yu, Yiyi Liao, Xiaowei Zhou

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00569 2025-04-15 cs.CV cs.LG 57%

Probing Visual Language Priors in VLMs

Tiange Luo, Ang Cao, Gunhee Lee, Justin Johnson, Honglak Lee

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Project Page: https://vilp-team.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08654 2025-04-14 cs.CV 57%

The Invisible EgoHand: 3D Hand Forecasting through EgoBody Pose Estimation

Masashi Hatano, Zhifan Zhu, Hideo Saito, Dima Damen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08641 2025-04-14 cs.CV cs.AI cs.CL 57%

Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization

Jialu Li, Shoubin Yu, Han Lin, Jaemin Cho, Jaehong Yoon, Mohit Bansal

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Website: https://video-msg.github.io; The first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08473 2025-04-14 cs.CV 57%

Cut-and-Splat: Leveraging Gaussian Splatting for Synthetic Data Generation

Bram Vanherle, Brent Zoomers, Jeroen Put, Frank Van Reeth, Nick Michiels

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted at the International Conference on Robotics, Computer Vision and Intelligent Systems 2025 (ROBOVIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08181 2025-04-14 cs.CV cs.AI 57%

TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation

Ruineng Li, Daitao Xing, Huiming Sun, Yuanzhou Ha, Jinglin Shen, Chiuman Ho

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14367 2025-04-14 cs.CV 57%

Thinking Racial Bias in Fair Forgery Detection: Models, Datasets and Evaluations

Decheng Liu, Zongqi Wang, Chunlei Peng, Nannan Wang, Ruimin Hu, Xinbo Gao

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments The paper is accepted in AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07382 2025-04-11 cs.CV 57%

Model Discrepancy Learning: Synthetic Faces Detection Based on Multi-Reconstruction

Qingchao Jiang, Zhishuo Xu, Zhiying Zhu, Ning Chen, Haoyue Wang, Zhongjie Ba

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06895 2025-04-10 cs.CV 57%

ColorizeDiffusion v2: Enhancing Reference-based Sketch Colorization Through Separating Utilities

Dingkun Yan, Xinrui Wang, Yusuke Iwasawa, Yutaka Matsuo, Suguru Saito, Jiaxian Guo

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04170 2025-04-10 cs.AI cs.CV cs.RO 57%

Digital Gene: Learning about the Physical World through Analytic Concepts

Jianhua Sun, Cewu Lu

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16199 2025-04-09 cs.CV 57%

VIRES: Video Instance Repainting via Sketch and Text Guided Generation

Shuchen Weng, Haojie Zheng, Peixuan Zhang, Yuchen Hong, Han Jiang, Si Li, Boxin Shi

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04423 2025-04-08 cs.CV cs.AI 57%

UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding

Yang Jiao, Haibo Qiu, Zequn Jie, Shaoxiang Chen, Jingjing Chen, Lin Ma, Yu-Gang Jiang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accpeted to CVPR 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06786 2025-04-07 cs.CV 57%

Retrieving Semantics from the Deep: an RAG Solution for Gesture Synthesis

M. Hamza Mughal, Rishabh Dabral, Merel C. J. Scholman, Vera Demberg, Christian Theobalt

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://vcai.mpi-inf.mpg.de/projects/RAG-Gesture/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02312 2025-04-04 cs.CV cs.AI 57%

OmniCam: Unified Multimodal Video Generation via Camera Control

Xiaoda Yang, Jiayang Xu, Kaixuan Luan, Xinyu Zhan, Hongshun Qiu, Shijun Shi, Hao Li, Shuai Yang, Li Zhang, Checheng Yu, Cewu Lu, Lixin Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03017 2025-04-04 cs.CV 57%

Pixel-level and Semantic-level Adjustable Super-resolution: A Dual-LoRA Approach

Lingchen Sun, Rongyuan Wu, Zhiyuan Ma, Shuaizheng Liu, Qiaosi Yi, Lei Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06682 2025-04-03 cs.CV 57%

Transfer Your Perspective: Controllable 3D Generation from Any Viewpoint in a Driving Scene

Tai-Yu Pan, Sooyoung Jeon, Mengdi Fan, Jinsu Yoo, Zhenyang Feng, Mark Campbell, Kilian Q. Weinberger, Bharath Hariharan, Wei-Lun Chao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23684 2025-04-01 cs.CV 57%

Detail-aware multi-view stereo network for depth estimation

Haitao Tian, Junyang Li, Chenxing Wang, Helong Jiang

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23355 2025-04-01 cs.CV 57%

DSPFusion: Image Fusion via Degradation and Semantic Dual-Prior Guidance

Linfeng Tang, Chunyu Li, Guoqing Wang, Yixuan Yuan, Jiayi Ma

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23022 2025-04-01 cs.CV 57%

MeshCraft: Exploring Efficient and Controllable Mesh Generation with Flow-based DiTs

Xianglong He, Junyi Chen, Di Huang, Zexiang Liu, Xiaoshui Huang, Wanli Ouyang, Chun Yuan, Yangguang Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏