arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4228 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4228 篇

2007.03780 2021-08-09 cs.CV cs.GR 62%

SofGAN: A Portrait Image Generator with Dynamic Styling

Anpei Chen, Ruiyang Liu, Ling Xie, Zhang Chen, Hao Su, Jingyi Yu

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR

Comments Project page: https://apchenstu.github.io/sofgan/ Code: https://github.com/apchenstu/sofgan

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.06593 2021-06-15 cs.CV cs.GR cs.LG 62%

Toward Accurate and Realistic Outfits Visualization with Attention to Details

Kedan Li, Min jin Chong, Jeffrey Zhang, Jingen Liu

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR

Comments Accepted to CVPR2021. Live demo here https://revery.ai/demo.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.10974 2020-12-22 cs.CV cs.GR cs.LG 62%

High-Fidelity Neural Human Motion Transfer from Monocular Video

Moritz Kappel, Vladislav Golyanik, Mohamed Elgharib, Jann-Ole Henningson, Hans-Peter Seidel, Susana Castillo, Christian Theobalt, Marcus Magnor

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR

Comments 14 pages, 8 figures; project page: https://graphics.tu-bs.de/publications/kappel2020high-fidelity

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.03065 2020-12-08 cs.CV cs.GR 62%

Dynamic Neural Radiance Fields for Monocular 4D Facial Avatar Reconstruction

Guy Gafni, Justus Thies, Michael Zollhöfer, Matthias Nießner

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR

Comments Video: https://youtu.be/m7oROLdQnjk | Project page: https://gafniguy.github.io/4D-Facial-Avatars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.07727 2020-09-15 cs.CV cs.GR cs.LG 62%

Semantic Photo Manipulation with a Generative Image Prior

David Bau, Hendrik Strobelt, William Peebles, Jonas Wulff, Bolei Zhou, Jun-Yan Zhu, Antonio Torralba

专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH 2019

Journal ref ACM Transactions on Graphics (TOG) 38.4 (2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.03298 2020-09-08 cs.CV cs.GR cs.LG 62%

Improved Modeling of 3D Shapes with Multi-view Depth Maps

Kamal Gupta, Susmija Jabbireddy, Ketul Shah, Abhinav Shrivastava, Matthias Zwicker

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.12298 2020-09-02 cs.CV cs.GR 62%

One Shot 3D Photography

Johannes Kopf, Kevin Matzen, Suhib Alsisan, Ocean Quigley, Francis Ge, Yangming Chong, Josh Patterson, Jan-Michael Frahm, Shu Wu, Matthew Yu, Peizhao Zhang, Zijian He, Peter Vajda, Ayush Saraf, Michael Cohen

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

Comments Project page: https://facebookresearch.github.io/one_shot_3d_photography/ Code: https://github.com/facebookresearch/one_shot_3d_photography

Journal ref ACM Transactions on Graphics (Proceedings of SIGGRAPH 2020), Volume 39, Number 4, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.09077 2020-07-20 cs.CV cs.GR cs.LG eess.IV 62%

Generating Person Images with Appearance-aware Pose Stylizer

Siyu Huang, Haoyi Xiong, Zhi-Qi Cheng, Qingzhong Wang, Xingran Zhou, Bihan Wen, Jun Huan, Dejing Dou

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR

Comments Appearing at IJCAI 2020. The code is available at https://github.com/siyuhuang/PoseStylizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.03805 2020-04-09 cs.CV cs.GR 62%

State of the Art on Neural Rendering

Ayush Tewari, Ohad Fried, Justus Thies, Vincent Sitzmann, Stephen Lombardi, Kalyan Sunkavalli, Ricardo Martin-Brualla, Tomas Simon, Jason Saragih, Matthias Nießner, Rohit Pandey, Sean Fanello, Gordon Wetzstein, Jun-Yan Zhu, Christian Theobalt, Maneesh Agrawala, Eli Shechtman, Dan B Goldman, Michael Zollhöfer

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR

Comments Eurographics 2020 survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.04591 2020-04-07 cs.CV cs.GR 62%

Neural Voxel Renderer: Learning an Accurate and Controllable Rendering Tool

Konstantinos Rematas, Vittorio Ferrari

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR

Comments Additional results: http://www.krematas.com/nvr/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.05863 2020-03-13 cs.CV cs.GR eess.IV 62%

Towards Photo-Realistic Virtual Try-On by Adaptively Generating$\leftrightarrow$Preserving Image Content

Han Yang, Ruimao Zhang, Xiaobao Guo, Wei Liu, Wangmeng Zuo, Ping Luo

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.09267 2020-02-12 cs.CV cs.GR cs.LG 62%

Semantic Hierarchy Emerges in Deep Generative Representations for Scene Synthesis

Ceyuan Yang, Yujun Shen, Bolei Zhou

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR

Comments 15 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.05483 2019-09-13 cs.CV cs.GR 62%

3D Ken Burns Effect from a Single Image

Simon Niklaus, Long Mai, Jimei Yang, Feng Liu

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

Comments TOG 2019, http://sniklaus.com/kenburns

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.02165 2019-09-06 cs.CV cs.GR eess.IV 62%

Poly-GAN: Multi-Conditioned GAN for Fashion Synthesis

Nilesh Pandey, Andreas Savakis

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.04932 2017-05-16 cs.CV cs.GR 62%

GeneGAN: Learning Object Transfiguration and Attribute Subspace from Unpaired Data

Shuchang Zhou, Taihong Xiao, Yi Yang, Dieqiao Feng, Qinyao He, Weiran He

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR

Comments Github: https://github.com/Prinsphield/GeneGAN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17998 2026-03-19 cs.CV 61%

The Unreasonable Effectiveness of Text Embedding Interpolation for Continuous Image Steering

文本嵌入插值在连续图像操控中的不合理有效性

Yigit Ekin, Yossi Gandelsman

机构 * Reve

专题命中 可控生成 :image editing(abstract);分类 cs.CV;diffusion(comments)

AI总结 本文提出一种无需训练的连续可控图像编辑框架,通过文本嵌入空间的简单操控实现平滑编辑控制,引入弹性范围搜索确保连续性,并在文本条件模态间实现泛化。

Comments Project Page: https://yigitekin.github.io/diffusion-sliders

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14981 2026-01-16 cs.CV 61%

SPATIALGEN: Layout-guided 3D Indoor Scene Generation

SPATIALGEN: 布局引导的3D室内场景生成

Chuan Fang, Heng Li, Yixun Liang, Jia Zheng, Yongsen Mao, Yuan Liu, Rui Tang, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Manycore Tech Inc(Manycore科技公司)

专题命中 可控生成 :diffusion(abstract,comments);分类 cs.CV

AI总结 SPATIALGEN通过布局引导的多视角多模态扩散模型生成高质量3D室内场景,解决现有方法在视觉质量、多样性及语义一致性方面的不足。

Comments 3D scene generation; diffusion model; Scene reconstruction and understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10463 2025-09-16 cs.LG cs.CV 61%

The 1st International Workshop on Disentangled Representation Learning for Controllable Generation (DRL4Real): Methods and Results

Qiuyu Chen, Xin Jin, Yue Song, Xihui Liu, Shuai Yang, Tao Yang, Ziqiang Li, Jianguo Huang, Yuntao Wei, Ba'ao Xie, Nicu Sebe, Wenjun, Zeng, Jooyeol Yun, Davide Abati, Mohamed Omran, Jaegul Choo, Amir Habibian, Auke Wiggers, Masato Kobayashi, Ning Ding, Toru Tamaki, Marzieh Gheisari, Auguste Genovesio, Yuheng Chen, Dingkun Liu, Xinyao Yang, Xinping Xu, Baicheng Chen, Dongrui Wu, Junhao Geng, Lexiang Lv, Jianxin Lin, Hanzhe Liang, Jie Zhou, Xuanxin Chen, Jinbao Wang, Can Gao, Zhangyi Wang, Zongze Li, Bihan Wen, Yixin Gao, Xiaohan Pan, Xin Li, Zhibo Chen, Baorui Peng, Zhongming Chen, Haoran Jin

专题命中 可控生成 :diffusion(abstract,comments);分类 cs.CV

Comments Workshop summary paper for ICCV 2025, 9 accepted papers, 9 figures, IEEE conference format, covers topics including diffusion models, controllable generation, 3D-aware disentanglement, autonomous driving applications, and EEG analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23549 2026-08-25 cs.CV 新提交 57%

FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors

FixAnything:基于视频生成先验的3D一致性渲染优化

Khiem Vuong, Deva Ramanan, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FixAnything是一款复用预训练视频生成模型、仅需轻量微调的单一模型,可修复3DGS、NeRF等四种3D表示的渲染伪影,实现3D一致性渲染,替代多个专用优化管线。

Comments Appearing in ECCV 2026. Project page: https://fix-anything.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22828 2026-08-25 cs.CV 新提交 57%

VeCAS: Vessel-Focused Contrast-Free Angiogram Synthesis for Vascular Interventions

VeCAS:面向血管介入的聚焦血管的无造影剂血管造影合成

De-Xing Huang, Chen-Yu Wang, Hao Liang, Xiao-Hu Zhou, Mei-Jiang Gui, Tian-Yu Xiang, Qin-Yi Zhang, Chen Wang, Xiao-Liang Xie, Shi-Qi Liu, Ming-Yuan Liu, Zhen-Chang Wang, Zeng-Guang Hou

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出VeCAS框架,通过两阶段合成实现无造影剂血管造影,在下肢数据集实验中优于对比方法,还可缩短机器人导丝导航的时间与步骤,具临床应用潜力。

Comments 10 pages, 8 figures, 5 tabels, supplementary material: https://dxhuang-casia.github.io/data/vecas_supplementary_material.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21659 2026-08-25 cs.CV 新提交 57%

SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space

SketchFlow:基于CLIP潜在空间中GMM先验流的零样本矢量草图生成

Jin Zhou, Hongliang Yang, Pengfei Xu, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence(广东省视觉媒体与多维智能重点实验室) Shenzhen University(深圳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SketchFlow是基于CLIP潜在空间的零样本矢量草图生成框架,通过GMM先验流匹配与混合扩散解码器,实现了优于基线的视觉质量与零样本泛化能力。

Comments Accepted to SIGGRAPH Asia 2026 Conference Papers. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-08-25 cs.CV 版本更新 57%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Accepted by ECCV 2026. Project Page: https://yunhe24.github.io/langdrivectrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18422 2026-08-25 cs.CV 版本更新 57%

Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control

生成现实:基于交互式视频生成的人本世界模拟

Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) NYU Shanghai(纽约大学上海分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。

Comments Project page here: https://codeysun.github.io/generated-reality

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05076 2026-08-25 cs.CV 版本更新 57%

BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

BulletTime: 分离时间与相机姿态的视频生成控制

Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajič, Siyu Tang, Gordon Wetzstein

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。

Comments CVPR 2026, Project Page: https://19reborn.github.io/Bullet4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06159 2026-08-24 cs.CV 版本更新 57%

Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving

驾驶用DINO:作为自动驾驶仿真到现实生成的统一桥梁的视觉基础特征

Xuyang Chen, Conglang Zhang, Chuanheng Fu, Zihao Yang, Kaixuan Zhou, Yizhi Zhang, Yanfeng Zhang, Mingwei Sun, Zhen Dong, Xiaoxiao Long, Zengmao Wang, Liqiu Meng

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Hilbert Research Center(华为希利伯特研究中心) Huawei Riemann Lab(华为里曼实验室) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DwD通过利用视觉基础模块特征作为统一桥梁,解决自动驾驶仿真到现实生成中的现实性与真实性困境,提升控制精度与时间稳定性。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18560 2026-08-20 cs.HC cs.CV 新提交 57%

SemanticSlider3D: Training-Free Continuous Semantic Editing for 3D Objects

SemanticSlider3D:无需训练的3D物体连续语义编辑

Ru Wang, Rahul Jain, Koichiro Niinuma, Aakar Gupta

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SemanticSlider3D是一种无需训练的3D物体连续语义编辑技术,通过在先进3D生成模型潜空间构建语义编辑方向,在技术验证与用户研究中均表现优于基线方法,可作为现有3D创作工作流的有效补充。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17559 2026-08-19 cs.CV 新提交 57%

MSEditor: Toward Consistent Multi-Shot Video Editing

MSEditor:面向一致性多镜头视频编辑

Kunyu Feng, Yue Ma, Bingyuan Wang, Yuefeng Wang, Zhiyuan Qin, Hao Cheng, Hao Li, Qifeng Chen, Zeyu Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对多镜头视频编辑的身份漂移与累积误差问题,提出首个专用框架MSEditor,通过监督适配器与跨镜头打包策略实现一致性编辑,在基准上性能优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16299 2026-08-19 cs.CV 版本更新 57%

Repurposing 3D Generative Model for Autoregressive Layout Generation

将3D生成模型重新利用于自回归布局生成

Haoran Feng, Yifan Niu, Zehuan Huang, Yang-Tian Sun, Yuxin Peng, Lu Sheng

机构 * School of Software, Beihang University(北航软件学院) Tsinghua University(清华大学) University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文英) Peking University(北京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LaviGen框架,利用3D生成模型直接在3D空间中生成布局,通过自回归过程建模几何关系和物理约束,提升3D场景的物理合理性与效率。

Comments https://fenghora.github.io/LaviGen-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22782 2026-08-19 cs.CV 版本更新 57%

Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models

Know3D: 通过视觉-语言模型的知识提示3D生成

Wenyue Chen, Wenjue Chen, Peng Li, Qinghe Wang, Xu Jia, Heliang Zheng, Rongfei Jia, Yuan Liu, Ronggang Wang

机构 * Peking University(北京大学) Math Magic(数学魔术) The Hong Kong University of Science and Technology(香港科学与技术大学) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) Dalian University of Technology(大连理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Know3D框架,利用多模态大语言模型的知识提升3D生成的可控性,通过潜在状态注入实现语言可控的后视图生成,改进3D生成的几何细节与一致性。

Comments ECCV2026 page: https://xishuxishu.github.io/Know3D.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16863 2026-08-18 cs.CV 新提交 57%

SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis

SplatGuide:用于无姿态新视图合成的3D高斯几何先验

Yejun Zhang, Zihan Wang, Xu Ji, Yihao Wang, Yuxin Hou, Junyuan Fang, Juho-Matti Kilpeläinen, Arno Solin, Hamed Rezazadegan Tavakoli, Esa Rahtu, Juho Kannala

机构 * Aalto University(阿尔托大学) Deep Render(深度渲染公司) ELLIS Institute Finland(芬兰ELLIS研究所) Nokia Technologies(诺基亚技术公司) Tampere University(坦佩雷大学) University of Oulu(奥卢大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SplatGuide复用单个3DGS场景生成三种互补信号,实现无姿态新视图合成,在多个基准数据集上达到SOTA,在RealEstate10K上超越真实姿态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏