SofGAN: A Portrait Image Generator with Dynamic Styling
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
Comments Project page: https://apchenstu.github.io/sofgan/ Code: https://github.com/apchenstu/sofgan
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
Comments Project page: https://apchenstu.github.io/sofgan/ Code: https://github.com/apchenstu/sofgan
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
Comments Accepted to CVPR2021. Live demo here https://revery.ai/demo.html
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
Comments 14 pages, 8 figures; project page: https://graphics.tu-bs.de/publications/kappel2020high-fidelity
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
Comments Video: https://youtu.be/m7oROLdQnjk | Project page: https://gafniguy.github.io/4D-Facial-Avatars/
专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR
Comments SIGGRAPH 2019
Journal ref ACM Transactions on Graphics (TOG) 38.4 (2019)
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR
Comments Project page: https://facebookresearch.github.io/one_shot_3d_photography/ Code: https://github.com/facebookresearch/one_shot_3d_photography
Journal ref ACM Transactions on Graphics (Proceedings of SIGGRAPH 2020), Volume 39, Number 4, 2020
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
Comments Appearing at IJCAI 2020. The code is available at https://github.com/siyuhuang/PoseStylizer
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR
Comments Eurographics 2020 survey paper
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR
Comments Additional results: http://www.krematas.com/nvr/index.html
专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR
Comments CVPR 2020
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR
Comments 15 pages, 20 figures
专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR
Comments TOG 2019, http://sniklaus.com/kenburns
专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR
专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR
Comments Github: https://github.com/Prinsphield/GeneGAN
文本嵌入插值在连续图像操控中的不合理有效性
机构 * Reve
专题命中 可控生成 :image editing(abstract);分类 cs.CV;diffusion(comments)
AI总结 本文提出一种无需训练的连续可控图像编辑框架,通过文本嵌入空间的简单操控实现平滑编辑控制,引入弹性范围搜索确保连续性,并在文本条件模态间实现泛化。
Comments Project Page: https://yigitekin.github.io/diffusion-sliders
SPATIALGEN: 布局引导的3D室内场景生成
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Manycore Tech Inc(Manycore科技公司)
专题命中 可控生成 :diffusion(abstract,comments);分类 cs.CV
AI总结 SPATIALGEN通过布局引导的多视角多模态扩散模型生成高质量3D室内场景,解决现有方法在视觉质量、多样性及语义一致性方面的不足。
Comments 3D scene generation; diffusion model; Scene reconstruction and understanding
专题命中 可控生成 :diffusion(abstract,comments);分类 cs.CV
Comments Workshop summary paper for ICCV 2025, 9 accepted papers, 9 figures, IEEE conference format, covers topics including diffusion models, controllable generation, 3D-aware disentanglement, autonomous driving applications, and EEG analysis
FixAnything:基于视频生成先验的3D一致性渲染优化
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 FixAnything是一款复用预训练视频生成模型、仅需轻量微调的单一模型,可修复3DGS、NeRF等四种3D表示的渲染伪影,实现3D一致性渲染,替代多个专用优化管线。
Comments Appearing in ECCV 2026. Project page: https://fix-anything.github.io
VeCAS:面向血管介入的聚焦血管的无造影剂血管造影合成
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本文提出VeCAS框架,通过两阶段合成实现无造影剂血管造影,在下肢数据集实验中优于对比方法,还可缩短机器人导丝导航的时间与步骤,具临床应用潜力。
Comments 10 pages, 8 figures, 5 tabels, supplementary material: https://dxhuang-casia.github.io/data/vecas_supplementary_material.pdf
SketchFlow:基于CLIP潜在空间中GMM先验流的零样本矢量草图生成
机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence(广东省视觉媒体与多维智能重点实验室) ; Shenzhen University(深圳大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SketchFlow是基于CLIP潜在空间的零样本矢量草图生成框架,通过GMM先验流匹配与混合扩散解码器,实现了优于基线的视觉质量与零样本泛化能力。
Comments Accepted to SIGGRAPH Asia 2026 Conference Papers. 16 pages
LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; NEC Labs America(NEC美国实验室) ; UC San Diego(加州大学圣迭戈分校)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。
Comments Accepted by ECCV 2026. Project Page: https://yunhe24.github.io/langdrivectrl/
生成现实:基于交互式视频生成的人本世界模拟
机构 * Stanford University(斯坦福大学) ; NYU Shanghai(纽约大学上海分校) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。
Comments Project page here: https://codeysun.github.io/generated-reality
BulletTime: 分离时间与相机姿态的视频生成控制
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。
Comments CVPR 2026, Project Page: https://19reborn.github.io/Bullet4D/
驾驶用DINO:作为自动驾驶仿真到现实生成的统一桥梁的视觉基础特征
机构 * Technical University of Munich(慕尼黑技术大学) ; Huawei Hilbert Research Center(华为希利伯特研究中心) ; Huawei Riemann Lab(华为里曼实验室) ; Wuhan University(武汉大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 DwD通过利用视觉基础模块特征作为统一桥梁,解决自动驾驶仿真到现实生成中的现实性与真实性困境,提升控制精度与时间稳定性。
Comments Accepted to ACM MM 2026
SemanticSlider3D:无需训练的3D物体连续语义编辑
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 SemanticSlider3D是一种无需训练的3D物体连续语义编辑技术,通过在先进3D生成模型潜空间构建语义编辑方向,在技术验证与用户研究中均表现优于基线方法,可作为现有3D创作工作流的有效补充。
Comments UIST 2026
MSEditor:面向一致性多镜头视频编辑
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 针对多镜头视频编辑的身份漂移与累积误差问题,提出首个专用框架MSEditor,通过监督适配器与跨镜头打包策略实现一致性编辑,在基准上性能优于现有方法。
Comments ECCV 2026
将3D生成模型重新利用于自回归布局生成
机构 * School of Software, Beihang University(北航软件学院) ; Tsinghua University(清华大学) ; University of Hong Kong(香港大学) ; Tencent Hunyuan(腾讯文英) ; Peking University(北京大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出LaviGen框架,利用3D生成模型直接在3D空间中生成布局,通过自回归过程建模几何关系和物理约束,提升3D场景的物理合理性与效率。
Know3D: 通过视觉-语言模型的知识提示3D生成
机构 * Peking University(北京大学) ; Math Magic(数学魔术) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) ; Dalian University of Technology(大连理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Know3D框架,利用多模态大语言模型的知识提升3D生成的可控性,通过潜在状态注入实现语言可控的后视图生成,改进3D生成的几何细节与一致性。
Comments ECCV2026 page: https://xishuxishu.github.io/Know3D.github.io/
SplatGuide:用于无姿态新视图合成的3D高斯几何先验
机构 * Aalto University(阿尔托大学) ; Deep Render(深度渲染公司) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; Nokia Technologies(诺基亚技术公司) ; Tampere University(坦佩雷大学) ; University of Oulu(奥卢大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 SplatGuide复用单个3DGS场景生成三种互补信号,实现无姿态新视图合成,在多个基准数据集上达到SOTA,在RealEstate10K上超越真实姿态基线。