VidEdit: Zero-Shot and Spatially Aware Text-Driven Video Editing
专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments TMLR 2024. Project web-page at https://videdit.github.io
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments TMLR 2024. Project web-page at https://videdit.github.io
专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments Accept by ICLR 2024. Project Page: https://kaichen1998.github.io/projects/geodiffusion/
专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
专题命中 可控生成 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV
Comments 10 pages, 9 figures. Project page: https://video-p2p.github.io/
ARDY:用于交互式人体运动生成的具有混合表示的自回归扩散
机构 * NVIDIA(英伟达) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 可控生成 :diffusion(title);分类 cs.CV、cs.GR
AI总结 研究旨在解决交互式应用中人体运动生成问题,提出ARDY框架,采用混合表示和两阶段自回归变压器去噪器,能通过在线文本提示和运动学约束实现高保真运动生成,经评估验证了有效性和实用性。
Comments ACM Transactions on Graphics (SIGGRAPH 2026)
机构 * Ewha Womans University(东亚大学) ; Princeton University(普林斯顿大学) ; NAVER CLOUD
专题命中 可控生成 :image generation(title);分类 cs.CV、cs.MM
Comments In progress
专题命中 可控生成 :image generation(title);分类 cs.CV、cs.GR
Comments UIST 2024
专题命中 可控生成 :image generation(title);分类 cs.CV、cs.GR
Comments 19 pages, 10 figures; Project page: https://unity-research.github.io/holo-gen/
专题命中 可控生成 :diffusion(title);分类 cs.CV、cs.MM
Comments Accepted for publication in IEEE Wireless Communication Letters
专题命中 可控生成 :diffusion(title);分类 cs.CV、cs.GR
Comments 7 pages, 6 figures
专题命中 可控生成 :image synthesis(title);分类 cs.CV、cs.GR
Comments ECCV 2022, project page: https://jgkwak95.github.io/surfgan/
专题命中 可控生成 :image generation(title);分类 cs.CV、cs.GR
Comments 15 pages, 14 figures
专题命中 可控生成 :image generation(title);分类 cs.CV、cs.GR
Comments Project webpage and video available at http://afruehstueck.github.io/insetgan
专题命中 可控生成 :image synthesis(title);分类 cs.CV、cs.GR
Comments SIGGRAPH Asia 2021 (https://chufengxiao.github.io/SketchHairSalon/)
专题命中 可控生成 :image synthesis(title);分类 cs.CV、cs.GR
Comments The source codes are available at https://github.com/endo-yuki-t/Fewshot-SMIS
专题命中 可控生成 :image synthesis(title);分类 cs.CV、cs.GR
Comments Accepted as a CVPR 2019 oral paper
Journal ref CVPR 2019
流密度控制:超越熵正则化微调的生成优化
机构 * ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世人工智能中心)
专题命中 可控生成 :image generation(abstract);text-to-image(abstract);diffusion(abstract)
AI总结 流密度控制通过简化复杂优化问题,实现超越熵正则化微调的生成模型优化,适用于分子设计和图像生成等任务。
Comments NeurIPS 2025
专题命中 可控生成 :image generation(abstract);diffusion(abstract);inpainting(abstract)
Comments 12 pages, 11 figures
ControlRadio:用于跨模态无线电地图生成的提示驱动可控扩散模型
机构 * Pengcheng Laboratory(鹏城实验室) ; South China University of Technology(华南理工大学) ; Peking University(北京大学) ; Huazhong University of Science and Technology(华中科技大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 可控生成 :diffusion(title);分类 cs.CV
AI总结 ControlRadio是一种可控生成框架,可根据自然语言描述和环境布局生成无线电地图,在不同城市场景中精度和泛化能力领先,计算时间较传统方法减少四个数量级以上,为无线环境建模提供新范式。
Comments 17 pages, 9 figures, 8 tables
EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 可控生成 :image generation(title);分类 cs.CV
AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。
MIMFlow:将掩码图像建模与归一化流集成用于端到端图像生成
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; Alibaba Group(阿里巴巴集团) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 可控生成 :image generation(title);分类 cs.CV
AI总结 提出MIMFlow框架,通过VAE编码器从掩码图像推断语义潜在变量,使归一化流专注于低频语义流形,解码器处理高频合成,解决NF容量瓶颈,在ImageNet 256×256上达到71.3%线性探测精度和2.50 FID。
Comments Accepted by ECCV 2026
TerraDiT-$\Omega$:任意地理基元的卫星图像合成统一空间控制
机构 * Washington University in St. Louis(圣路易斯华盛顿大学)
专题命中 可控生成 :image synthesis(title);分类 cs.CV
AI总结 提出TerraDiT-Ω框架,通过几何感知局部注意力机制,支持从任意原生地理基元(多边形、折线、边界框、点)直接生成卫星图像,在多种控制格式下优于密集和稀疏控制基线,并提升下游任务性能。
Comments European Conference on Computer Vision 2026
端到端自回归图像生成与1D语义分词器
机构 * California Institute of Technology(加州理工学院) ; Stanford University(斯坦福大学)
专题命中 可控生成 :image generation(title);分类 cs.CV
AI总结 本文提出端到端训练 pipeline,结合重建与生成优化,改进1D分词器,实现自回归图像生成的高FID分数结果。
Comments In ICML 2026 (Spotlight)
C-GenReg:基于多视角一致的几何到图像生成的无训练3D点云配准
机构 * Ben-Gurion University(本·古里安大学)
专题命中 可控生成 :image generation(title);分类 cs.CV
AI总结 C-GenReg通过多视角一致的几何到图像生成,结合概率模态融合,实现无训练的3D点云配准,解决了跨模态、采样差异和环境的泛化问题。
Comments CVPR 2026
基于复合语义掩码的左心房LGE MRI的3D条件图像合成
机构 * Systems and Computer Engineering, Carleton University(卡尔顿大学系统与计算机工程系) ; Department of Radiology, University of Ottawa(渥太华大学放射科部)
专题命中 可控生成 :image synthesis(title);分类 cs.CV
AI总结 本文提出利用3D条件生成模型增强稀少LGE训练数据,提升左心房分割性能,SPADE-LDM生成最逼真图像,使Dice分数显著提升。
Comments This work has been published in the Proceedings of the 2025 IEEE International Conference on Imaging Systems and Techniques (IST). The final published version is available via IEEE Xplore
Journal ref 2025 IEEE International Conference on Imaging Systems and Techniques (IST)
MacTok: 图像生成中的鲁棒连续分词
机构 * Fudan University(复旦大学)
专题命中 可控生成 :image generation(title);分类 cs.CV
AI总结 MacTok通过引入图像掩码和表征对齐,防止后验崩溃,实现高效且高保真的连续分词,仅需64或128个token,在ImageNet上取得优异成绩。
Journal ref CVPR 2026
真实场景中通过可控图像编辑实施车辆检测器的伪装攻击
机构 * Carnegie Mellon University(卡内基梅隆大学) ; DEVCOM Army Research Laboratory(陆军研究实验室) ; Florida State University(佛罗里达州立大学)
专题命中 可控生成 :image editing(title);分类 cs.CV
AI总结 本文提出了一种将车辆伪装攻击视为条件图像编辑问题的新框架,通过图像级和场景级生成策略提升攻击效果,实验表明其在COCO和LINZ数据集上显著降低检测器性能,同时保持车辆结构和提升人类感知的隐蔽性。
Comments 45 pages, 35 figures
Gemini 3 Pro图像的SCHEMA:为Google原生多模态模型的受控AI图像生成的结构化方法
机构 * Independent Researcher(独立研究者)
专题命中 可控生成 :image generation(title);分类 cs.CV
AI总结 SCHEMA为Google Gemini 3 Pro图像提供结构化提示工程方法,通过三级系统提升AI图像生成的可控性,实现高合规率和跨领域应用。
Comments 24 pages, 8 tables. Based on SCHEMA Method v1.0 (deposited December 11, 2025). Previously published on Zenodo: doi:10.5281/zenodo.18721380
基于几何到图像合成的生成式点云配准
机构 * ANGEL CorpLab and College of Computing and Data Science, Nanyang Technological University, Singapore(ANGEL CorpLab和计算与数据科学学院,南洋理工大学,新加坡) ; Alibaba Cloud, Alibaba Group, China(阿里巴巴云,阿里巴巴集团,中国) ; PCA Lab, VCIP, College of Computer Science, Nankai University, China(PCA实验室,VCIP,计算机科学学院,南开大学,中国) ; State Key Laboratory for Novel Software Technology & Schoolof Intelligence Science and Technology, Nanjing University, China(新型软件技术国家重点实验室与智能科学与技术学校,南京大学,中国)
专题命中 可控生成 :image synthesis(title);分类 cs.CV
AI总结 本文提出生成式点云配准方法,通过生成跨视角一致的图像对,结合几何与颜色特征融合,提升3D配准性能。
Comments Journal extension of the ICML 2025 paper "Generative Point Cloud Registration". This version adopts a new title, and includes substantial methodological improvements, additional experiments, and extended analysis. Under review at IEEE TPAMI
超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) ; School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)
专题命中 可控生成 :image generation(title);分类 cs.CV
AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。