Diffusion Model-Based Video Editing: A Survey
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM
Comments 23 pages, 12 figures, a project related to this paper can be found at https://github.com/wenhao728/awesome-diffusion-v2v
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM
Comments 23 pages, 12 figures, a project related to this paper can be found at https://github.com/wenhao728/awesome-diffusion-v2v
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
Comments Project Website: https://stylus-diffusion.github.io
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
Comments Accepted to ICLR 2024. Project website: https://meowuu7.github.io/GeneOH-Diffusion/; Huggingface Demo: https://huggingface.co/spaces/xymeow7/gene-hoi-denoising; Code: https://github.com/Meowuu7/GeneOH-Diffusion
Journal ref ICLR 2024
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
Comments For the project site, see https://1zb.github.io/functional-diffusion/
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
Comments Project page: https://diffusion-with-forward-models.github.io/
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
Comments 8 pages main paper + 23 pages supplementary material. Moderate revisions from v1 (different template, added user study, wording). Presented at AMFG workshop at ICCV 2023. Project page: https://studios.disneyresearch.com/2023/10/02/controllable-inversion-of-black-box-face-recognition-models-via-diffusion/
GET:用于医学图像分割的生成式嵌入翻译
专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV
AI总结 该研究提出GET框架,基于Stable Diffusion VAE的冻结潜在空间实现医学图像分割,在多数据集上优于各类基线,参数更少且域偏移下性能提升显著。
Comments Accepted at ECCV 2026 - BioImage Computing Workshop
卷积神经网络(CNNs)是否在内部对真实图像与虚假图像的表示存在差异?隐藏层分析
机构 * Kansas State University(堪萨斯州立大学)
专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本研究通过场景识别实验证实,CNNs对真实与虚假图像的隐藏层激活存在可统计的差异,该差异无法仅用图像退化解释,为改进虚假图像检测提供了新思路。
用于调度设计的无分类器指导的解析分布
专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV
AI总结 研究针对扩散模型中无分类器指导(CFG)的分布问题,通过概率流常微分方程分析并推导解析表示,提出分布引导CFG调度,经玩具模型验证,在Stable Diffusion 1.5上改进生成效果,降低采样成本。
噪声鲁棒条件流匹配:从噪声数据集生成干净样本
机构 * Center for Advanced Systems Understanding (CASUS)(高级系统理解中心) ; Helmholtz-Zentrum Dresden-Rossendorf e. V. (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心) ; Institute of Computer Science, University of Wrocław(弗罗茨瓦夫大学计算机科学学院) ; School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) ; Cluster of Excellence Physics of Life(生命物理学卓越集群)
专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV
AI总结 该研究针对科学成像中噪声数据难以获取干净参考的问题,提出NR-CFM模型,可从单张带噪图像学习生成干净样本,在多数场景优于NR-GAN,高噪声下与Ambient Diffusion相当,低信噪比科学数据上表现良好。
Comments 10 pages, 3 Figures, and an Appendix
通过视频表示正则化缓解复合误差
机构 * Peking University(北京大学)
专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV
AI总结 针对视频扩散世界模型自回归生成的复合误差问题,研究发现其与表示维度崩溃相关,提出视频表示正则化方法,在VBench指标上显著优于Diffusion Forcing,提升了长视频生成的鲁棒性。
用于视频对象插入和层分解的显式层建模
机构 * POSTECH(浦项科技大学)
专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV
AI总结 研究针对视频编辑系统缺乏显式分层表示的问题,提出TriLayer数据集及DBL-Diffusion框架,用于视频对象插入和层分解任务,显著提升了插入保真度和分解质量。
Qwen-Image-2.0-RL 技术报告
专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)
AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。
Comments 16 pages, 6 figures, 1 table
从名人到普通人:4chan上AI裸化内容、技术与社区动态的特征分析
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)
专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV
AI总结 本研究通过分析4chan上的24,105个AI裸化内容,发现目标从名人转向普通人(占55.8%),开源模型(如Stable Diffusion)主导生成,少数活跃生产者驱动社区生态。
Comments 22 pages, 13 figures, 2 tables
生成恐惧图像:探究图像生成模型中的潜在情感偏差
机构 * Yale University(耶鲁大学) ; University of Maryland(马里兰大学)
专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV
AI总结 研究生成式AI模型在图像情感表达中的偏差,发现Stable Diffusion、ChatGPT和Gemini等模型生成的图像普遍倾向于引发恐惧情绪,表明存在系统性偏差。
改进的DDIM采样与矩匹配高斯混合模型
机构 * Independent Researcher(独立研究者) ; Apple(苹果公司)
专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出在DDIM框架中使用高斯混合模型作为反向转换操作符,通过约束GMM参数匹配DDPM前向边缘的矩,从而在少量采样步骤下提升生成样本质量,实验表明GMM核在FID和IS指标上优于传统高斯核。
Comments 34 pages, 12 figures; Accepted to TMLR; Code open sourced
Journal ref Transactions on Machine Learning Research, 05/2026
AlphaGRPO:通过分解性可验证奖励解锁UMMs中的自反思多模态生成
机构 * The University of Hong Kong(香港大学)
专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 AlphaGRPO通过分解性可验证奖励提升多模态生成能力,实现文本到图像生成和自反思修正,验证了自反思强化方法在生成高质量输出中的有效性。
Comments ICML2026
专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);image editing(abstract);image synthesis(abstract)
专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)
Comments ECCV 2024
专题命中 扩散模型 :image generation(abstract);diffusion(abstract);inpainting(abstract);image synthesis(abstract)
Comments Project Page: https://vinairesearch.github.io/LFM/
以秘密-隐写图像的差异性为设计轴:基于扩散模型的可逆无载体图像隐写术
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM
AI总结 该研究提出InvCISD可逆扩散框架,耦合秘密与参考图像潜在表示,降低秘密-隐写图像视觉相似性,提升隐写质量,为CIS抗隐写分析研究提供方向。
Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Independent Researcher(独立研究者)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。
S-Avatar:基于单张图像的扩散引导高斯头部化身
机构 * KAIST(韩国科学技术院) ; KAIST KI-ITC ARRC(韩国科学技术院KI-ITC ARRC)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
AI总结 S-Avatar通过三阶段流水线,结合扩散引导3DGS生成与FLAME控制,从单张图像生成高逼真3D头部化身,提升了3D一致性,在新视点和表情生成上优于现有方法,适用于VR/AR应用。
Comments 15 pages, 12 figures
CachedSearch:用于视频扩散测试时搜索的免训练缓存探索
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM
AI总结 研究视频扩散测试时搜索中缓存对候选者排名的影响,提出CachedSearch方法,通过积极缓存探索候选者,仅全计算时重生成获胜者,在多模型多系列中有效提升效率,以低成本获高增益,且免训练、与验证器无关,可用于测试时扩展。
MMOE:通过高效专家设计使扩散变压器现代化
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
AI总结 研究AIGC基础模型中扩散变压器未平衡质量与成本问题,提出MMOE对其现代化改造,将多种专家设计应用于AIGC生成,实验表明MMOE能达更好质量成本平衡,使AIGC基础模型可循大语言模型平衡扩展路径。
Comments 13 pages, 5 figures
LightCrafter:用于可控且一致的重光照的PBR条件视频扩散细化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Toronto(多伦多大学) ; Bosch Research(博世研究)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
AI总结 研究视频重光照问题,提出LightCrafter混合管道,将其重表述为代理视频转换,利用PBR渲染并结合光度先验,在真实世界重光照基准上优于现有技术,还贡献合成基准及相关资源。
Comments Project page: https://www.zixinguo.me/lightcrafter
HorizonRelight: 通过扩散变换器一致地重照明长时域视频
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
AI总结 针对长视频重照明中的时间不连续问题,提出基于扩散变换器的框架,通过掩码目标域自条件化和热启动提示实现跨块一致重照明,显著提升时间一致性。
Comments https://research.nvidia.com/labs/sil/projects/horizonrelight/
HaineiFRDM:面向快速运动与多样缺陷的保结构扩散电影修复方法
机构 * Tongji University, Shanghai, China(同济大学) ; Shanghai Film Restoration Laboratory, Shanghai, China(上海电影修复实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM
AI总结 针对电影修复中快速运动导致肢体消失和结构扭曲的问题,提出基于扩散模型的HaineiFRDM,采用内容感知修复、分块策略与位置感知全局融合模块,实现高分辨率保结构修复,并引入频率模块增强纹理一致性。
一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Sun Yat-Sen University(中山大学) ; Technical University of Munich(慕尼黑工业大学) ; Heilbronn Data Science Center(海尔布隆数据科学中心) ; Munich Data Institute(慕尼黑数据研究所)
专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV、cs.GR
AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。
Steady-Forcing: 长时程自然视频扩散中空间持久性与运动连续性的平衡
机构 * Department of Computer Science and Engineering, Sogang University(西江大学计算机科学与工程系) ; Department of Artificial Intelligence, Sogang University(西江大学人工智能系)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM
AI总结 提出Steady-Forcing框架,通过视觉锚点、运动记忆和蒸馏等技术,在长时程固定相机自然视频生成中平衡背景稳定与运动连续性,优于现有方法。
Comments Project page: https://minar09.github.io/steadyforcing/