arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1802 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1384 篇

2601.19115 2026-06-15 cs.CV 版本更新 83%

FBSDiff++: Improved Frequency Band Substitution of Diffusion Features for Efficient and Highly Controllable Text-Driven Image-to-Image Translation

FBSDiff++: 改进的扩散特征频带替换用于高效且高度可控的文本驱动图像到图像翻译

Xiang Gao, Yunpeng Jia

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出FBSDiff++框架,通过动态频带替换扩散特征,实现无需训练的文本驱动图像到图像翻译,支持外观、布局和轮廓引导,并大幅提升推理速度(8.9倍),支持任意分辨率输入和局部编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14096 2026-06-11 cs.CV 版本更新 83%

RSTR: Reducing SpatioTemporal Redundancy in Diffusion Transformers

RSTR: 减少扩散Transformer中的时空冗余

Ruitong Sun, Tianze Yang, Wei Niu, Jin Sun

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出RSTR框架,通过进化搜索和自适应秩分配联合减少扩散Transformer中的时空冗余,实现50%-70%计算节省并保持或提升生成质量。

Comments International Conference on Machine Learning (ICML)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02426 2026-06-10 cs.LG cs.CV 版本更新 83%

Breaking the Curse of Dimensionality: Diffusion Models Efficiently Learn Low-Dimensional Distributions

打破维度诅咒:扩散模型高效学习低维分布

Peng Wang, Huijie Zhang, Zekai Zhang, Siyi Chen, Yi Ma, Qing Qu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出新数学框架,证明扩散模型通过等价于子空间聚类,能以线性于内在维度的样本复杂度学习低维分布,避免维度诅咒。

Comments 37 pages, 8 figures, 2 tables, JMLR publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00273 2026-06-09 cs.CV cs.AI 版本更新 83%

When Do Diffusion Models learn to Generate Multiple Objects?

扩散模型何时学会生成多个物体?

Yujin Jeong, Arnas Uselis, Iro Laina, Seong Joon Oh, Anna Rohrbach

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究探讨了扩散模型在多物体生成中的局限性,发现场景复杂度比概念不平衡更关键,且低数据条件下计数任务更难学习。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20963 2026-06-08 cs.LG cs.CV 版本更新 83%

Generalization of Diffusion Models Arises with a Balanced Representation Space

扩散模型的泛化源于平衡表示空间

Zekai Zhang, Xiao Li, Xiang Li, Lianghe Shi, Meng Wu, Molei Tao, Qing Qu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 通过分析两层ReLU去噪自编码器,证明记忆化导致局部尖峰表示,而泛化产生平衡表示,并在真实扩散模型中验证,提出基于表示的检测和编辑方法。

Comments Accepted at ICLR 2026. 40 pages, 19 figures. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18324 2026-06-16 cs.CV cs.AI cs.GR cs.LG stat.ML 版本更新 82%

Improved Baselines with Representation Autoencoders

改进的基于表示自动编码器的基线

Jaskirat Singh, Boyang Zheng, Zongze Wu, Richard Zhang, Eli Shechtman, Saining Xie

机构 * Adobe Research(Adobe研究院) ANU(澳大利亚国立大学) New York University(纽约大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 本文研究了基于表示自动编码器(RAE)的设计选择,发现三个见解,简化并改进了RAE。首先,研究了一种通用公式,将表示定义为最后k个编码器层的总和,而不是仅最终层。其次,研究了RAE与表示对齐(REPA)的假设,发现两者具有互补的工作机制。最后,改进了RAE在无分类器指导(CFG)中的表现,通过重新参数化DiT模型输出,实现了无需训练第二个模型的指导效果。RAEv2在ImageNet-256上达到了1.06的gFID,且训练效率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23811 2026-08-18 cs.SD cs.CL 版本更新 82%

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

基于解耦时间深度扩散变换器的内存高效音频合成

Dongseong Hwang, Prasanth Yadla, Kaan Elgin, Shifas Padinjaru Veettil, Sivanand Achanta, Dipjyoti Paul, Ramya Rasipuram, Tyler Johnson, Emad Soroush, Chung-Cheng Chiu, Zhifeng Chen

机构 * Apple(苹果公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出基于解耦时间深度扩散变换器的内存高效音频合成架构,通过特定设计将语义音频令牌转换为RVQ表示,用单个深度解码器和因果滑动窗口注意力降低内存复杂度,在AMX上实现高效合成,提升音频质量。

Comments 11 pages, ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26632 2026-08-18 cs.LG 版本更新 82%

RT-Lynx: Putting GEMM Sparsity in the Right Place for Diffusion Models

RT-Lynx:以正确方式将GEMM稀疏性应用于扩散模型

Xing Cong, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Chenhao Xie

机构 * Alibaba Group(阿里巴巴集团) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 针对扩散模型推理成本高的问题,提出将N:M半结构化稀疏性从权重转移到激活,结合误差补偿技术,实现线性层平均1.55倍加速且保持生成质量。

Comments 33 pages, 18 figures, Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16871 2026-08-18 cs.RO 版本更新 82%

SADP: Subgoal-Aware Diffusion Policy for Long-Horizon Manipulation Learned from Foundation Model Generated Demonstrations

SADP:基于基础模型生成示范的子目标感知扩散策略用于可解释机器人

Site Hu, Takato Horii

机构 * Department of Systems Innovation, Graduate School of Engineering Science, Osaka University(系统创新系,工学研究科,大阪大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SADP,一种基于基础模型生成示范的子目标感知扩散策略,用于可解释机器人,通过自主生成子目标标注的示范数据,训练扩散策略,使机器人能够通过子目标结构和执行进度向用户解释决策过程,从而在长周期操作中实现更高的任务成功率和故障诊断能力。

Comments Revised manuscript with an updated title, evaluation protocol, and simulation results

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21628 2026-08-14 cs.CR cs.LG 版本更新 82%

Noise as a Probe: Membership Inference Attacks on Diffusion Models Leveraging Initial Noise

噪声作为探针:利用初始噪声的扩散模型成员推断攻击

Puwei Lian, Yujun Cai, Songze Li, Bingkun Bao

机构 * Southeast University(东南大学) The University of Queensland(昆士兰大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出利用扩散模型初始噪声中的残余语义信息进行成员推断攻击,揭示了微调模型在隐私保护方面的脆弱性。

Comments Accepted to 34th ACM International Conference on Multimedia (MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07039 2026-08-10 quant-ph cs.LG 版本更新 82%

Quantum Generative Diffusion Model: A Fully Quantum-Mechanical Model for Generating Quantum State Ensemble

量子生成扩散模型:一种用于生成量子态系综的全量子力学模型

Chuangtao Chen, Qinglin Zhao, MengChu Zhou, Zhimin He, Zhili Sun, Haozhen Situ

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出全量子力学模型QGDM,基于量子信道理论构建正向与反向过程,在多种量子态生成任务中性能优于现有模型,为量子生成建模提供了新框架。

Comments 31 pages, 15 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence. The supplementary material is included at the end of the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15844 2026-08-07 astro-ph.IM astro-ph.CO 版本更新 82%

Radio-Interferometric Image Reconstruction with Denoising Diffusion Restoration Models

利用去噪扩散恢复模型进行无线电干涉成像重建

Michel Morales, Emma Tolley, Remi Poitevineau

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于去噪扩散概率模型的无线电天空成像重建方法,通过训练DDPM并结合DDRM技术,在不依赖网格化可见度数据的情况下实现高保真重建,优于传统CLEAN方法。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07008 2026-07-28 cs.LG 版本更新 82%

Exact Evaluation of the Accuracy of Diffusion Models for Inverse Problems with Gaussian Data Distributions

高斯数据分布反问题扩散模型精度的精确评估

Emile Pierret, Bruno Galerne

机构 * Université d’Orléans, Université de Tours, CNRS, IDP, UMR 7013(奥尔良大学、图尔大学、国家科学研究中心、IDP、UMR 7013) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 研究高斯数据分布反问题中扩散模型精度,通过刻画迭代高斯过程及计算瓦瑟斯坦距离分析差异,比较两种算法,引入更精确的条件高斯扩散模型新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20955 2026-07-24 cs.CR cs.LG 版本更新 82%

Enhancing Membership Inference Attacks on Diffusion Models from a Frequency-Domain Perspective

从频域角度增强扩散模型的成员推理攻击

Puwei Lian, Yujun Cai, Songze Li, Bingkun Bao

机构 * Southeast University(东南大学) The University of Queensland(昆士兰大学) Hefei University of Technology(合肥工业大学) Engineering Research Center of Blockchain Application, Supervision and Management (Southeast University), Ministry of Education(区块链应用、监督与管理工程研究中心(东南大学),教育部)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文从频域角度揭示扩散模型处理高频信息的缺陷导致成员推理攻击误分类,并提出即插即用的高频滤波模块以提升攻击性能。

Comments Accepted to Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16947 2026-07-24 cs.RO cs.AI 版本更新 82%

Drive As You Like: Multi-Head Diffusion with Reinforcement Learning for Personalized Driving

随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶

Fan Ding, Xuewen Luo, Fucai Ke, Hwa Hui Tew, Susilawati Susilawati, Vishnu Monn Baskaran, Junn Yong Loo

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) Southwest University, China(西南大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。

Comments Has been submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20666 2026-07-23 cs.LG cs.AI 版本更新 82%

Dominant vs. Dominated: Concept-Level Generative Collapse in Diffusion Models

主导与被主导:扩散模型中的概念级生成坍缩

Hayeon Jeong, Jong-Seok Lee

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 研究文本到图像扩散模型多概念生成中的DvD不平衡,引入DominanceBench,从数据和机制角度研究其成因,通过受控微调、交叉注意力及头部消融分析,揭示DvD是系统性概念级失败模式,为可靠可控多概念生成提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10552 2026-07-22 cs.NE 版本更新 82%

MindPilot: Closed-loop Visual Stimulation Optimization for Brain Modulation with EEG-guided Diffusion

MindPilot: 闭环视觉刺激优化用于EEG引导的脑调控

Dongyang Li, Kunpeng Xie, Mingyang Wu, Yiwei Kong, Jiahua Tang, Haoyang Qin, Chen Wei, Quanying Liu

专题命中 扩散模型 :diffusion(title);image generation(abstract);image synthesis(abstract)

AI总结 MindPilot通过EEG反馈实现闭环视觉刺激优化,推动非侵入性脑调控和双向脑机接口的发展。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00126 2026-07-21 cs.RO 版本更新 82%

Compositional Diffusion with Guided Search for Long-Horizon Planning

用于长期规划的带引导搜索的组合扩散

Utkarsh A Mishra, David He, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。

Comments 38 pages, 18 figures, ICLR 2026 ORAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19729 2026-07-17 cs.RO cs.AI 版本更新 82%

VOiLA: Vectorized Online Planning with Learned Diffusion Models for POMDP Agents

VOiLA: 基于学习扩散模型的向量化在线规划用于POMDP智能体

Marcus Hoerger, Rishikesh Joshi, Rahul Shome, Ian Manchester, Hanna Kurniawati

机构 * Australian National University(澳大利亚国立大学) The University of Sydney(悉尼大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出VOiLA框架,利用条件扩散模型学习POMDP模型,通过蒸馏加速采样并与向量化在线规划器集成,在三个基准任务和实物机器人上实现高效在线规划。

Comments Submitted to the 2026 International Symposium of Robotics Research (ISRR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15041 2026-07-14 cs.LG cs.SE 版本更新 82%

HyperNet-Adaptation for Diffusion-Based Test Case Generation

基于扩散的测试用例生成的超网络自适应

Oliver Weißl, Vincenzo Riccio, Severin Kacianka, Andrea Stocco

机构 * Technical University of Munich(慕尼黑技术大学) University of Udine(乌迪内大学) fortiss

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 针对深度学习系统可靠性评估问题,提出HyNeA生成式测试方法,通过超网络实现无数据集可控性,采用独特训练策略,能以较低计算成本有针对性地生成现实故障用例,提高可控性和测试多样性,还可推广到无故障标签数据领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22510 2026-07-14 cs.LG stat.ML 版本更新 82%

CANDI: Hybrid Discrete-Continuous Diffusion Models

CANDI:混合离散-连续扩散模型

Patrick Pynadath, Jiaxin Shi, Ruqi Zhang

机构 * Purdue University, West Lafayette, U.S.A(普渡大学) Google Deepmind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 研究连续扩散应用于离散数据表现不佳的问题,提出CANDI混合框架解耦离散和连续破坏,实现同时学习,在受控生成和文本生成中分别展现优势,解锁连续扩散对离散空间的好处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02657 2026-07-03 cs.LG cs.AI 版本更新 82%

Locality-Aware Continual Unlearning for Diffusion Models

面向扩散模型的局部感知持续遗忘学习

Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

机构 * Indian Institute of Technology Hyderabad(印度海得拉巴印度理工学院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 提出局部感知持续遗忘框架,通过局部感知目标选择和局部感知回放机制,解决扩散模型在连续概念移除中的性能崩溃问题,在10步顺序遗忘中保持高相关保留和通用保留。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15067 2026-06-24 cs.LG cs.AI cs.SY eess.SY 版本更新 82%

EMFusion: Uncertainty-Aware Conditional Diffusion Model for Multivariate Narrow-band Exposure Forecasting

EMFusion: 一种考虑不确定性的条件扩散框架用于无线网络中频率选择性电磁场预测

Zijiang Yan, Yixiang Huang, Jianhua Pei, Hina Tabassum, Luca Chiaraviglio

机构 * department of Electrical Engineering and Computer Science, York University(电气工程与计算机科学系,约克大学) School of Electrical and Electronic Engineering, Huazhong University of Science and Technology(电子与电气工程学院,华中科技大学) Central China Branch of State Grid Corporation of China(国家电网公司中部分部) Department of Electronic Engineering, University of Rome Tor Vergata(罗马大学Tor Vergata电子工程系) Consorzio Nazionale Interuniversitario per le Telecomunicazioni (CNIT)(国家大学间电信研究会(CNIT))

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 本文提出EMFusion框架,通过整合时间、季节等上下文因素,提供不确定性估计,以提升无线网络中频率选择性电磁场预测的准确性。

Comments Accepted in IEEE Transactions on Network Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09508 2026-06-24 eess.AS 版本更新 82%

A Fast Solver for Interpolating Stochastic Differential Equation Diffusion Models for Speech Restoration

用于语音恢复的插值随机微分方程扩散模型的快速求解器

Bunlong Lay, Timo Gerkmann

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 针对SGMSE+等插值扩散模型,提出一种快速求解器,仅需10次神经网络评估即可完成语音恢复任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03212 2026-06-16 cs.LG 版本更新 82%

Bayesian Tensor Decomposition with Diffusion Model Prior

贝叶斯张量分解与扩散模型先验

Zerui Tao, Qibin Zhao

机构 * Zerui Tao(泽瑞·陶) Qibin Zhao(赵启斌)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 提出DiffBCP框架,结合累积收缩过程先验和预训练扩散模型,通过分裂吉布斯采样实现贝叶斯CP分解,在图像修复和去噪任务中优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18291 2026-06-11 cs.AI 版本更新 82%

Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies

扩散以协调:高效在线多智能体扩散策略

Zhuoran Li, Hai Zhong, Xun Wang, Qingxin Xia, Lihua Zhang, Longbo Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出首个在线离线策略多智能体强化学习框架OMAD,利用扩散策略和松弛策略目标最大化缩放联合熵,实现高效探索与协调,在MPE和MAMuJoCo上样本效率提升2.5至5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26985 2026-06-09 cs.LG cs.AI 版本更新 82%

Simple Self-Conditioning Adaptation for Masked Diffusion Models

简单自条件适应用于掩码扩散模型

Michael Cardei, Huu Binh Ta, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 本文提出一种简单有效的后训练适应方法,通过自条件预测提升掩码扩散模型的生成能力,减少生成困惑度并提升图像合成和分子生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19725 2026-08-07 cs.LG cs.CV 版本更新 81%

Analytic Distribution of Classifier-Free Guidance for Schedule Design

用于调度设计的无分类器指导的解析分布

Enze Jiang, Zheng Ma

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 研究针对扩散模型中无分类器指导(CFG)的分布问题,通过概率流常微分方程分析并推导解析表示,提出分布引导CFG调度,经玩具模型验证,在Stable Diffusion 1.5上改进生成效果,降低采样成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00064 2026-08-05 cs.CV 版本更新 81%

Noise-Robust Conditional Flow Matching: Generating Clean Samples from Noisy Datasets

噪声鲁棒条件流匹配:从噪声数据集生成干净样本

Adrian Urbański, Gabriel della Maggiora, Artur Yakimovich

机构 * Center for Advanced Systems Understanding (CASUS)(高级系统理解中心) Helmholtz-Zentrum Dresden-Rossendorf e. V. (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心) Institute of Computer Science, University of Wrocław(弗罗茨瓦夫大学计算机科学学院) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) Cluster of Excellence Physics of Life(生命物理学卓越集群)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 该研究针对科学成像中噪声数据难以获取干净参考的问题,提出NR-CFM模型,可从单张带噪图像学习生成干净样本,在多数场景优于NR-GAN,高噪声下与Ambient Diffusion相当,低信噪比科学数据上表现良好。

Comments 10 pages, 3 Figures, and an Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25802 2026-07-30 cs.CV 版本更新 81%

Explicit Layer Modeling for Video Object Insertion and Layer Decomposition

用于视频对象插入和层分解的显式层建模

Kyujin Han, Seungjoo Shin, Sunghyun Cho

机构 * POSTECH(浦项科技大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 研究针对视频编辑系统缺乏显式分层表示的问题,提出TriLayer数据集及DBL-Diffusion框架,用于视频对象插入和层分解任务,显著提升了插入保真度和分解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏