arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2605.14894 2026-05-15 cs.CV 83%

SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer

SEDiT: 一种基于单步扩散变换器的无掩膜视频字幕擦除方法

Zheng Hui, Yunlong Bai

机构 * Baidu Inc.(百度公司)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 SEDiT提出一种单步扩散变换器方法,实现无掩膜视频字幕擦除,通过理论证明和实验验证,解决字幕擦除中的局部编辑问题和长期时间一致性挑战。

Comments Project page:http://zheng222.github.io/SEDiT_project

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14461 2026-05-15 cs.CV 83%

ClickRemoval: An Interactive Open-Source Tool for Object Removal in Diffusion Models

ClickRemoval: 一种基于扩散模型的对象移除交互式开源工具

Ledun Zhang, Yatu Ji, Xufei Zhuang, Xinying Yao

机构 * Inner Mongolia University of Technology(内蒙古科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ClickRemoval通过用户点击实现对象移除,无需手动掩膜或文本提示,在复杂场景中实现精确移除和自然背景恢复。

Comments 5 pages, 4 figures. Open-source software paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14341 2026-05-15 cs.CV 83%

AnyBand-Diff: A Unified Remote Sensing Image Generation and Band Repair Framework with Spectral Priors

AnyBand-Diff: 一种结合光谱先验的遥感图像生成与波段修复框架

Zuopeng Zhao, Ying Liu, Xiaoyu Li, Su Luo, Lu Li, Wenwen Liu

机构 * School of Computer Science and Technology / School of Artificial Intelligence, China University of Mining and Technology(计算机科学与技术学院/人工智能学院,中国矿业大学) Mine Digitization Engineering Research Center of the Ministry of Education(教育部矿山数字化工程研究中心) Jiangsu Provincial Industrial Technology Engineering Center for Intelligent Sensing(江苏省智能感知与应急物联网地下空间工业技术工程中心)

专题命中 扩散模型 :image generation(title);diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出AnyBand-Diff框架,结合光谱先验指导扩散模型,解决遥感图像生成中的光谱失真问题,通过双随机掩码策略和物理引导采样机制实现可靠图像生成与准确光谱修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08698 2026-05-15 cs.CV cs.LG 83%

Supersampling Stable Diffusion and Beyond: A Seamless, Training-Free Approach for Scaling Neural Networks Using Common Interpolation Methods

超采样稳定扩散与更远:一种无缝、无需训练的方法,利用常见插值方法扩展神经网络

Md Abu Obaida Zishan, Jannatun Noor, Annajiat Alim Rasel

机构 * School of Data and Sciences BRAC University, Dhaka(数据与科学学院,布拉克大学,达卡) Computing for Sustainability and Social Good (C2SG) Research Group Department of Computer Science and Engineering United Internation University, Dhaka(可持续性与社会公益(C2SG)研究组,计算机科学与工程系,联合国际大学,达卡)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出无需训练的超采样方法,通过插值扩展神经网络以生成更高分辨率图像,同时减少内存占用。

Comments Updated the title for clarity. Removed background and redundant text from section 4.2,5. Improved organization in section 4 and clarity of text in Section 4.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12088 2026-05-14 cs.CV 83%

UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation

UniCustom: 多参考图像生成的统一视觉条件化

Yiyan Xu, Qiulin Wang, Wenjie Wang, Yunyao Mao, Xintao Wang, Pengfei Wan, Kun Gai, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 UniCustom通过融合ViT和VAE特征提升多参考图像生成中主体一致性和指令遵循能力,采用两阶段训练策略和槽绑定正则化减少跨参考混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04557 2026-05-14 cs.CV cs.AI 83%

Efficient Geometry-Controlled High-Resolution Satellite Image Synthesis

高效几何控制高分辨率卫星图像合成

Vlad Vasilescu, Daniela Faur, Teodor Costachioiu

机构 * Univ. POLITEHNICA Bucharest SIGMA Lab , CAMPUS Institute(巴比什-博亚尔银行大学 SIGMA 实验室,CAMPUS 机构) Univ. POLITEHNICA Bucharest GEOSENSE , CAMPUS Institute(巴比什-博亚尔银行大学 GEOSENSE,CAMPUS 机构)

专题命中 扩散模型 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种高效方法,通过利用跳连特征和滑动窗口交叉注意力模块,改进扩散模型以实现几何控制的高分辨率卫星图像合成,同时探讨了当前评估方法的局限性。

Comments 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13293 2026-05-14 cs.CV 83%

Img2CADSeq: Image-to-CAD Generation via Sequence-Based Diffusion

Img2CADSeq:通过序列扩散生成图像到CAD

Shiyu Tan, Zixuan Zhao, Hao Gao, Zhiheng Chen, Xiaolong Yin, Enya Shen

机构 * School of Software Tsinghua University China(软件学院清华大学中国) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Img2CADSeq,通过序列扩散模型生成高质量CAD模型,采用三级代码本和对比学习解决模态差异问题,实现工业领域应用。

Comments Accepted by SIGGRAPH 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12122 2026-05-13 cs.LG cs.AI cs.CV 83%

Disentangled Sparse Representations for Concept-Separated Diffusion Unlearning

解耦稀疏表示用于概念分离的扩散撤销

Hyeonjin Kim, Hangyeol Jung, Heechan Yun, Sungjun Yun, Dong-Jun Han

机构 * Yonsei University(延世大学) Kookmin University(韩国釜山大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出SAEParate,通过概念感知对比目标解耦潜在表示,提升扩散模型中特定概念撤销的精度与效果,实验显示在联合风格-物体撤销任务中表现优异。

Comments 40 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11506 2026-05-13 cs.CV 83%

Principled Design of Diffusion-based Optimizers for Inverse Problems

基于逆问题的扩散优化器原理化设计

Julio Oscanoa, Irmak Sivgin, Cagan Alkan, Daniel Ennis, John Pauly, Mert Pilanci, Shreyas Vasanawala

机构 * Department of Bioengineering(生物工程系) Department of Radiology, Stanford University, USA(斯坦福大学放射学系,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出原理化重参数化方法,使扩散模型在逆问题中能复用超参数,提升推理速度和图像质量。

Comments 22 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11311 2026-05-13 cs.LG cs.CV stat.CO stat.ML 83%

Couple to Control: Joint Initial Noise Design in Diffusion Models

耦合控制:扩散模型中的联合初始噪声设计

Jing Jia, Liyue Shen, Guanyang Wang

机构 * Department of Computer Science(计算机科学系) Rutgers University(罗格斯大学) Department of EECS(电子工程与计算机科学系) University of Michigan(密歇根大学) Department of Statistics(统计学系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过设计多样本展厅的依赖结构来控制初始噪声,改进生成质量并提升多样性,同时支持结构化初始化。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05209 2026-05-12 cs.CV 83%

EAM: Enhancing Anything with Diffusion Transformers for Blind Super-Resolution

EAM: 利用扩散变换器提升盲超分辨率

Haizhen Xie, Kunpeng Du, Qiangyu Yan, Sen Lu, Jianhong Han, Hanting Chen, Hailin Hu, Jie Hu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出EAM模型,利用DiT架构提升盲超分辨率,引入Ψ-DiT块和渐进性掩码图像建模策略,实现更优的图像恢复效果。

Comments Revision of Section 4.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22942 2026-05-12 cs.CV cs.AI cs.LG 83%

VS-DDPM: Efficient Low-Cost Diffusion Model for Medical Modality Translation

VS-DDPM:高效的低成本扩散模型用于医学模态转换

Nikoo Moradi, Gijs Luijten, Behrus Hinrichs-Puladi, Jens Kleesiek, Victor Alves, Jan Egger, André Ferreira

机构 * Center Algoritmi / LASI, University of Minho(中心Algoritmi / LASI,明霍大学) Institute for Artificial Intelligence in Medicine (IKIM)(医学人工智能研究所) Essen University Hospital (AöR)(埃森大学医院(AöR)) University of Duisburg-Essen(杜伊斯堡-埃森大学) Cancer Research Center Cologne Essen (CCCE)(科隆-埃森癌症研究中心(CCCE)) West German Cancer Center(西德癌症中心) University Hospital Essen (AöR)(埃森大学医院(AöR)) German Cancer Consortium (DKTK)(德国癌症联盟(DKTK)) Partner site University Hospital Essen (AöR)(埃森大学医院(AöR)合作站点) Institute of Computer Graphics and Vision(计算机图形与视觉研究所) Graz University of Technology(格拉茨技术大学) Institute of Medical Informatics(医学信息学研究所) University Hospital RWTH Aachen(亚琛RWTH大学医院) Department of Oral and Maxillofacial Surgery(口腔和颌面外科部门) TU Dortmund University(多特蒙德技术大学) Center for Virtual and Extended Reality in Medicine (ZvRM)(医学虚拟和扩展现实中心(ZvRM)) Faculty of Computer Science(计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出VS-DDPM模型,通过改进的去噪扩散概率模型提升医学图像生成效率与质量,在MRI缺失合成、肿瘤移除等任务中表现优异,但部分任务未达最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06699 2026-05-11 eess.IV cs.AI cs.CV cs.LG 83%

Multimodal synthesis of MRI and tabular data with diffusion in a joint latent space via cross-attention

通过交叉注意力在联合潜在空间中利用扩散模型进行MRI和表格数据的多模态合成

Daniel Mensing, Jan Kapar, Jochen G. Hirsch, Matthias Günther, Horst Hahn, Marvin N. Wright

机构 * Fraunhofer Institute for Digital Medicine MEVIS(弗劳恩霍夫数字医学研究所MEVIS) Leibniz Institute for Prevention Research and Epidemiology – BIPS(莱比锡预防研究与流行病学研究所 – BIPS) Faculty of Mathematics and Computer Science, University of Bremen(不莱梅大学数学与计算机科学学院) Faculty of Physics and Electrical Engineering, University of Bremen(不莱梅大学物理与电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种多模态潜在扩散模型,通过交叉注意力在共享潜在空间中联合生成MRI和临床表格数据,验证了在单一扩散框架中联合建模MRI和混合类型表格数据的可行性。

Journal ref Proc. SPIE 13925, Medical Imaging 2026: Image Processing, 139252D (April 03, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06070 2026-05-08 cs.CV 83%

Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models

竞技场作为离线奖励:用于扩散模型的高效细粒度偏好优化

Zhikai Li, Yue Zhao, Edward Zhongwei Zhang, Xuewen Liu, Jing Zhang, Qingyi Gu, Zhen Dong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出ArenaPO,利用竞技场评分作为离线奖励,实现高效细粒度优化,无需奖励模型。通过构建能力分布模型,基于截断正态分布估计质量差距,提升扩散模型的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00175 2026-05-08 cs.LG cs.AI cs.CV cs.CY 83%

The Illusion of Forgetting: Attack Unlearned Diffusion via Initial Latent Variable Optimization

遗忘的幻觉:通过初始潜在变量优化攻击未学习的扩散模型

Manyi Li, Yufan Liu, Lai Jiang, Bing Li, Yuming Li, Weiming Hu

机构 * School of Advanced Interdisciplinary Sciences, University of the Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Alipay, Ant Group(蚂蚁集团支付宝)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出IVO框架,通过优化初始潜在变量恢复未学习模型的噪声分布,揭示当前未学习方法的缺陷。

Comments 25 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05889 2026-05-08 cs.CV cs.AI cs.LG cs.NA math.NA 83%

DBMSolver: A Training-free Diffusion Bridge Sampler for High-Quality Image-to-Image Translation

DBMSolver: 一种无需训练的扩散桥采样器用于高质量图像到图像翻译

Sankarshana Venugopal, Mohammad Mostafavi, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 DBMSolver通过指数积分器利用DBM底层SDE和ODE的半线性结构,实现高效的一阶和二阶解,减少5倍采样次数并提升图像质量,适用于多种图像任务。

Comments Accepted to CVPR 2026. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20650 2026-05-08 cs.CV cs.CR 83%

Gungnir: Exploiting Stylistic Features in Images for Backdoor Attacks on Diffusion Models

Gungnir: 利用图像中的风格特征对扩散模型进行后门攻击

Lei Zhang, Yu Pan, Bingrong Dai, Lin Wang

机构 * School of Economics and Management(经济管理学院) East China Normal University(华东师范大学) School of Information Science and Technology(信息科学与技术学院) Shanghai Tech University(上海理工大学) Shanghai Development Center of Computer Software Technology(上海计算机软件技术开发中心) School of Computer and Information Engineering(计算机与信息工程学院) Shanghai Polytechnic University(上海理工大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 Gungnir通过嵌入图像中的风格特征触发扩散模型后门攻击,利用RAN和STTR保持触发器一致性,绕过检测并保持有效性,揭示了模型的潜在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19182 2026-05-08 cs.CV cs.AI 83%

SOWing Information: Cultivating Contextual Coherence with MLLMs in Image Generation

信息播种:利用大规模语言模型在图像生成中培养上下文一致性

Yuhan Pei, Ruoyu Wang, Yongqi Yang, Ye Zhu, Olga Russakovsky, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SOW方法,通过多模态大语言模型实现文本-视觉到图像生成,提升图像像素级条件保真度和视觉语义一致性。

Comments Project page: https://pyh-129.github.io/SOW/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01653 2026-05-05 cs.CV 83%

SteeringDiffusion: A Bottlenecked Activation Control Interface for Diffusion Models

SteeringDiffusion: 一种瓶颈化激活控制接口用于扩散模型

Fangzheng Wu, Brian Summa

机构 * Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SteeringDiffusion通过瓶颈化激活层控制扩散模型的内容-风格平衡,采用冻结的U-Net结构和小的提示条件潜在代码,实现可控且稳定的生成效果,优于LoRA、ControlNet等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01479 2026-05-05 cs.CV 83%

CSGuard: Toward Forgery-Resistant Watermarking in Diffusion Models via Compressed Sensing Constraint

CSGuard:通过压缩感知约束实现扩散模型中的抗伪造水印技术

Jiewei Lai, Lan Zhang, Chen Tang, Pengcheng Sun, Zhaopeng Zhang, Yunhao Wang, Hui Jin

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究所,合肥国家科学中心) Lenovo Research(联想研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 CSGuard通过压缩感知约束实现扩散模型的抗伪造水印技术,确保只有持有秘密矩阵的用户才能正确嵌入或验证图像水印,有效防止伪造攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00526 2026-05-04 cs.CV 83%

IdentiFace: Multi-Modal Iterative Diffusion Framework for Identifiable Suspect Face Generation in Crime Investigations

IdentiFace:面向犯罪调查的可识别嫌疑人面部生成多模态迭代扩散框架

Weichen Liu, Yixin Yang, Changsheng Chen, Alex Kot

机构 * Southeast University(东南大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出IdentiFace框架,通过多模态输入设计和迭代生成流程提升可识别嫌疑人面部生成的条件控制与特征调整能力,贡献了面部身份损失函数和两个专用数据集,实验证明其在身份检索上的优越性能。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18654 2026-05-04 cs.LG cs.CV 83%

Diffusion Models for Solving Inverse Problems via Posterior Sampling with Piecewise Guidance

通过后验采样与分段引导的扩散模型解决逆问题

Saeed Mohseni-Sehdeh, Walid Saad, Kei Sakaguchi, Tao Yu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Virginia Tech(弗吉尼亚理工大学) Department of Electrical and Electronic Engineering(电气电子工程系) Institute of Science(科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出一种基于扩散模型的分段引导框架,用于解决逆问题,通过分段函数平衡计算效率与引导精度,有效整合测量噪声,实验显示在图像修复和超分辨率任务中提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26348 2026-04-30 cs.CV cs.AI 83%

ACPO: Anchor-Constrained Perceptual Optimization for Diffusion Models with No-Reference Quality Guidance

ACPO:基于锚点的感知优化用于无参考质量引导的扩散模型

Yang Yang, Feifan Meng, Han Fang, Weiming Zhang

机构 * School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥国家综合科学中心人工智能研究院) School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出ACPO方法,通过锚点约束优化提升扩散模型的感知质量,同时保持生成多样性和训练稳定性。

Comments 14 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25358 2026-04-29 cs.CV 83%

Benchmarking Layout-Guided Diffusion Models through Unified Semantic-Spatial Evaluation in Closed and Open Settings

通过闭合和开放设置的统一语义-空间评估基准测试布局引导扩散模型

Luca Parolari, Nicla Faccioli, Lamberto Ballan

机构 * Department of Mathematics, University of Padova(帕多瓦大学数学系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出C-Bench和O-Bench两种基准测试,结合语义和空间准确性评估布局引导扩散模型,通过大规模测试揭示模型性能与局限性。

Comments Accepted to CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24575 2026-04-28 cs.CV 83%

Diffusion Model as a Generalist Segmentation Learner

扩散模型作为通用分割学习者

Haoxiao Wang, Antao Xiang, Haiyang Sun, Peilin Sun, Changhao Pan, Yifu Chen, Minjie Hong, Weijie Wang, Shuang Chen, Yue Chen, Zhou Zhao

机构 * Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Nanjing University(南京大学) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出DiGSeg,利用预训练扩散模型实现通用分割框架,通过编码图像和掩码到潜在空间,并结合CLIP对齐的文本路径,实现基于外观和任意文本提示的结构化分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24493 2026-04-28 cs.CV 83%

CA-IDD: Cross-Attention Guided Identity-Conditional Diffusion for Identity-Consistent Face Swapping

CA-IDD:跨注意力引导的身份条件扩散用于身份一致的面部交换

Md Shohel Rana, Tanoy Debnath

机构 * School of Computing(计算学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出CA-IDD,一种基于扩散的面部交换方法,通过多尺度交叉注意力整合 gaze、身份和面部解析,提升身份一致性和视觉真实性,实现稳定训练和精细区域控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23858 2026-04-28 cs.CV 83%

Latent Inter-Frame Pruning: A Training-Free Method Bridging Traditional Video Compression and Modern Diffusion Transformers for Efficient Generation

潜在帧剪枝:一种无训练方法,连接传统视频压缩与现代扩散变换器以实现高效生成

Dennis Menn, Chih-Hsien Chou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Futurewei Technologies, Inc.(未来科技公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无训练的潜在帧剪枝方法,通过剪枝重复的潜在块来减少计算负担并提高生成速度,同时引入注意力恢复机制以解决训练与推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11789 2026-04-28 stat.ML cs.CV cs.LG 83%

Statistical Test for Diffusion-Based Anomaly Localization via Selective Inference

基于选择性推断的扩散模型异常定位统计检验

Teruyuki Katsuoka, Tomohiro Shiraishi, Daiki Miwa, Vo Nguyen Le Duy, Ichiro Takeuchi

机构 * Nagoya University(名古屋大学) University of Information Technology(信息技术大学) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市) RIKEN(理化学研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出基于选择性推断的统计框架,用于量化检测到的异常区域显著性,通过提供p值评估假阳性率,提升异常定位的可靠性。

Comments 35 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23536 2026-04-28 cs.CV 83%

$Z^2$-Sampling: Zero-Cost Zigzag Trajectories for Semantic Alignment in Diffusion Models

$Z^2$-采样:用于扩散模型语义对齐的零成本zigzag轨迹

Haosen Li, Wenshuo Chen, Shaofeng Liang, Lei Wang, Kaishen Yuan, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Griffith University & Data61/CSIRO(格里菲斯大学及Data61/CSIRO)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出$Z^2$-采样,通过隐式代数坍缩与动态缓存的时间语义代理,实现零成本zigzag轨迹,提升采样效率并保持语义探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14897 2026-04-28 cs.CV 83%

Seer: Language Instructed Video Prediction with Latent Diffusion Models

Seer:基于潜在扩散模型的语言指导视频预测

Xianfan Gu, Chuan Wen, Weirui Ye, Jiaming Song, Yang Gao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai AI Lab(上海人工智能实验室) NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 Seer通过扩展预训练文本到图像扩散模型的时间轴,提出高效模型以实现文本条件视频预测,提升机器人未来预测能力,实验表明其在多个数据集上性能优越。

Comments 31 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏