arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2603.17555 2026-08-18 cs.CV cs.AI 版本更新 79%

FrescoDiffusion: 4K Image-to-Video with Prior-Regularized Tiled Diffusion

FrescoDiffusion: 4K图像到视频的先验正则化拼接扩散

Hugo Caselles-Dupré, Mathis Koroglu, Guillaume Jeanneret, Arnaud Dapogny, Matthieu Cord

机构 * Obvious Research, Paris, France Institute of Intelligent Systems(Obvious Research,巴黎,法国智能系统研究所) Robotics - Sorbonne University, Paris, France(机器人学 - 索邦大学,巴黎,法国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FrescoDiffusion通过先验正则化拼接扩散方法,实现从单张复杂图像生成4K图像到视频,提升全局一致性与细节保真度。

Comments 5 authors. Hugo Caselles-Dupré, Mathis Koroglu, and Guillaume Jeanneret contributed equally. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10076 2026-08-18 cs.CV 版本更新 79%

Mitigating Error Accumulation in Co-Speech Motion Generation via Global Rotation Diffusion and Multi-Level Constraints

通过全局旋转扩散和多级约束缓解语音同步运动生成中的误差累积

Xiangyue Zhang, Jianfang Li, Jianqiang Ren, Jiaxu Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GlobalDiff,通过全局旋转扩散和多级约束缓解语音同步运动生成中的误差累积,提升生成运动的平滑度和准确性。

Comments AAAI 2026. Project page: https://xiangyuezhang.com/GlobalDiff/; code and pretrained models: https://github.com/Xiangyue-Zhang/GlobalDiff

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(15), 12834-12842, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18911 2026-08-18 cs.LG cs.AI cs.CV 版本更新 79%

Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching

重新思考逐令牌特征缓存:通过双特征缓存加速扩散Transformer

Chang Zou, Shikang Zheng, Evelyn Zhang, Runlin Guo, Haohang Xu, Zhengyi Shi, Conghui He, Xuming Hu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(南方科技大学) Beihang University(北航) Huawei Technologies Ltd(华为技术有限公司) Shanghai AI Lab(上海人工智能实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对逐令牌特征缓存的核心问题提出质疑,提出双特征缓存方法DuCa,在DiT等生成模型上实现了优于现有逐令牌特征缓存的性能。

Journal ref IEEE Transactions on Image Processing, vol. 35, pp. 6211-6220, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14430 2026-08-17 cs.LG cs.CV stat.ML 新提交 79%

Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View

为扩散模型设计强化学习:统一的路径空间视角

Yixian Xu, Yuanrui Zhang, Shengjie Luo, Liwei Wang, Di He

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从路径空间视角统一了扩散模型RL算法的原理,推导得到降方差值梯度形式,提出多样本KDE估计器和尺度受限权重族,在SD3.5-M等模型上验证了方法有效性并优于基线。

Comments 29 pages, 9 figures, 4 tables; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13669 2026-08-17 cs.CV 新提交 79%

Multiphase-Diff: Diffusion-Based Generative Modeling for High-Contrast Multiphase Physical Systems with Sharp Interfaces

Multiphase-Diff:面向具有尖锐界面的高对比度多相物理系统的基于扩散的生成建模

Yining Huang, Zhenyu Liang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对高对比度多相物理系统的扩散生成建模难题,提出Multiphase-Diff方法,通过三项改进实现更优的物理与分布保真度,在多相基准上优于7个基线模型,适用于该场景的科学样本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09231 2026-08-17 cs.CV 版本更新 79%

BAG: Budget-Aware Gating for Diffusion Caching

BAG:面向扩散缓存的预算感知门控机制

Tong Zhao, Mingkun Lei, Yucheng Han, Chi Zhang

机构 * Westlake AGI Lab(西湖AGI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出BAG(预算感知门控机制),通过离线到在线调度蒸馏训练轻量门控网络,在FLUX.1-dev和Wan2.1上实现优于现有最优缓存方法的性能。

Comments 23 pages, 13 figures, and 14 tables. Code Link: see AGI-Lab/BAG" target="_blank" rel="noopener">https://github.com/Westlake-AGI-Lab/BAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03265 2026-08-17 cs.CV 79%

Optimizing for the Shortest Path in Denoising Diffusion Model

Ping Chen, Xingpeng Zhang, Zhaoxiang Liu, Huan Hu, Xiang Liu, Kai Wang, Min Wang, Yanlin Qian, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能) DJI Technology Co.,Ltd.(大疆科技有限公司) School of Computer Science and Software Engineering, Southwest Petroleum University(西南石油大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepet by CVPR 2025 (10 pages, 6 figures)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025, pp. 18021-18030

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13255 2026-08-14 cs.CV cs.AI 新提交 79%

GeoCache: Training-Free Acceleration of Multi-View Texture Diffusion via Geometric Delta Transport

GeoCache:通过几何增量传输实现多视图纹理扩散的无训练加速

Haotang Li, Zhenyu Qi, Shaohan Henry Wang, Kebin Peng, Yutong Zhao, Zi Wang, Bo Liu, Huanrui Yang, Sen He

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无训练插件GeoCache,通过传输锚点视图的几何对齐更新实现多视图纹理扩散加速,在三个基准数据集上实现优于时间缓存和步骤缩减的速度-保真度权衡,2倍以上加速时表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01677 2026-08-14 cs.CV cs.LG 版本更新 79%

Generative Brownian Bridge Diffusion In Motion Space For Enhanced Myocardial Strain Analysis

用于增强心肌应变分析的运动空间生成布朗桥扩散模型

Rishov Paul, Frederick H. Epstein, Miaomiao Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出运动空间生成布朗桥扩散模型,以标准CMR图像为条件学习运动映射,在多中心CMR数据集上验证其可提升应变分析准确性,为开发临床可用的低成本心脏评估AI工具提供新范式。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17492 2026-08-14 cs.CV 版本更新 79%

EvDiff: Event-Based Video Reconstruction using One-Step Diffusion Models

EvDiff:高质视频与事件相机

Weilun Li, Lei Sun, Ruixi Gao, Qi Jiang, Yuqin Ma, Kaiwei Wang, Ming-Hsuan Yang, Luc Van Gool, Danda Pani Paudel

机构 * Zhejiang University(浙江大学) INSAIT UC Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EvDiff通过基于事件的扩散模型和替代训练框架,从单色事件流生成高质量彩色视频,提升视频生成的保真度和现实感。

Comments Replacement note: This manuscript has been transferred from the CVPR format to the ECCV 2026 format, with the corresponding title and template updated accordingly. The technical content remains largely unchanged from the previous version. (Current version: 21 pages, 6 figures, and 3 tables.) Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12308 2026-08-13 cs.CV cs.AI 新提交 79%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12175 2026-08-13 cs.CV 新提交 79%

TGRHuman: Text-Guided Realistic 3D Human Generation via Diffusion Renderer

TGRHuman:基于扩散渲染器的文本引导逼真3D人体生成

Muxin Zhang, Chaohui Yu, Yuanwang Yang, Min Wei, Zhuo Su, Kun Li

机构 * Tianjin University(天津大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出TGRHuman方法,解耦3D人体的几何与纹理生成,采用显式多视图优化结合扩散渲染器,实现高效高质量文本引导的逼真3D人体生成,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12155 2026-08-13 cs.CV 新提交 79%

Understanding Why Foundation Models Work for Diffusion-Generated Image Detection

探究基础模型为何适用于扩散生成图像检测

Davide Cozzolino, Giovanni Poggi, Luisa Verdoliva

机构 * University Federico II of Naples(那不勒斯费德里科二世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究探究基础模型用于扩散生成图像检测的原因,通过DDIM反演、频率交换及潜在空间分析,发现其利用中低频分布差异实现检测,为该类方法的可解释性提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12032 2026-08-13 cs.CV cs.AI 新提交 79%

LoSA: Near-Lossless Sparse Attention for Training-Free Video Diffusion Acceleration

LoSA:用于无训练视频扩散加速的近无损稀疏注意力

Enhuai Liu, Yunke Wang, Yutong Wang, Changming Sun, Chang Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LoSA是一种无训练稀疏注意力方法,通过固定99%的注意力质量阈值移除冗余计算,在多款视频扩散Transformer上实现最高3.2倍加速,且速度-质量权衡优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11942 2026-08-13 cs.CV 新提交 79%

Evaluating and Calibrating Diffusion Model-derived Uncertainty for Quantitative MRI Mapping

评估与校准扩散模型衍生的定量MRI成像不确定性

Shishuai Wang, Stefan Klein, Juan A. Hernandez-Tamames, Dirk H. J. Poot

机构 * Erasmus MC(伊拉斯姆斯医学中心) TU Delft(代尔夫特理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对深度学习定量MRI成像方法可靠性未明确表征的问题,评估了扩散模型衍生的不确定性,发现其与成像误差正相关,经校准后可用于可靠性评估与选择性预测。

Comments 11 pages, 6 figures. Accepted at the MICCAI 2026 Workshop on Uncertainty for Safe Utilization of Machine Learning in Medical Imaging (UNSURE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11913 2026-08-13 cs.CV 新提交 79%

HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion

HarmoniDPO:基于偏好优化扩散模型的视频引导音频生成

Wenshuo Peng, Kaipeng Zhang

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HarmoniDPO框架,采用双视频表示、online-DPO微调及DDS算法,实现更精准的视频到音频生成,在音视频同步性与主观质量上优于现有最优方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11765 2026-08-13 cs.CV 新提交 79%

ProBAG: Prototype-Guided Boundary-Aware Graph Diffusion for Weakly Supervised Histopathology Segmentation

ProBAG:用于弱监督组织病理学分割的原型引导边界感知图扩散

Duy-Dong Nguyen, Le-Van Thai, Hoai Nhan Pham, Ngoc Lam Quang Bui, Tam Tran, Zhi Huang

机构 * AI VIETNAM Lab(AI越南实验室) Washington University School of Medicine(华盛顿大学医学院) Jeonbuk National University(全北国立大学) Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProBAG是一种新的弱监督组织病理学分割方法,通过结合视觉与文本原型、逐类功率重新校准及图扩散机制,在BCSS-WSSS和LUAD-HistoSeg数据集上取得优于现有方法的性能。

Comments 12 pages, 2 figures, 4 tables. Accepted by MICCAI Workshop (COMPAYL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11617 2026-08-13 cs.CV 新提交 79%

KANResDiff: Learning Local Residual Diffusion via Kolmogorov-Arnold Network for Ambiguous Medical Image Segmentation

KANResDiff:基于柯尔莫哥洛夫-阿诺德网络学习局部残差扩散以解决模糊医学图像分割问题

Fanding Li, Chenglin Wang, Xiangyu Li, Xingyu Qiu, Xinghua Ma, Xiangming Yin, Haiyang Li, Suyu Dong, Wei Wang, Kuanquan Wang, Gongning Luo, Shuo Li

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部) College of Computer and Control Engineering, Northeast Forestry University(东北林业大学计算机与控制工程学院) Case Western Reserve University(凯斯西储大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现有模糊医学图像分割方法无法形成渐进式语义建模的问题,提出KANResDiff模型,通过独立时间编码与残差薛定谔桥实现阶段感知模糊性建模,在公开数据集上取得SOTA性能。

Comments 10 pages, 3 figures, MICCAI 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11562 2026-08-13 cs.CV cs.AI eess.IV 新提交 79%

From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection

从合成到去除:基于物理的反射模拟与基于扩散的视频去反射

Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang, Daiguo Zhou

机构 * Xiaomi Inc.(小米公司) MiLM Plus

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对视频反射去除数据与模型缺失问题,提出闭环框架S2R,含基于物理的反射模拟、首个扩散式视频去反射模型及专用基准,实现了更优性能与更快推理。

Comments Project page: https://codingwzp.github.io/VideoDereflection_S2R

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27345 2026-08-13 cs.CV 版本更新 79%

SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers

RayPE: 用于3D感知视频生成的射线空间位置编码

Minghao Yin, Jiahao Lu, Wenbo Hu, Wang Zhao, Shan Ying, Kai Han

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) ARC Lab, Tencent(腾讯ARC Lab)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出RayPE,通过向自注意力注入6D Plücker坐标编码射线几何关系,提升视频扩散Transformer的3D一致性和相机可控性。

Comments Project page: https://visual-ai.github.io/scope/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23726 2026-08-13 physics.med-ph cs.AI cs.CV 79%

q3-MuPa: Quick, Quiet, Quantitative Multi-Parametric MRI using Physics-Informed Diffusion Models

q3-MuPa: 快速、安静、定量的多参数MRI使用物理引导的扩散模型

Shishuai Wang, Florian Wiesinger, Noemi Sgambelluri, Carolin Pirkl, Stefan Klein, Juan A. Hernandez-Tamames, Dirk H. J. Poot

机构 * Erasmus University Medical Center(埃拉斯姆斯大学医学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的qMRI映射方法,结合物理数据一致性约束,提升映射性能并实现四倍加速的高质qMRI成像。

Journal ref Magnetic Resonance Imaging 131 (2026) 110699

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07661 2026-08-13 cs.CV 版本更新 79%

Optimization-Guided Diffusion for Interactive Scene Generation

基于优化的扩散生成交互场景

Shihao Li, Naisheng Ye, Tianyu Li, Kashyap Chitta, Tuo An, Peng Su, Boyang Wang, Haiou Liu, Chen Lv, Hongyang Li

机构 * Beijing Institute of Technology(北京理工大学) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Nanyang Technological University(南洋理工大学) NVIDIA Research(英伟达研究院) Yinwang Intelligent Tech. Co. Ltd.(银网智能科技有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OMEGA框架,通过优化引导扩散过程生成符合物理和行为约束的多智能体驾驶场景,提升生成场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02943 2026-08-13 cs.CV 版本更新 79%

TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration

TC-Padé:轨迹一致的Padé近似用于扩散加速

Benlei Cui, Shaoxuan He, Bukun Huang, Zhizeng Ye, Yunyun Sun, Longtao Huang, Hui Xue, Yang Yang, Jingqun Tang, Zhou Zhao, Haiwen Hong

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang Gongshang University(浙江工商大学) ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出轨迹一致的Padé近似方法,通过有理函数建模特征演变,实现低步数下的高效扩散模型加速。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16477 2026-08-13 cs.CV 79%

qMRI Diffuser: Quantitative T1 Mapping of the Brain using a Denoising Diffusion Probabilistic Model

Shishuai Wang, Hua Ma, Juan A. Hernandez-Tamames, Stefan Klein, Dirk H. J. Poot

机构 * Erasmus MC(伊拉斯姆斯大学医学中心) TU Delft(代尔夫特理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted by Deep Generative Models workshop at MICCAI 2024

Journal ref Deep Generative Models, Lecture Notes in Computer Science 15224 (2025) 129-138

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10173 2026-08-12 cs.CV 新提交 79%

DoseBridge: Denoising Diffusion Bridge Model for Dose Prediction in Lung Intensity-Modulated Proton Therapy

DoseBridge:用于肺调强质子治疗剂量预测的去噪扩散桥模型

Zerun Zhang, Xiaoda Cong, Xiangkun Xu, Peter Y. Chen, Xuanfeng Ding

机构 * Corewell Health William Beaumont University Hospital(Corewell Health William Beaumont大学医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对肺调强质子治疗剂量预测问题,提出DoseBridge去噪扩散桥模型,融合CT与射野几何信息,在52例患者数据上的多项指标优于对比模型,为放疗剂量预测提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16188 2026-08-12 cs.CV 版本更新 79%

TEASR: Training-Efficient Any-Step Diffusion Transformer for Real-World Image Super-Resolution

teasr: 面向真实世界图像超分辨率的训练高效任意步扩散Transformer

Xiang Gao, Chenxin Zhu, Yushun Fang, Qiang Hu, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TEASR框架,通过自对抗蒸馏和时步感知矫正策略,在单一扩散模型中实现任意步采样,无需辅助教师模型,显著提升训练效率并超越现有方法。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13058 2026-08-12 cs.CV cs.AI 版本更新 79%

SynBoost: A Synergistic Framework for Fast Sampling of Diffusion Models

SynBoost:用于扩散模型快速采样的协同框架

Hu Yu, Hao Luo, Xueyang Fu, Jie Huang, Fan Wang, Feng Zhao

机构 * USTC(中国科学技术大学) DAMO Academy, Alibaba Group(阿里云达摩院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对扩散模型采样速度慢的问题,提出无需训练的SynBoost框架,通过双误差解耦策略缓解离散化与近似误差,可与现有采样器集成并提升速度与生成质量,在少步数场景中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09445 2026-08-11 cs.CR cs.CV 新提交 79%

DiffSafeMerge: Mitigating Backdoor Inheritance in Diffusion Model Merging

DiffSafeMerge:缓解扩散模型合并中的后门继承问题

Jiayang Zhang, Ji Guo, Jiachen Li, Wenshu Fan, Wenbo Jiang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffSafeMerge是一种缓解扩散模型合并中后门继承的方法,通过评分源模块、收缩可疑贡献并在干净去噪损失预算下选择衰减,在多组实验中实现低攻击成功率和低FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09133 2026-08-11 cs.CV cs.AI 新提交 79%

When Latents Forget Pixels: Restoring Fidelity in Diffusion Transformer Super-Resolution

当潜变量遗忘像素时:在扩散Transformer超分辨率中恢复保真度

Yu Shi, Yuyao Zhang, Yu-wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对扩散Transformer超分辨率中VAE压缩导致的保真度下降问题,提出像素锚定超分辨率框架,通过复用VAE前的像素证据提升结果的忠实度,实验验证其性能优于现有潜变量生成式超分辨率方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08999 2026-08-11 cs.CV cs.AI 新提交 79%

DeepFreqMark: End-To-End Learnable Frequency-Domain Watermarking with Spherical Attack Simulation for Latent Diffusion Models

DeepFreqMark:面向潜在扩散模型的、结合球形攻击模拟的端到端可学习频域水印

Chen-Hsiu Huang, Mario Köppen, Ja-Ling Wu

机构 * National Taiwan University(台湾大学) Kyushu Institute of Technology(九州工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对潜在扩散模型生成图像的版权与虚假信息问题,提出DeepFreqMark频域水印框架,结合球形攻击模拟规避计算瓶颈,其误码率显著低于基线,消息容量可达256位。

Comments accepted by APSIPA ASC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏