arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2605.10071 2026-05-12 cs.CV 79%

MFVLR: Multi-domain Fine-grained Vision-Language Reconstruction for Generalizable Diffusion Face Forgery Detection and Localization

MFVLR:多领域细粒度视觉-语言重建用于通用扩散面部伪造检测与定位

Yaning Zhang, Tianyi Wang, Zan Gao, Yibo Zhao, Chunjie Ma, Meng Wang

机构 * Faculty of Computer Science and Technology, Qilu University of Technology (Shandong Academy of Sciences)(计算机科学与技术学院,齐鲁工业大学(山东省科学院)) School of Computing, National University of Singapore(国立新加坡大学计算机学院) Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences)(山东省人工智能研究院,齐鲁工业大学(山东省科学院)) Key Laboratory of Computer Vision and System, Ministry of Education, Tianjin University of Technology(教育部计算机视觉与系统重点实验室,天津工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MFVLR模型,通过语言引导的面部伪造表示学习,实现通用的扩散合成面部伪造检测与定位,结合多领域视觉编码器和细粒度语言变压器提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09688 2026-05-12 cs.CV 79%

ConFixGS: Learning to Fix Feedforward 3D Gaussian Splatting with Confidence-Aware Diffusion Priors in Driving Scenes

ConFixGS:基于置信度感知扩散先验的学习以修复馈送式3D高斯点溅射在驾驶场景中

Rui Song, Tianhui Cai, Markus Gross, Xingcheng Zhou, Zewei Zhou, Zhiyu Huang, Olaf Wysocki, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Cambridge(剑桥大学) Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ConFixGS,通过置信度感知扩散先验学习修复馈送式3D高斯点溅射,提升稀疏视角驾驶场景中新型视角合成的鲁棒性,实验显示PSNR提升3.68dB,FID降低近一半。

Comments 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09681 2026-05-12 cs.CV 79%

Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models

Forcing-KV:用于高效自回归视频扩散模型的混合KV缓存压缩

Yicheng Ji, Zhizhou Zhong, Jun Zhang, Qin Yang, XiTai Jin, Ying Qin, Wenhan Luo, Shuiyang Mao, Wei Liu, Huan Li

机构 * ZJU(浙江大学) Video Rebirth(视频重生) HKUST(香港科技大学) BJTU(北京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Forcing-KV方法,通过混合KV缓存压缩技术,提升自回归视频扩散模型的生成速度和内存效率,实现高达2.82倍的速度提升。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09622 2026-05-12 cs.CV cs.AI 79%

Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study

任意到任意的3D扩散模型与知识转移:放射治疗计划研究

Yuhan Wang, Zihan Li, Han Liu, Simon Arberet, Martin Kraus, Yuyin Zhou, Florin-Cristian Ghesu, Dorin Comaniciu, Ali Kamen, Riqiang Gao

机构 * UC Santa Cruz(加州大学圣克ruz分校) Siemens Healthineers(西门子医疗) University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffKT3D,一种利用预训练视频扩散模型知识的统一Any2Any 3D扩散框架,通过模态特定嵌入实现多临床模态灵活条件化,结合临床导向的强化学习机制,提升放射治疗计划中的剂量预测精度与图像质量。

Comments Accepted by CVPR 2026 main conference. Compare to CVPR version, minor updates here are included (e.g., combine main text and appendix; clarify the timing scenario in appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09477 2026-05-12 cs.CV cs.AI 79%

Outlier-Robust Diffusion Solvers for Inverse Problems

具有鲁棒性的扩散求解器用于逆问题

Yang Zheng, Jiahua Liu, Tongyao Pang, Wen Li, Zhaoqiang Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Yau Mathematical Sciences Center, Tsinghua University(清华大学尤太数学科学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种鲁棒扩散求解器,通过噪声估计和Huber损失构建迭代加权最小二乘目标,以解决逆问题中的异常值问题,并在多个图像数据集上验证了其有效性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09242 2026-05-12 eess.IV cs.CV 79%

Cross-Modal Semantic-Enhanced Diffusion Framework for Diabetic Retinopathy Grading

跨模态语义增强的扩散框架用于糖尿病视网膜病变分级

Yiqun Wang

机构 * School of Software Engineering Beijing Jiaotong University(软件工程学院 北京交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CLIP引导语义扩散框架,通过整合视觉-语言预训练与扩散概率建模,解决糖尿病视网膜病变分级中的细粒度病变模式区分、分布差异和临床语义知识利用问题。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07399 2026-05-12 cs.CV 79%

GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization

GPO-V:通过全局概率优化实现扩散视觉语言模型的突破

Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) University of Warwick(沃里克大学) SUN YAT-SEN UNIVERSITY(中山大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GPO-V,通过全局概率优化方法突破扩散视觉语言模型的安全防线,揭示了非顺序生成架构中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19222 2026-05-12 cs.CV cs.LG 79%

Spectrally-Guided Diffusion Noise Schedules

基于光谱引导的扩散噪声调度

Carlos Esteves, Ameesh Makadia

机构 * Google Research(谷歌研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于图像光谱特性设计实例特定噪声调度的方法,通过理论界限优化噪声级别,提升单阶段像素扩散模型生成质量,尤其在低步数情况下表现更佳。

Comments Accepted to ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04549 2026-05-12 cs.CV 79%

Nix and Fix: Targeting 1000x Compression of 3D Gaussian Splatting with Diffusion Models

Nix 和 Fix:通过扩散模型实现 3D 高斯散射的 1000 倍压缩

Cem Eteke, Enzo Tartaglione

机构 * 1 Chair of Media Technology, Munich Institute of Robotics Machine Intelligence School of Computation, Information Technology Technical University of Munich, 80333 Munich, Germany 2LTCI, T\'el\'ecom Paris, Institut Polytechnique de Paris, France

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出 NiFi 方法,通过扩散模型实现 3DGS 在极低速率下的高质量压缩,达到 1000 倍压缩率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06637 2026-05-12 cs.LG cs.AI cs.CV 79%

Control-Augmented Autoregressive Diffusion for Data Assimilation

增强控制的自回归扩散用于数据同化

Prakhar Srivastava, Farrin Marouf Sofian, Francesco Immorlano, Kushagra Pandey, Stephan Mandt

机构 * University of California, Irvine(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种增强控制的自回归扩散模型,通过引入预训练模型与离线训练控制器,提升数据同化中混沌时空偏微分方程的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08440 2026-05-12 cs.LG cs.CV 79%

TARO: Temporal Adversarial Rectification Optimization Using Diffusion Models as Purifiers

TARO:利用扩散模型作为净化器的时序对抗修正优化

Daniel Wesego, Pedram Rooshenas

机构 * Department of Computer Science(计算机科学系) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TARO通过构建时序引导的分数先验,结合多视角去噪,实现对抗样本的鲁棒修正与语义保留,提升零样本下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08252 2026-05-12 cs.CV 79%

Multimodal Emotion Recognition via Causal-Diffusion Bridge (Affect-Diff)

通过因果-扩散桥进行多模态情绪识别(Affect-Diff)

Ankit Sanjyal

机构 * Department of Computer Science -- Data Science(计算机科学系——数据科学部) Fordham University(福特汉姆大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对CMU-MOSEI数据集中情绪类别不平衡问题,Affect-Diff通过因果图、正则化潜在压缩和扩散先验机制提升识别性能,验证了其在平衡准确率和少数类敏感性上的优势。

Comments 10 Pages, 12 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08144 2026-05-12 cs.LG cs.AI cs.CV 79%

NoiseRater: Meta-Learned Noise Valuation for Diffusion Model Training

NoiseRater: 用于扩散模型训练的元学习噪声估值

Fang Wu, Haokai Zhao, Da Xing, Hanqun Cao, Tinson Xu, Yanchao Li, Xiangru Tang, Zehong Wang, Aaron Tu, Kuan Pang, Hanchen Wang, Hongbin Lin, Zeqi Zhou, Yinxi Li, Peng Xia, Li Erran Li, Molei Tao, Jure Leskovec, Aditya Joshi, Yejin Choi

机构 * Stanford University(斯坦福大学) UNSW(新南威尔士大学) UCL(伦敦大学学院) The University of Chicago(芝加哥大学) CUHK(香港中文大学) Nanjing University(南京大学) Brown University(布朗大学) Yale University(耶鲁大学) University of Notre Dame(Notre Dame 大学) University of Waterloo(滑铁卢大学) UCB(加州大学伯克利分校) Georgia Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NoiseRater,通过元学习实现实例级噪声估值,提升扩散模型训练效率和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08054 2026-05-11 cs.CV 79%

Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization

面向高约束人类动作生成的检索引导扩散噪声优化

Hanchao Liu, Fang-Lue Zhang, Shining Zhang, Tai-Jiang Mu, Shi-Min Hu

机构 * Tsinghua University(清华大学) University of New South Wales(新南威尔士大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于无训练扩散噪声优化框架的检索引导方法,通过关系任务解析和奖励引导掩码优化,解决高约束下的动作生成问题,提升虚拟代理行为合成能力。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07915 2026-05-11 cs.CV 79%

What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion

潜在扩散 manifold 中什么因素重要?面向潜在扩散的先验对齐自编码器

Zhengrong Yue, Taihang Hu, Mengting Chen, Haiyu Zhang, Zihao Pan, Tao Liu, Zikang Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Yali Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Beihang University(北航) Sun Yat-sen University(中山大学) Nankai University(南开大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究潜在 manifold 组织对扩散模型生成质量的影响,提出 PAE 显式构建潜在 manifold,提升训练效率和生成质量,达到新状态的 gFID 1.03。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02129 2026-05-11 cs.CV 79%

VDEGaussian: Video Diffusion Enhanced 4D Gaussian Splatting for Dynamic Urban Scenes Modeling

VDEGaussian:基于视频扩散的4D高斯点云用于动态城市场景建模

Yuru Xiao, Zihan Lin, Chao Lu, Deming Zhai, Kui Jiang, Wenbo Zhao, Wei Zhang, Junjun Jiang, Huanran Wang, Xianming Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种结合视频扩散的4D高斯点云方法,解决动态场景建模中快速移动物体建模难题,通过时间一致性先验和不确定性蒸馏提升新型视角合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06924 2026-05-11 cs.CV cs.AI 79%

A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency

A$^2$RD:基于代理的自回归扩散用于长视频一致性

Do Xuan Long, Yale Song, Min-Yen Kan, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 A$^2$RD通过Retrieve-Synthesize-Refine-Update循环实现长视频一致性合成,提升视频生成的连贯性和叙事一致性。

Comments Project page: http://dxlong2000.github.io/AARD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06892 2026-05-11 cs.CV 79%

Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation

并非所有标记都需要40步:扩散变换器中的异质步分配用于高效视频生成

Ernie Chu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HSA算法,通过根据速度动态分配不同时间空间标记的步数预算,提升视频生成效率,实验表明在加速运行时表现优于现有方法。

Comments Project page: https://ernestchu.github.io/hsa

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06829 2026-05-11 cs.LG cs.CV cs.ET cs.IT cs.NE math.IT 79%

A Unified Measure-Theoretic View of Diffusion, Score-Based, and Flow Matching Generative Models

扩散、基于分数的和流匹配生成模型的统一测度论观点

Aditya Ranganath, Mukesh Singhal

机构 * Center for Applied Scientific Computing(应用科学计算中心) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of California Merced(加州默塞德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从测度论角度统一了扩散、基于分数和流匹配生成模型,探讨了时间依赖向量场诱导的边缘分布,并分析了采样、稳定性和计算的权衡。

Comments 62 pages, 1 figure, jmlr preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06169 2026-05-11 cs.LG cs.CV 79%

Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers

均值模式尖叫:用于1000层扩散变换器的均值-方差分割残差

Pengqi Lu

机构 * Beijing, China(中国北京)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出均值-方差分割残差,解决扩散变换器在数百层时出现的均值主导崩溃问题,通过分割残差更新和泄漏主干均值替换,使模型在极端深度下保持稳定训练。

Comments 43 pages (9-page main paper + appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13837 2026-05-11 cs.CV 79%

A Causal Diffusion Model for Video Reconstruction from Ultra-Low-Bitrate Representations

一种用于从超低比特率表示中重建视频的因果扩散模型

Cem Eteke, Batuhan Tosun, Martin Piccolrovazzi, Alexander Griessel, Wolfgang Kellerer, Eckehard Steinbach

机构 * Chair of Media Technology(媒体技术系) Chair of Communication Networks(通信网络系) Munich Institute of Robotics and Machine Intelligence(慕尼黑机器人与智能机械研究所) School of Computation Information and Technology, Technical University of Munich(计算信息与技术学院,慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种因果扩散模型,用于从超低比特率语义和高度压缩帧中重建视频,通过联合建模互补信息,提升重建质量,优于传统、神经、生成和语义基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16748 2026-05-11 cs.CV 79%

Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation

具有内存库的多模态扩散变换器用于可扩展的长时谈话视频生成

Haojie Zhang, Zhihao Liang, Ruibo Fu, Bingyan Liu, Zhengqi Wen, Xuefei Liu, Jianhua Tao, Yaling Liang

机构 * South China University of Technology(南方科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学研究中心,清华大学) Department of Automation, BNRist, Tsinghua University(清华大学自动化系,北京信息科学研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出 LetsTalk 框架,通过多模态指导和内存库机制解决长时谈话视频生成中的质量、一致性、时间连贯性和计算效率问题,实验表明其在生成质量和效率上达到新水平。

Comments 16 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06548 2026-05-08 cs.CL cs.AI cs.CV 79%

Continuous Latent Diffusion Language Model

连续潜在扩散语言模型

Hongcan Guo, Qinyu Zhao, Yian Zhao, Shen Nie, Rui Zhu, Qiushan Guo, Feng Wang, Tao Yang, Hengshuang Zhao, Guoqiang Wei, Yan Zeng

机构 * The University of Hong Kong(香港大学) The Australian National University(澳大利亚国立大学) Peking University(北京大学) Renmin University of China(中国人民大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Cola DLM,通过层次化信息分解实现文本生成,结合文本到潜在空间的映射、连续潜在空间中的全局语义先验建模及条件解码,提升生成效率和语义建模能力。

Comments 99 pages, 31 figures, 9 tables. Project page: https://hongcanguo.github.io/Cola-DLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06507 2026-05-08 cs.CV cs.LG 79%

MARBLE: Multi-Aspect Reward Balance for Diffusion RL

MARBLE: 多方面奖励平衡用于扩散强化学习

Canyu Zhao, Hao Chen, Yunze Tong, Yu Qiao, Jiacheng Li, Chunhua Shen

机构 * Zhejiang University(浙江大学) HiThink Zhejiang University of Technology(浙江工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MARBLE框架,通过梯度空间优化解决多奖励平衡问题,实现多维度奖励同时优化,提升训练效率和稳定性。

Comments Homepage and code repo: https://aim-uofa.github.io/MARBLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06010 2026-05-08 cs.CV cs.AI 79%

Adding Thermal Awareness to Visual Systems in Real-Time via Distilled Diffusion Models

通过蒸馏扩散模型在实时中增强视觉系统热感知

Yuchen Guo, Junli Gong, Wenjun Dong, Yiuming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FusionProxy模块,通过蒸馏扩散模型实现实时热感知融合,提升静态识别和动态任务鲁棒性,适用于边缘部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05630 2026-05-08 cs.CV cs.LG 79%

Making Reconstruction FID Predictive of Diffusion Generation FID

使重建FID成为扩散生成FID的预测指标

Tongda Xu, Mingwei He, Shady Abu-Hussein, Jose Miguel Hernandez-Lobato, Chunhang Zheng, Kai Zhao, Chao Zhou, Ya-Qin Zhang, Yan Wang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出插值FID(iFID),通过在潜在空间中检索最近邻并插值其潜在表示,解码后计算与原数据集的FID,从而与生成FID强相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08416 2026-05-08 eess.SP cs.IT cs.LG cs.MM math.IT 79%

Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications

生成AI遇见6G与未来:扩散模型在语义通信中的应用

Hai-Long Qin, Jincheng Dai, Guo Lu, Shuo Shao, Sixian Wang, Tongda Xu, Wenjun Zhang, Ping Zhang, Khaled B. Letaief

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 本文探讨生成AI与6G通信的结合,介绍扩散模型在语义通信中的应用,分析其在可控生成、高效推理和跨域适应中的核心方法及贡献。

Comments Accepted by IEEE COMST, GitHub repository: https://github.com/qin-jingyun/Awesome-DiffComm, project page: https://qin-jingyun.github.io/Awesome-DiffComm

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22126 2026-05-08 cs.CR cs.CV 79%

Guidance Watermarking for Diffusion Models

扩散模型的引导水印技术

Enoal Gesny, Eva Giboulot, Teddy Furon, Vivien Chappelier

机构 * Inria(法国国家信息与自动化技术研究所) LABEL4.AI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种新型扩散模型水印方法,通过梯度计算提升抗攻击能力,将后验水印方案转化为生成过程中的嵌入,与变分自编码器技术互补,验证了不同模型和检测器的效果,不影响生成图像的质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05688 2026-05-08 cs.CV 79%

R2H-Diff: Guided Spectral Diffusion Model for RGB-to-Hyperspectral Reconstruction

R2H-Diff: 用于RGB到高光谱重建的引导频谱扩散模型

Songyu Ding, Ronggiang Zhao, Mingchun Sun, Jie Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出R2H-Diff框架,通过引导频谱细化模块和高光谱适应性转置注意力模块,实现高效RGB到HSI重建,平衡重建质量与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04412 2026-05-08 cs.CV 79%

Structured 3D Latents Are Surprisingly Powerful: Unleashing Generalizable Style with 2D Diffusion

结构化3D潜在空间出人意料地强大:通过2D扩散模型释放可泛化的风格

Yiran Qiao, Yiren Lu, Yunlai Zhou, Disheng Liu, Linlin Hou, Rui Yang, Yu Yin, Jing Ma

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiLAST方法,利用预训练的2D扩散模型生成通用风格先验,通过扩散引导对齐渲染视角与目标风格,优化结构化3D潜在表示,实现对Out-of-distribution风格的有效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏