arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2512.06174 2026-03-20 cs.CV 79%

Embedding Physical Reasoning into Diffusion-Based Shadow Generation

将物理推理嵌入基于扩散的阴影生成

Shilin Hu, Jingyi Xu, Akshat Dave, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过几何推理和物理原理生成真实阴影,提升阴影的真实性和定位精度,实验显示在DESOBAV2数据集上效果优于现有方法。

Comments Project page: https://shilin21.github.io/physical_generation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02460 2026-03-20 cs.CV 79%

GenCompositor: Generative Video Compositing with Diffusion Transformer

GenCompositor:基于扩散变换器的生成视频合成

Shuzhou Yang, Xiaoyu Li, Xiaodong Cun, Guangzhi Wang, Lingen Li, Ying Shan, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) GVC Lab, Great Bay University(Great Bay大学GVC实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GenCompositor,通过扩散变换器实现自动化视频合成,解决传统方法劳动强度大、成本高的问题,提出轻量背景保存分支、动态元素融合块和ERoPE位置嵌入等创新方法,构建VideoComp数据集并验证方法有效性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17968 2026-03-19 cs.CV 79%

Robust-ComBat: Mitigating Outlier Effects in Diffusion MRI Data Harmonization

Robust-ComBat: 降低扩散磁共振成像数据调和中的异常值影响

Yoan David, Pierre-Marc Jodoin, Alzheimer's Disease Neuroimaging Initiative, The TRACK-TBI Investigators

机构 * VitaLab, Dep of Computer Science, University of Sherbrooke(维塔实验室,计算机科学系,谢布罗什大学) Imeka Solutions Inc.(伊梅卡解决方案公司) Alzheimer’s Disease Neuroimaging Initiative(阿尔茨海默病影像化验倡议) The TRACK-TBI Investigators(TRACK-TBI研究组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Robust-ComBat方法,通过引入MLP模型有效处理扩散MRI数据中的异常值问题,提升调和精度并保留疾病相关信号。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21592 2026-03-19 cs.CV 79%

Unifying Heterogeneous Degradations: Uncertainty-Aware Diffusion Bridge Model for All-in-One Image Restoration

统一异构退化:面向全场景图像修复的不确定性感知扩散桥模型

Luwei Tu, Jiawei Wu, Xing Luo, Zhi Jin

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University, Shenzhen, Guangdong 518107, China(中山大学智能系统工程学院深圳校区) Department of Frontier Research, Peng Cheng Laboratory, Shenzhen, Guangdong 518055, China(鹏城实验室前沿研究部) Guangdong Provincial Key Laboratory of Fire Science and Technology, Guangzhou 510006, China(广东省消防科学与技术重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UDBM模型,通过将全场景图像修复转化为随机传输问题,利用像素级不确定性引导修复过程,解决异构退化间的优化冲突问题,实现单步推理下的高性能修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17398 2026-03-19 cs.CV 79%

Motion-Adaptive Temporal Attention for Lightweight Video Generation with Stable Diffusion

面向轻量视频生成的运动自适应时间注意力机制

Rui Hong, Shuxue Quan

机构 * George Mason University(乔治·玛森大学) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于冻结Stable Diffusion模型的运动自适应时间注意力机制,通过动态调整时间注意力接收域,实现高运动序列局部关注与低运动序列全局关注,仅增加25.8M参数即在WebVid验证集上取得竞争性结果。

Comments 6 pages, 3 figures, 4 tables. Published at IS&T Electronic Imaging 2026, GENAI Track

Journal ref IS&T Electronic Imaging 2026, GENAI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22057 2026-03-19 cs.CV cs.AI 79%

Unsupervised Decomposition and Recombination with Discriminator-Driven Diffusion Models

无监督分解与重组:基于判别器驱动的扩散模型

Archer Wang, Emile Anand, Yilun Du, Marin Soljačić

机构 * Research Laboratory of Electronics, MIT, Cambridge, MA 02139, USA(MIT电子研究实验室) Department of Physics, Massachusetts Institute of Technology, MIT, Cambridge, MA, USA(麻省理工学院物理系) NSF AI Institute for Artificial Intelligence(国家科学基金会人工智能与基本相互作用研究所) Kempner Institute, Harvard University, Cambridge, MA, USA(哈佛大学 Kempner 院) Google DeepMind, Mountain View, CA, USA(Google DeepMind) School of Computer Science, Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于判别器驱动的扩散模型,用于无监督分解和重组数据,通过对抗训练提升潜在因子发现和生成质量,实验显示在多个数据集上优于基线方法,且在机器人视频轨迹中实现新应用。

Comments 28 pages, 16 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22179 2026-03-19 cs.CV 79%

High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning

高保真扩散面部交换与ID约束面部条件化

Dailan He, Xiahong Wang, Shulun Wang, Guanglu Song, Bingqi Ma, Hao Shao, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Vivix Group Limited(Vivix集团有限公司) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种ID约束的面部条件化框架,通过解耦条件注入确保身份保持并优化属性对齐,结合身份和对抗损失提升生成质量,在定性和定量评估中均优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17049 2026-03-19 cs.CV cs.AI 79%

From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis

从几何模仿到综合生成:一种基于上下文的多模态扩散模型用于城市形态合成

Fangshuo Zhou, Huaxia Li, Liuchang Xu, Rui Hu, Sensen Wu, Liang Xu, Hailin Feng, Zhenhong Du

机构 * Zhejiang Agriculture and Forestry University(浙江农业与林业大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ControlCity模型,通过多模态信息融合实现城市形态综合生成,提升了形态保真度和空间重叠度,实现了跨城市风格迁移和未知城市零样本生成。

Comments Accepted

Journal ref International Journal of Geographical Information Science (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16747 2026-03-18 cs.CV 79%

Semi-supervised Latent Disentangled Diffusion Model for Textile Pattern Generation

半监督潜在解耦扩散模型用于纺织图案生成

Chenggong Hu, Yi Wang, Mengqi Xue, Haofei Zhang, Jie Song, Li Sun

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SLDDM-TPG方法,通过潜在解耦网络和半监督扩散模型生成高保真的纺织图案,有效解决服装与纹理混淆问题。

Comments 9 pages, 7 figures, acceptted by AAAI2026, the code is available at https://github.com/Cg-Hu/SLDDM-TPG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16134 2026-03-18 cs.CV cs.AI cs.LG 79%

When Generative Augmentation Hurts: A Benchmark Study of GAN and Diffusion Models for Bias Correction in AI Classification Systems

生成增强有害:GAN和扩散模型在AI分类系统中的偏见校正基准研究

Shesh Narayan Gupta, Nik Bear Brown

机构 * College of Engineering, Northeastern University(东北大学工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文通过对比三种增强策略,发现生成增强在低数据条件下会增加分类器偏见,Stable Diffusion结合LoRA表现最佳,揭示了GAN增强在特定样本量下的有害性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01953 2026-03-18 cs.RO cs.AI cs.CV 79%

Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy

闭环动作块与动态修正的训练无关扩散策略

Pengyuan Wu, Pingrui Zhang, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence, China Telecom Corp Ltd(中国电信人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DCDP框架,结合动作块生成与实时修正,提升动态场景下的适应性,无需重新训练,计算量仅增加5%,在动态PushT模拟中适应性提升19%。

Comments Accepted by ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19117 2026-03-18 cs.CV physics.optics 79%

3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion

3M-TI: 通过无校准多相机跨模态扩散实现高质量移动热成像

Minchong Chen, Xiaoyun Yuan, Junzhe Wan, Jianing Zhang, Jun Zhang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能联合实验室,人工智能研究院,上海交通大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出3M-TI,一种无需校准的多相机跨模态扩散框架,通过跨模态自注意力模块提升热成像的分辨率和细节,验证其在实际应用中的优越性能。

Comments Accepted by CVPR 2026, Code: https://github.com/work-submit/3MTI, Project page: https://lab.xiaoyunyuan.net/index.html?project=3m-ti

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24034 2026-03-18 physics.med-ph cs.CV 79%

Supervised Diffusion-Model-Based PET Image Reconstruction

基于监督扩散模型的PET图像重建

George Webber, Alexander Hammers, Andrew P King, Andrew J Reader

机构 * School of Biomedical Engineering

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种监督扩散模型算法,用于PET图像重建,通过强制PET的泊松似然模型非负性和适应PET图像的宽动态范围,实验表明其在不同剂量水平下优于现有深度学习方法,并展示了模型组件的优越性及对训练数据和参数的影响。

Comments 12 pages, 6 figures. Submitted to MICCAI 2025, not peer-reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23205 2026-03-18 cs.CV 79%

BridgeShape: Latent Diffusion Schrödinger Bridge for 3D Shape Completion

BridgeShape: 基于潜在扩散的Schrödinger桥用于3D形状补全

Dequan Kong, Honghua Chen, Zhe Zhu, Mingqiang Wei

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 BridgeShape通过将形状补全建模为最优传输问题,并引入深度增强的向量量化变分自编码器,实现高效且高保真的3D形状补全。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21777 2026-03-18 cs.LG cond-mat.dis-nn cs.CV q-bio.NC stat.ML 79%

Memorization to Generalization: Emergence of Diffusion Models from Associative Memory

记忆与泛化:从联想记忆中涌现的扩散模型

Bao Pham, Gabriel Raya, Matteo Negri, Mohammed J. Zaki, Luca Ambrogioni, Dmitry Krotov

机构 * Department of Computer Science, Rensselaer Polytechnic Institute ( RPI )(计算机科学系,罗切斯特理工学院(RPI)) Jheronimus Academy of Data Science, Tilburg University(数据科学学院,蒂尔堡大学) Department of Physics, University of Rome Sapienza(物理系,罗马萨皮恩扎大学) Donders Institute for Brain, Cognition, and Behaviour, Radboud University(大脑、认知与行为研究所,拉德堡德大学) IBM Research(IBM研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从联想记忆视角分析扩散模型,发现其在小数据时形成独特吸引子,随着数据量增加从记忆转向泛化,识别出关键的虚假状态作为生成能力的早期标志。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15627 2026-03-18 cs.GR cs.CE physics.comp-ph physics.flu-dyn 79%

Physics-Informed Video Diffusion For Shallow Water Equations

基于物理的视频扩散用于浅水方程

Yang Bai, George Eskandar, Ziyuan Liu, Gitta Kutyniok

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出一种结合物理约束的视频扩散框架,直接在生成过程中整合物理定律,实现同时预测物理状态和真实视频,提升生成视频的物理合理性和效率。

Comments 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08015 2026-03-18 eess.IV cs.AI cs.CV cs.LG 79%

CardioComposer: Leveraging Differentiable Geometry for Compositional Control of Anatomical Diffusion Models

CardioComposer:利用可微几何实现解剖扩散模型的组合控制

Karim Kadry, Shoaib Goraya, Ajay Manicka, Abdalla Abdelwahed, Naravich Chutisilp, Farhad Nezami, Elazer Edelman

机构 * Massachusetts Institute of Technology(麻省理工学院) Brigham and Women’s Hospital(布里奇沃特医院) American University in Cairo(开罗美国大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CardioComposer通过可微几何实现对解剖扩散模型的组合控制,利用可解释的椭球体原语生成多类解剖标签图,通过可微测量函数实现几何属性的约束与控制。

Comments 10 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15478 2026-03-17 cs.CV 79%

ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer

ViFeEdit:一种无需视频的视频扩散变换器调谐器

Ruonan Yu, Zhenxiong Tan, Zigeng Chen, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ViFeEdit框架,通过2D图像实现视频生成与编辑,无需视频训练数据,采用架构重参数化解耦空间独立性与全3D注意力,实现高质量视频编辑与生成。

Comments Working in progress, code is at https://github.com/Lexie-YU/ViFeEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15365 2026-03-17 cs.CV 79%

A PPO-Based Bitrate Allocation Conditional Diffusion Model for Remote Sensing Image Compression

基于PPO的比特率分配条件扩散模型用于遥感图像压缩

Yuming Han, Jooho Kim, Anish Shakya

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Institute for a Disaster Resilient Texas(灾难韧性德克萨斯研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于PPO的条件扩散压缩框架,结合条件扩散解码器与块级比特率分配策略,实现高压缩比和强感知性能,并发布高分辨率无人机图像数据集,实验显示在DIV2K和无人机图像数据集上分别达到19.3x和21.2x的压缩比,下游目标检测实验表明重建图像保持任务相关信息且性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15267 2026-03-17 cs.CV 79%

Exemplar Diffusion: Improving Medical Object Detection with Opportunistic Labels

示例扩散:利用机会性标签改进医学目标检测

Victor Wåhlstrand, Jennifer Alvén, Ida Häggström

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种利用推理时现有标签(示例)提升医学图像目标检测性能的方法,通过无需训练的扩散方法增强已知边界框信息,提高检测精度和鲁棒性,并量化预测不确定性。

Comments Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14885 2026-03-17 cs.CV 79%

SpiralDiff: Spiral Diffusion with LoRA for RGB-to-RAW Conversion Across Cameras

SpiralDiff: 基于LoRA的Spiral扩散用于跨相机的RGB到RAW转换

Huanjing Yue, Shangbin Xie, Cong Cao, Qian Wu, Lei Zhang, Lei Zhao, Jingyu Yang

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) State key laboratory of Smart Power Distribution Equipment and System, Tianjin University(天津大学智能电力分配设备与系统国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SpiralDiff通过信号依赖噪声加权策略和CamLoRA模块,提升跨相机RGB到RAW转换的重建质量及下游任务性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14819 2026-03-17 cs.CV cs.AI 79%

RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models

RAZOR:面向视觉变换器和扩散模型的比率感知层编辑以实现针对性遗忘

Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RAZOR通过比率感知机制实现视觉变换器和扩散模型的针对性遗忘,通过多层和多头编辑提升模型安全性与合规性,实现高效且稳定的遗忘更新。

Comments 18 pages, 6 figures, 8 tables, accepted to the CVPR 2026 and to appear in the Findings Track Proceedings of IEEE/CVF Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14704 2026-03-17 cs.LG cs.CV stat.ML 79%

Chain-of-Trajectories: Unlocking the Intrinsic Generative Optimality of Diffusion Models via Graph-Theoretic Planning

轨迹链:通过图论规划解锁扩散模型的内在生成最优性

Ping Chen, Xiang Liu, Xingpeng Zhang, Fei Shen, Xun Gong, Zhaoxiang Liu, Zezhou Chen, Huan Hu, Kai Wang, Shiguo Lian

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出轨迹链框架,通过图论规划解决扩散模型在高维状态空间中的计算瓶颈,提升生成质量与稳定性。

Comments 12 figues, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14702 2026-03-17 cs.CV 79%

Fractal Autoregressive Depth Estimation with Continuous Token Diffusion

分形自回归深度估计与连续令牌扩散

Jinchang Zhang, Xinrou Kang, Guoyu Lu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种分形视觉自回归扩散框架,通过粗到细的自回归生成过程改进单目深度估计,采用多尺度特征融合和连续空间去噪扩散损失提升跨模态条件化效果,同时通过分形递归架构和不确定性感知共识聚合方案提高计算效率与预测稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14667 2026-03-17 cs.CV cs.AI 79%

Comparative Analysis of 3D Convolutional and 2.5D Slice-Conditioned U-Net Architectures for MRI Super-Resolution via Elucidated Diffusion Models

3D卷积与2.5D切片条件化U-Net架构在MRI超分辨率中的比较分析:通过阐明扩散模型

Hendrik Chiche, Ludovic Corcos, Logan Rouge

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文比较了3D卷积U-Net与2.5D切片条件化U-Net架构,利用阐明扩散模型提升MRI超分辨率,3D模型在PSNR、SSIM和LPIPS指标上均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14645 2026-03-17 cs.CV 79%

Spectrum Matching: a Unified Perspective for Superior Diffusability in Latent Diffusion

频谱匹配:一种提升潜在扩散扩散性的统一视角

Mang Ning, Mingxiao Li, Le Zhang, Lanmiao Liu, Matthew B. Blaschko, Albert Ali Salah, Itir Onal Ertugrul

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了变分自编码器在潜在扩散中的扩散性,提出频谱匹配假设,通过频谱匹配提升潜在扩散性,并在多个数据集上验证了其有效性。

Comments We use NIPS template for readability reason

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14503 2026-03-17 cs.CV astro-ph.CO 79%

Mapping Dark-Matter Clusters via Physics-Guided Diffusion Models

通过物理引导的扩散模型映射暗物质簇

Diego Royo, Brandon Zhao, Adolfo Muñoz, Diego Gutierrez, Katherine L. Bouman

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种自动重建星系团表面质量密度的方法,利用DarkClusters-15k数据集和扩散模型,在无需专家调参的情况下实现高精度质量重建。

Comments 22 pages, 7 figures. Project page available at: https://graphics.unizar.es/projects/DarkMatterMapping

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14320 2026-03-17 cs.CV 79%

Early Failure Detection and Intervention in Video Diffusion Models

视频扩散模型中的早期故障检测与干预

Kwon Byung-Ki, Sohwi Lim, Nam Hyeon-Woo, Moon Ye-Bin, Tae-Hyun Oh

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种用于视频扩散模型的早期故障检测与干预方法,通过实时检查模块在生成过程中快速检测故障并提前干预,减少计算开销,提升生成质量。

Comments 29 pages, 24 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14220 2026-03-17 cs.CV 79%

FIND: A Simple yet Effective Baseline for Diffusion-Generated Image Detection

FIND: 一种简单而有效的扩散生成图像检测基线

Jie Li, Yingying Feng, Chi Xie, Jie Hu, Lei Tan, Jiayi Ji

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FIND方法,通过在真实图像上添加高斯噪声并标记为合成图像,利用分布差异提升检测性能,比现有方法快126倍,提升11.7%。

Comments AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14207 2026-03-17 cs.CV cs.AI 79%

DualTSR: Unified Dual-Diffusion Transformer for Scene Text Image Super-Resolution

DualTSR:统一的双扩散变压器用于场景文本图像超分辨率

Axi Niu, Kang Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DualTSR通过统一的双扩散目标解决文本图像超分辨率中的文本先验依赖和复杂架构问题,采用单多模态Transformer骨干网络,实现视觉与文本信息的交互,提升超分辨率效果与文本保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏