arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2412.20704 2026-04-14 cs.CV cs.LG 79%

HFI: A unified framework for training-free detection and implicit watermarking of latent diffusion model generated images

HFI:一种用于训练自由检测和隐式水印的潜在扩散模型生成图像的统一框架

Sungik Choi, Hankook Lee, Jaehoon Lee, Seunghyun Kim, Stanley Jungkyu Choi, Moontae Lee

机构 * LG AI Research(LG AI研究院) Sungkyunkwan University(成均馆大学) University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HFI框架,用于训练自由检测和隐式水印,通过分析潜在扩散模型生成图像的高频信息畸变,有效检测复杂背景图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17163 2026-04-14 cs.CV 79%

OSDFace: One-Step Diffusion Model for Face Restoration

OSDFace:面向面部修复的一步扩散模型

Jingkai Wang, Jue Gong, Lin Zhang, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OSDFace提出一种一步扩散模型,通过视觉嵌入器和面部身份损失提升面部修复的视觉质量和身份一致性。

Comments Accepted to CVPR 2025. The code and model will be available at https://github.com/jkwang28/OSDFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10085 2026-04-14 cs.CV 79%

Particle Diffusion Matching: Random Walk Correspondence Search for the Alignment of Standard and Ultra-Widefield Fundus Images

粒子扩散匹配:用于标准和超宽场视网膜图像对齐的随机游走对应搜索

Kanggeon Lee, Soochahn Lee, Kyoung Mu Lee

机构 * ASRI, Dept. of ECE, Seoul National University(首尔大学电气与计算机工程系ASRI) School of Electrical Engineering, Kookmin University(国民大学电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种稳健的对齐技术,通过扩散模型引导的迭代随机游走对应搜索(RWCS)实现标准视网膜图像(SFIs)和超宽场视网膜图像(UWFIs)的对齐,解决了尺度、外观差异和特征稀少的问题,展示了在多个视网膜图像对齐基准上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10084 2026-04-14 cs.CV 79%

Active Diffusion Matching: Score-based Iterative Alignment of Cross-Modal Retinal Images

主动扩散匹配:基于分数模型的跨模态视网膜图像迭代对齐

Kanggeon Lee, Su Jeong Song, Soochahn Lee, Kyoung Mu Lee

机构 * ASRI, Dept. of ECE, Seoul National University(首尔大学电子与计算机工程系ASRI) Dept. of Ophthalmology, Kangbuk Samsung Hospital, Sungkyunkwan University(成均馆大学三星首尔医院眼科) School of Electrical Engineering, Kookmin University(国民大学电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出主动扩散匹配方法,通过迭代 Langevin 马尔可夫链联合估计全局和局部变换,实现视网膜图像的跨模态对齐,实验表明其在对齐精度上达到最先进的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10040 2026-04-14 cs.CV 79%

Intra-finger Variability of Diffusion-based Latent Fingerprint Generation

基于扩散模型的指纹生成内部手指变异性研究

Noor Hussein, Anil K. Jain, Karthik Nandakumar

机构 * Michigan State University(密歇根州立大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文系统评估了使用先进扩散模型生成的合成指纹(特别是潜在指纹)的内部手指变异性,通过构建包含七种多样数据集的潜在风格库,提高了生成模型的潜在风格多样性,并分析了生成指纹中ridge和 minutiae的完整性。

Comments Accepted at the 2nd Workshop on Foundation and Generative Models in Biometrics (FoundGen-Bio), held in conjunction with CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09838 2026-04-14 cs.CV 79%

Vector Field Synthesis with Sparse Streamlines Using Diffusion Model

基于扩散模型的稀疏流线向量场合成

Nguyen K. Phan, Ricardo Morales, Sebastian D. Espriella, Guoning Chen

机构 * University of Houston(休斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的向量场合成方法,利用稀疏流线输入生成符合物理规律的2D向量场,通过条件去噪扩散模型和分类器自由引导,实现几何和物理约束的保真重建。

Comments 5 pages, 4 figures; published at IEEE VIS 2025

Journal ref 2025 IEEE Visualization and Visual Analytics (VIS), pp. 296-300

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02003 2026-04-14 cs.CV 79%

ProDiG: Progressive Diffusion-Guided Gaussian Splatting for Aerial to Ground Reconstruction

ProDiG:渐进式扩散引导高斯点云法用于空到地重建

Sirshapan Mitra, Yogesh S. Rawat

机构 * CRCV, University of Central Florida(中佛罗里达大学计算机视觉研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ProDiG方法,通过扩散引导逐步将空视图转换为地面级视图,利用几何感知因果注意力模块和距离自适应高斯模块,实现高斯点云的渐进式优化,提升重建的几何一致性和鲁棒性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05880 2026-04-14 cs.CV 79%

Contour Refinement using Discrete Diffusion in Low Data Regime

利用离散扩散进行低数据环境下的轮廓优化

Fei Yu Guan, Ian Keefe, Sophie Wilkinson, Daniel D. B. Perrakis, Steven Waslander

机构 * University of Toronto(多伦多大学) Simon Fraser University(西蒙弗雷泽大学) Natural Resources Canada(加拿大自然资源部)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出轻量离散扩散轮廓优化方法,通过自注意力CNN和条件处理,在低数据环境下实现鲁棒边界检测,提升推理效率3.5倍。

Comments CRV 2026, 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09022 2026-04-13 cs.CV 79%

BlendFusion -- Scalable Synthetic Data Generation for Diffusion Model Training

BlendFusion -- 可扩展的合成数据生成用于扩散模型训练

Thejas Venkatesh, Suguna Varshini Velury

机构 * Samaya AI, Inc.(Samaya AI公司) Stanford University(斯坦福大学) Independent Researcher(独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出BlendFusion框架,通过路径追踪生成高质量图像-描述对,构建FineBLEND数据集,并分析其质量及与现有数据集的对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08945 2026-04-13 cs.CV cs.RO 79%

TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches

TouchAnything: 从稀疏机器人触碰引导的3D重建

Langzhe Gu, Hung-Jui Huang, Mohamad Qadri, Michael Kaess, Wenzhen Yuan

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TouchAnything框架,利用预训练的2D视觉扩散模型作为语义和几何先验,从稀疏触觉测量中实现准确的3D重建,优于现有基线方法,支持开放世界中未见过的物体实例重建。

Comments Project Page: https://grange007.github.io/touchanything

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08922 2026-04-13 cs.CV 79%

Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios

抗退化融合:一种高效的抗退化扩散框架,用于任意退化场景下的多模态图像融合

Yu Shi, Yu Liu, Zhong-Cheng Wu, Juan Cheng, Huafeng Li, Xun Chen

机构 * Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学生物医学工程系) Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种高效的抗退化扩散框架,用于处理多模态图像融合中的复杂退化场景。该框架通过隐式去噪和联合观测模型校正机制,提升了在复杂退化下的融合性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08716 2026-04-13 cs.CV 79%

What Matters in Virtual Try-Off? Dual-UNet Diffusion Model For Garment Reconstruction

虚拟试穿中什么重要?用于服装重建的双UNet扩散模型

Loc-Phat Truong, Meysam Madadi, Sergio Escalera

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat de Barcelona, Spain(西班牙巴塞罗那大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了虚拟试穿的逆问题,提出双UNet扩散模型,通过比较生成骨干、条件设计和损失函数,实现了服装重建的先进性能,提升了基线并为未来研究提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08646 2026-04-13 cs.CV 79%

InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation

InsEdit:通过数据高效的视频扩散模型适应实现基于指令的视觉编辑

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(title);image editing(abstract);分类 cs.CV

AI总结 本文提出InsEdit,基于HunyuanVideo-1.5构建指令式编辑模型,结合Mutual Context Attention机制,仅需少量视频编辑数据即可实现高质量视频编辑,并支持图像编辑。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08546 2026-04-10 cs.CV 79%

When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例

Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学) Afari Intelligent Drive(阿法里智能驾驶)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。

Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08329 2026-04-10 eess.IV cs.MM 79%

DiV-INR: Extreme Low-Bitrate Diffusion Video Compression with INR Conditioning

DiV-INR:基于INR条件的极端低比特率扩散视频压缩

Eren Çetin, Lucas Relic, Yuanyi Xue, Markus Gross, Christopher Schroers, Roberto Azevedo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 本文提出一种结合隐式神经表示与预训练视频扩散模型的视频压缩框架,旨在解决极低比特率下的压缩问题,通过INR条件引导扩散过程,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08305 2026-04-10 eess.IV cs.AI cs.CV cs.ET cs.LG q-bio.QM 79%

HistDiT: A Structure-Aware Latent Conditional Diffusion Model for High-Fidelity Virtual Staining in Histopathology

HistDiT:一种结构感知的潜在条件扩散模型,用于病理学高保真的虚拟染色

Aasim Bin Saleem, Amr Ahmed, Ardhendu Behera, Hafeezullah Amin, Iman Yi Liao, Mahmoud Khattab, Pan Jia Wern, Haslina Makmur

机构 * Edge Hill University(埃奇希尔大学) University of Nottingham Malaysia(诺丁汉大学马来西亚分校) University of Southampton Malaysia(南安普顿大学马来西亚分校) Cancer Research Malaysia(马来西亚癌症研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HistDiT,一种新的潜在条件扩散变换器架构,通过双流条件策略和多目标损失函数提升虚拟组织染色的视觉保真度,解决传统方法在结构与染色平衡上的不足。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21366 2026-04-10 cs.CV cs.LG 79%

BADiff: Bandwidth Adaptive Diffusion Model

BADiff:带宽自适应扩散模型

Xi Zhang, Hanwei Zhu, Yan Zhong, Jiamang Wang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种带宽自适应扩散模型,通过端到端训练策略使模型根据实时网络带宽调整生成质量,提升带宽受限环境下的图像传输效率。

Comments NeurIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08084 2026-04-10 cs.CV 79%

DiffVC: A Non-autoregressive Framework Based on Diffusion Model for Video Captioning

DiffVC: 一种基于扩散模型的非自回归框架用于视频描述生成

Junbo Wang, Liangyu Fu, Yuke Li, Yining Zhu, Ya Jing, Xuecheng Wu, Jiangbin Zheng

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Beijing University Of Technology(北京工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffVC,一种基于扩散模型的非自回归框架,解决视频描述生成中自回归方法速度慢和累积误差问题,通过并行解码和判别性条件扩散模型提升生成质量,实验表明其在多个数据集上优于非自回归方法并接近自回归方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08048 2026-04-10 cs.CV 79%

Guiding a Diffusion Model by Swapping Its Tokens

通过交换令牌引导扩散模型

Weijia Zhang, Yuehao Liu, Shanyan Guan, Wu Ran, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种简单方法,通过交换令牌实现条件和无条件生成的CFG引导,提升图像质量和提示对齐。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07273 2026-04-10 cs.CV 79%

GenLCA: 3D Diffusion for Full-Body Avatars from In-the-Wild Videos

GenLCA:从真实视频中生成全身体素的3D扩散模型

Yiqian Wu, Rawal Khirodkar, Egor Zakharov, Timur Bagautdinov, Lei Xiao, Zhaoen Su, Shunsuke Saito, Xiaogang Jin, Junxuan Li

机构 * Codec Avatars Lab, Meta(Meta Codec Avatars实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GenLCA,一种基于扩散的生成模型,能从文本和图像输入生成逼真全身体素并进行编辑。通过利用预训练的avatar重建模型作为可动画的3D分词器,解决视频中部分观测导致的模糊或透明问题,提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03134 2026-04-10 cs.CV 79%

SD-FSMIS: Adapting Stable Diffusion for Few-Shot Medical Image Segmentation

SD-FSMIS:利用稳定扩散适应少样本医学图像分割

Meihua Li, Yang Zhang, Weizhao He, Hu Qu, Yisong Li

机构 * Computer Vision Institute, College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院计算机视觉研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SD-FSMIS框架,通过引入支持-查询交互和视觉到文本条件翻译模块,利用预训练的稳定扩散模型提升少样本医学图像分割的效率与鲁棒性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16570 2026-04-10 cs.CV 79%

Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration

Face2Scene:利用面部退化作为扩散基于场景恢复的 oracle

Amirhossein Kazerouni, Maitreya Suin, Tristan Aumentado-Armstrong, Sina Honari, Amanpreet Walia, Iqbal Mohomed, Konstantinos G. Derpanis, Babak Taati, Alex Levinshtein

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) AI Center–Toronto, Samsung Electronics(三星电子多伦多AI中心) University Health Network(大学健康网络) York University(约克大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Face2Scene框架,通过面部作为感知oracle估计退化并指导全图恢复,有效恢复身体和背景。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06774 2026-04-10 cs.CV cs.AI 79%

RDSplat: Robust Watermarking for 3D Gaussian Splatting Against 2D and 3D Diffusion Editing

RDSplat: 3D高斯散射中针对2D和3D扩散编辑的鲁棒水印

Longjie Zhao, Ziming Hong, Zhenyang Ren, Runnan Chen, Mingming Gong, Tongliang Liu

机构 * The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RDSplat是首个能抵御2D和3D扩散编辑的3D高斯散射水印框架,通过在低频高斯基元中嵌入100位水印,结合频率感知基元选择和替代策略,实现高效训练和强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11435 2026-04-10 cs.CV cs.AI 79%

The Persistence of Cultural Memory: Investigating Multimodal Iconicity in Diffusion Models

文化记忆的延续:探究扩散模型中的多模态图标性

Maria-Teresa De Rosa Palmini, Eva Cetinic

机构 * University of Zurich(苏黎世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究扩散模型在文化共享视觉参考提示下的泛化与记忆模糊性,提出CRT指标评估模型对文化参考的识别与实现能力,揭示模型行为依赖于对参考的识别与再现方式,推动评估向更丰富的语境理解发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23310 2026-04-10 cs.CV 79%

Balanced Diffusion-Guided Fusion for Multimodal Remote Sensing Classification

多模态遥感分类的平衡扩散引导融合

Hao Liu, Yongjie Zheng, Yuhan Kang, Mingyang Zhang, Maoguo Gong, Lorenzo Bruzzone

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) College of Electrical and Information Engineering, Hunan University(湖南大学电气与信息工程学院) Key Laboratory of Collaborative Intelligent Systems of Ministry of Education, Xidian University(西安电子科技大学教育部协同智能系统重点实验室) School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) Academy of Artificial Intelligence, Inner Mongolia Normal University(内蒙古师范大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出平衡扩散引导融合框架,通过多模态扩散特征指导多分支网络进行土地覆盖分类,采用自适应模态掩码策略和跨模态注意力机制提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05398 2026-04-10 cs.GR 79%

2ndMatch: Finetuning Pruned Diffusion Models via Second-Order Jacobian Matching

2ndMatch: 通过二阶雅可比匹配进行剪枝扩散模型的微调

Caleb Zheng, Eli Shlizerman

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出2ndMatch框架,通过二阶雅可比匹配损失提升剪枝扩散模型性能,实验表明其能显著改善输出质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08637 2026-04-10 cs.CV cs.AI cs.LG 79%

DMin: Scalable Training Data Influence Estimation for Diffusion Models

DMin:用于扩散模型的可扩展训练数据影响估计

Huawei Lin, Yingjie Lao, Weijie Zhao

机构 * Rochester Institute of Technology(罗切斯特理工学院) Tufts University(塔夫茨大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DMin框架,用于高效估计扩散模型中每个训练样本对生成图像的影响,解决了传统方法在大规模模型上的计算限制问题,实现了存储和计算效率的显著提升。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00436 2026-04-10 cs.CV 79%

Diff-PCR: Diffusion-Based Correspondence Searching in Doubly Stochastic Matrix Space for Point Cloud Registration

Diff-PCR: 基于双随机矩阵空间的扩散对应搜索用于点云配准

Haihua Shi, Qianliang Wu

机构 * Jinling Institute of Technology(金陵科技学院) PCA Lab, Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, and Jiangsu Key Lab of Image and Video Understanding for Social Security, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院,教育部高维信息智能感知与系统重点实验室,江苏省社会安全图像与视频理解重点实验室,PCA实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Diff-PCR框架,利用去噪扩散模型在双随机矩阵空间中预测最优匹配矩阵的搜索梯度,通过迭代优化提升点云配准的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07026 2026-04-09 cs.CV 79%

Not all tokens contribute equally to diffusion learning

并非所有标记对扩散学习贡献相等

Guoqing Zhang, Lu Shi, Wanru Xu, Linna Zhang, Sen Wang, Fangfang Wang, Yigang Cen

机构 * School of Mechanical Engineering, Guizhou University, Guizhou, China(贵州大学机械工程学院) School of Information Science and Technology, Hangzhou Normal University, Zhejiang, China(杭州师范大学信息科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DARE框架,通过分布偏见缓解和空间一致性提升扩散模型的语义引导,解决训练数据长尾分布和交叉注意力空间对齐问题,提升文本到视频生成的准确性和语义对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05743 2026-04-09 cs.CV cs.AI 79%

On the Robustness of Diffusion-Based Image Compression to Bit-Flip Errors

扩散基图像压缩对位翻转错误的鲁棒性

Amit Vaisman, Gal Pomerants, Raz Lapid

机构 * Technion - Israel Institute of Technology(以色列理工学院) Deepkeep

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究探讨了基于扩散的图像压缩在位翻转错误下的鲁棒性,提出更稳健的Turbo-DDCM变体,改进鲁棒性的同时保持率-失真-感知权衡。

Comments Accepted at AIGENS @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏