arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2606.15457 2026-06-16 cs.CV cs.LG 新提交 79%

Lesion-DDPM: Lesion-Enhanced 3D Diffusion for MS MRI Synthesis

Lesion-DDPM:用于MS MRI合成的病灶增强3D扩散模型

Weidong Zhang, Yongchan Jung, Shafayat Mowla Anik, Furen Xiao, Vasudevan Janarthanan, Enkhzaya Chuluunbaatar, Byeong Kil Lee, Jeeho Ryoo

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) University of Texas at Dallas(德克萨斯大学达拉斯分校) National Taiwan University Hospital(国立台湾大学医院) National University of Mongolia(蒙古国立大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Lesion-DDPM,一种3D条件扩散框架,通过多级解剖掩膜注入和病灶加权重建损失,实现病灶感知的FLAIR合成,在MS病灶分割下游任务中显著提升Dice分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15389 2026-06-16 cs.CV 新提交 79%

Timestep Rescheduling in Diffusion Inversion

扩散反演中的时间步重调度

Shangquan Sun, Ting Gong, Zhirui Liu, Jiamin Wu, Runkai Zhao, Mianxin Liu, Wenqi Ren, Xiaochun Cao

机构 * Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散反演中时间步选择影响反演精度的问题,提出一种基于全局重缩放和局部动态规划的非均匀时间步调度器,有效降低反演误差,提升图像重建与编辑性能。

Comments Accepted by ICML 2026. 23 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15323 2026-06-16 cs.CV 新提交 79%

PPDM: Pixel Puzzling Diffusion Model for Speed and Memory Efficient Volumetric Medical Image Translation

PPDM: 像素拼图扩散模型用于速度和内存高效的体积医学图像翻译

Tianqi Chen, Jun Hou, Yinchi Zhou, James S. Duncan, Chi Liu, Bo Zhou

机构 * Department of Radiology, Northwestern University(西北大学放射学系) Department of Biomedical Engineering, Yale University(耶鲁大学生物医学工程系) Department of Radiology and Biomedical Imaging, Yale School of Medicine(耶鲁医学院放射学与生物医学影像系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出像素拼图扩散模型(PPDM),通过可逆像素拼图操作和直接桥接扩散公式,在降低内存和加速推理的同时保持全局一致性,用于3D医学图像翻译。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15304 2026-06-16 cs.CV 新提交 79%

HemExp: Clinically-Guided Latent Diffusion for Modeling Hematoma Expansion

HemExp: 临床引导的潜在扩散模型用于血肿扩展示建模

Orhun Utku Aydin, Satoru Tanioka, Tzu I Chuang, Alexander Koch, Dimitrios Rallios, Marie Gultom, Begum Tahhan, Fujimaro Ishida, Dietmar Frey, Adam Hilbert

机构 * CLAIM – Charité Lab for AI in Medicine, Charité – Universitätsmedizin Berlin, corporate member of Freie Universität Berlin and Humboldt-Universität zu Berlin(柏林夏里特医学院人工智能医学实验室(CLAIM),柏林夏里特医学院,柏林自由大学和柏林洪堡大学成员) Department of Neurosurgery, Mie Chuo Medical Center(三重中央医疗中心神经外科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出临床引导的潜在扩散模型HemExp,通过生成患者特异性随访CT图像及血肿分割,实现血肿扩展示的空间概率预测,支持临床变量扰动下的不确定性建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15048 2026-06-16 cs.LG cs.CV 新提交 79%

Temporal Difference Learning for Diffusion Models

扩散模型的时间差分学习

Qizhen Ying, Yangchen Pan, Victor Adrian Prisacariu, Junfeng Wen

机构 * Department of Engineering Science, University of Oxford, Oxford, United Kingdom(牛津大学工程科学系) School of Computer Science, Carleton University, Ottawa, Canada(卡尔顿大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出时间差分(TD)目标函数,通过将扩散过程视为马尔可夫奖励过程并利用强化学习中的策略评估,强制去噪轨迹上的跨时间一致性,显著提升少步采样下的生成质量。

Comments 15 pages, 4 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14879 2026-06-16 cs.RO cs.CV cs.LG 新提交 79%

VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy

VANDERER: 基于未来感知与视觉好奇心引导扩散策略的无地图探索

Venkata Naren Devarakonda, Raktim Gautam Goswami, Prashanth Krishnamurthy, Farshad Khorrami

机构 * Control/Robotics Research Laboratory (CRRL), Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(纽约大学坦登工程学院电气与计算机工程系控制/机器人研究实验室(CRRL)) New York University Abu Dhabi (NYUAD) Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比分校人工智能与机器人中心(CAIR))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出VANDERER框架,利用视觉好奇心模块引导预训练扩散策略,仅依赖单目图像实现高效无地图探索,在多种模拟环境中平均探索面积比NoMaD多13.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25449 2026-06-16 cs.CV 版本更新 79%

Pantheon360: Taming Digital Twin Generation via 3D-Aware 360° Video Diffusion

Pantheon360: 通过3D感知的360°视频扩散驯服数字孪生生成

Ting-Hsuan Chen, Ying-Huan Chen, Tao Tu, Jie-Ying Lee, Cho-Ying Wu, Fangzhou Lin, Hengyuan Zhang, David Paz, Xinyu Huang, Yuliang Guo, Yu-Lun Liu, Yue Wang, Liu Ren

机构 * University of Southern California(南加州大学) National Yang Ming Chiao Tung University(国家阳明交通大学) Cornell University(康奈尔大学) Bosch Research(博世研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Pantheon360框架,利用显式3D缓存从稀疏360°输入生成高保真视频,实现全局几何一致性和可控相机路径,解决传统透视视频生成器视野受限导致的跨视图不一致和时间漂移问题。

Comments Accepted to CVPR 2026. Project page: https://koi953215.github.io/pantheon360_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04239 2026-06-16 cs.CV 版本更新 79%

DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers

DiverseDiT:扩散Transformer中的多样化表示学习

Mengping Yang, Zhiyu Tan, Binglei Li, Xiaomeng Yang, Hesen Chen, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过分析扩散Transformer的表示动力学,发现块间表示多样性是关键,提出DiverseDiT框架,利用长残差连接和多样性损失促进多样特征学习,在ImageNet上提升性能并加速收敛。

Comments Accepted in CVPR 2026, GitHub Code: https://github.com/kobeshegu/DiverseDiT, Project Page: https://forevermamba.work/projects/DiverseDiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20202 2026-06-16 cs.CV 79%

An Efficient Watermarking Method for Latent Diffusion Models via Low-Rank Adaptation and Dynamic Loss Weighting

通过低秩适应与动态损失加权实现潜在扩散模型的高效水印方法

Dongdong Lin, Yue Li, Benedetta Tondi, Kaiqing Lin, Bin Li, Mauro Barni

机构 * Xiamen Key Laboratory of Data Security and Blockchain Technology, Huaqiao University, Xiamen 361021, China(厦门数据安全与区块链技术重点实验室,华侨大学,厦门361021,中国) Department of Information Engineering and Mathematics of the University of Siena, Italy(意大利锡耶纳大学信息工程与数学系) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University, Shenzhen 518060, China(广东省智能信息处理重点实验室,深圳大学,深圳518060,中国) Shenzhen Key Laboratory of Media Security, Shenzhen University, Shenzhen 518060, China(深圳媒体安全重点实验室,深圳大学,深圳518060,中国) SZU-AFS Joint Innovation Center for AI Technology, Shenzhen University, Shenzhen 518060, China(深圳大学人工智能技术联合创新中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于低秩适应的潜在扩散模型高效水印方法,通过动态损失加权平衡生成质量与水印保真度,实现快速准确的水印嵌入且不影响生成图像质量。

Journal ref Expert Systems with Applications. 331 (2026) 133172

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06637 2026-06-16 cs.CV 版本更新 79%

CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning

CLAD: 面向视觉-语言程序规划的约束潜在动作扩散模型

Lei Shi, Andreas Bulling

机构 * Machine Perception and Interaction group, Örebro University(机器感知与交互组,奥雷布罗大学) Collaborative Artificial Intelligence group, University of Stuttgart(协作人工智能组,斯图加特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CLAD模型,利用变分自编码器学习动作和观测的潜在表示作为约束,引导扩散模型生成动作,在三个数据集上大幅超越现有方法。

Comments Accepted at RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14072 2026-06-15 cs.CV cs.CL 新提交 79%

Diffusion-Refined Segmentation and Vision-Language Interpretation for Pediatric Brain Tumor MRI

扩散细化分割与视觉-语言解释用于儿童脑肿瘤MRI

Wentao Ke, Jianche Liu

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) School of Medicine, Stanford University(斯坦福大学医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出两阶段框架,先用Swin-UNETR粗分割,再用条件扩散模型细化边界,最后结合多模态语言模型生成结构化报告,提升儿童脑肿瘤分割精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13964 2026-06-15 cs.CV 新提交 79%

CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis

CaricHarmony:身份保持的漫画合成的对比扩散路径

Dongyu Wang, Dar-Yen Chen, Yi-Zhe Song

机构 * SketchX, CVSSP, University of Surrey(萨里大学CVSSP实验室SketchX组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CaricHarmony,一种无需训练的方法,通过并行无污染扩散路径解决身份与形状条件信号污染问题,实现平衡的漫画合成,在保持身份一致性的同时达到最优形状保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01801 2026-06-15 cs.CV cs.AI 版本更新 79%

Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention

快速自回归视频扩散与世界模型:基于时间缓存压缩与稀疏注意力

Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

机构 * Hebrew University of Jerusalem(特拉维夫大学) Google Research(谷歌研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FAST-AR框架,通过TempCache压缩KV缓存、AnnCA加速交叉注意力、AnnSA稀疏化自注意力,实现自回归视频扩散模型5-10倍加速,同时保持视觉质量并稳定GPU内存使用。

Comments Accepted to ICML 2026. Project Page: https://dvirsamuel.github.io/fast-auto-regressive-video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21179 2026-06-15 cs.CV 版本更新 79%

Enhancing Underwater Light Field Images via Global Geometry-aware Diffusion Process

通过全局几何感知扩散过程增强水下光场图像

Yuji Lin, Qian Zhao, Zongsheng Yue, Junhui Hou, Deyu Meng

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学学院) School of Mathematics and Statistics and the Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学学院和教育部智能网络与网络安全重点实验室) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Macao Institute of Systems Engineering, Macau University of Science and Technology(澳门系统工程研究院,澳门科学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于扩散的GeoDiff-LF框架,利用空间-角度结构增强水下4D光场成像,通过改进U-Net、几何引导损失和优化采样策略,有效缓解颜色失真,在视觉保真度和定量性能上超越现有方法。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13496 2026-06-12 cs.CV 新提交 79%

Budget-Constrained Step-Level Diffusion Caching

预算约束的步骤级扩散缓存

Mingkun Lei, Tong Zhao, Liangyu Yuan, Chi Zhang

机构 * Westlake-AGI-Lab(西湖大学AGI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出BudCache方法,通过离线搜索(模拟退火+爬山)在固定计算预算下优化缓存策略,并引入缓存感知调度对齐,以提升扩散模型生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13240 2026-06-12 cs.LG cs.AI cs.CV stat.ME stat.ML 新提交 79%

Towards More General Control of Diffusion Models Using Jeffrey Guidance

使用 Jeffrey 引导实现扩散模型的更通用控制

Raphaël Razafindralambo, Rémy Sun, Frédéric Precioso, Jes Frellsen, Pierre-Alexandre Mattei

机构 * Inria, CNRS, I3S, Maasai Université Côte d’Azur(法国国家信息与自动化研究所、法国国家科学研究中心、信息与系统科学实验室、马赛·蔚蓝海岸大学) Technical University of Denmark(丹麦技术大学) Inria, CNRS, LJAD, Maasai Université Côte d’Azur(法国国家信息与自动化研究所、法国国家科学研究中心、雅克-路易·利翁实验室、马赛·蔚蓝海岸大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出 Jeffrey 引导框架,通过 Jeffrey 条件规则更新边缘分布,扩展扩散模型控制到标准引导无法表达的应用,在 CIFAR-10 和 FFHQ 上显著降低 FID,并在 CelebA-HQ 上实现公平性控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12263 2026-06-12 cs.CV 新提交 79%

VOID: Defeating Unauthorized Mimicry in Latent Diffusion Models

VOID: 击败潜在扩散模型中的未授权模仿

Chunlin Qiu, Ang Li, Tianxiao Huang, Ruilin Gan, Yunjie Ge, Shenyi Zhang, Huayi Duan, Lingchen Zhao, Chao Shen, Qian Wang

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Institute for Math&AI, Wuhan University(武汉大学数学与人工智能研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) School of Cyber Science and Engineering, Xi’an Jiaotong University(西安交通大学网络空间安全学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对潜在扩散模型被用于未授权模仿的问题,提出VOID防御框架,通过操纵模型内在随机性,放大潜在编码误差并抵消目标引导信号,实现语义破坏,阻止未授权模仿,同时将扰动限制在人眼不可感知区域。

Comments Extended full version with more comprehensive experimental results. To appear in the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02849 2026-06-11 cs.CV 版本更新 79%

Active Sampling for Ultra-Low-Bit-Rate Video Compression via Conditional Controlled Diffusion

通过条件控制扩散实现超低比特率视频压缩的主动采样

Amirhosein Javadi, Shirin Saeedi Bidokhti, Tara Javidi

机构 * Department of Electrical and Computer Engineering, University of California San Diego(电子与计算机工程系,加州大学圣地亚哥分校) Department of Electrical and Systems Engineering, University of Pennsylvania(电子与系统工程系,宾夕法尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ActDiff-VC框架,利用条件扩散模型和主动采样策略(自适应关键帧选择与预算感知稀疏轨迹选择),在超低比特率下实现高感知质量视频压缩。

Comments 21 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22335 2026-06-11 cs.CV cs.AI 版本更新 79%

Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction

超越扩散:层级到层级自回归用于fMRI到图像重建

Xu Zhang, Ruijie Quan, Wenguan Wang, Yi Yang

机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University, China(脑机智能国家重点实验室,浙江大学,中国) ReLER, CCAI, College of Artificial Intelligence, Zhejiang University, China(ReLER、中国人工智能学会、人工智能学院、浙江大学、中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MindHier框架,通过层级fMRI编码器、层级对齐和尺度感知粗到细引导策略,实现从粗到细的fMRI到图像重建,优于扩散方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03933 2026-06-11 cs.CV cs.AI 版本更新 79%

Diffusion-based Cumulative Adversarial Purification for Vision Language Models

基于扩散的累积对抗净化方法用于视觉语言模型

Jia Fu, Yongtao Wu, Yihang Chen, Kunyu Peng, Xiao Zhang, Volkan Cevher, Sepideh Pashami, Anders Holst

机构 * KTH Royal Institute of Technology(皇家理工学院) Swiss Federal Institute of Technology Lausanne(洛桑联邦理工学院) University of California, Los Angeles(加州大学洛杉矶分校) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍兹中心) RISE Research Institutes of Sweden(瑞典RISE研究机构) Halmstad University(哈马碧大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DiffCAP,一种基于扩散的对抗净化策略,通过理论证明对抗效应随扩散单调衰减,并利用噪声注入与VLM嵌入相似度阈值自适应净化,显著提升防御效果并加速去噪。

Comments Accepted to Transactions on Machine Learning Research (TMLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11180 2026-06-10 cs.CV 新提交 79%

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

Lip Forcing: 用于实时唇部同步的少步自回归扩散

Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee, Joungbin Lee, Siyoon Jin, Heeseong Shin, Jung Yi, Yunjin Park, Chulmin Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) AIPARK

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Lip Forcing,首个用于视频到视频唇部同步的自回归扩散方法,通过蒸馏14B教师模型为因果学生模型,仅需两步去噪即可实现实时同步,并引入同步窗口DMD、两步推理计划和SyncNet奖励。

Comments Project Page: https://cvlab-kaist.github.io/LipForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07800 2026-06-10 cs.CV 版本更新 79%

SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models

SARA: 语义自适应关系对齐用于视频扩散模型

Jiesong Lian, Zixiang Zhou, Ruizhe Zhong, Yuan Zhou, Qinglin Lu, Rui Wang, Long Hu, Yixue Hao, Baoru Huang

机构 * Tencent Hunyuan(腾讯文英)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出SARA方法,通过文本条件显著性引导令牌对监督,提升视频扩散模型的文本对齐和运动质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08379 2026-06-10 cs.LG cs.AI cs.CV 版本更新 79%

MMD Guidance: Training-Free Distribution Adaptation for Diffusion Models via Maximum Mean Discrepancy Guidance

MMD Guidance: 基于最大均值差异引导的无训练分布适应扩散模型

Matina Mahdizadeh Sani, Nima Jamali, Mohammad Jalali, Farzan Farnia

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MMD Guidance,一种无训练方法,通过最大均值差异梯度引导扩散模型采样,实现与参考数据分布对齐,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16518 2026-06-10 cs.CV cs.AR 版本更新 79%

FG-Attn: Leveraging Fine-Grained Sparse Attention in Video Diffusion Models

FG-Attn:在视频扩散模型中利用细粒度稀疏注意力

Sankeerth Durvasula, Kavya Sreedhar, Zain Moustafa, Suraj Kothawade, Tianlei Pang, Ashish Gondimalla, Suvinay Subramanian, Narges Shahidi, Nandita Vijaykumar

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型中注意力层计算开销大的问题,提出FG-Attn,一种低开销的细粒度稀疏注意力机制,在MxN块粒度上跳过分数计算,实现最高2.45倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09718 2026-06-09 cs.LG cs.CV 新提交 79%

Evaluating the Representation Space of Diffusion Models via Self-Supervised Principles

通过自监督原则评估扩散模型的表示空间

Xiao Li, Yixuan Jia, Zekai Zhang, Xiang Li, Lianghe Shi, Jinxin Zhou, Zhihui Zhu, Liyue Shen, Qing Qu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 受自监督学习启发,提出基于Fisher信息的度量ICR,分解特征为不变和残差成分,用于联合评估扩散模型的表示与生成能力,发现中间噪声水平下不变性最强且分类性能最佳,ICR可敏感检测训练中的记忆化。

Comments First two authors contributed equally. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09608 2026-06-09 cs.CV 新提交 79%

TUDSR: Twice Upsampling-Diffusion for Higher Super-Resolution

TUDSR: 用于更高超分辨率的两次上采样扩散

Zhiqiang Wu, Yitong Dong, Xian Wei

机构 * East China Normal University(华东师范大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TUDSR框架,通过两阶段训练(R分辨率和NR分辨率)结合循环分块策略,在SD2.1基础上实现1024²和2048²高分辨率图像超分辨率,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09378 2026-06-09 cs.CV 新提交 79%

Echo-DM: Ultrasound Marker Removal via Conditional Latent Diffusion and Region-Aware Fusion

Echo-DM: 通过条件潜在扩散和区域感知融合去除超声标记

Zhiwei Wang, Tao Huang, Wentao Jiang, Muyi Li, Jianxin Liu, Jian Chen, Jie Zou, Yong Luo, Bo Du, Jing Zhang

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) The Central Hospital of Wuhan, China(武汉市中心医院) School of Computer Science, Hubei University of Technology, China(湖北工业大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Echo-DM框架,结合条件潜在扩散和区域感知融合,在无掩码条件下有效去除超声图像中的人工标记,同时保持解剖结构保真度。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09250 2026-06-09 cs.CV 新提交 79%

LiteVSR: Lightweight Adaptation of Frozen Diffusion Transformers for Video Super-Resolution

LiteVSR: 冻结扩散变换器的轻量级自适应用于视频超分辨率

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出LiteVSR,利用流匹配原理,通过轻量级状态感知适配器在冻结扩散变换器上实现视频超分辨率,仅需11.25%可训练参数和12 GPU小时训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08957 2026-06-09 cs.CV 新提交 79%

Rethinking 3D Shape Generation: Diffusion over Superquadrics

重新思考3D形状生成:超二次曲面上的扩散

Zhiyang Liu, Wanze Li, Yuwei Wu, Chengran Yuan, Jiawei Sun, Rui Zheng, Marcelo H Ang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出将扩散模型从高基数几何表示转移到紧凑的超二次曲面参数上,以降低计算和内存成本,并支持无分辨率点云解码、部件级编辑和约束设计,实现高效生成。

Comments Accepted to ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08788 2026-06-09 cs.CV 新提交 79%

MaskAlign: Token-Subset Representation Alignment for Efficient Diffusion Training

MaskAlign: 面向高效扩散训练的令牌子集表示对齐

Lianyu Pang, Tianlin Pan, Cheng Da, Changqian Yu, Huan Yang, Kun Gai, Song Guo, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散模型与预训练视觉模型表示对齐中令牌级信息不匹配问题,提出MaskAlign方法,通过随机采样令牌子集进行对齐,并引入预掩码令牌混合块减少信息损失,提升训练效率和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏