arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70082 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2606.06853 2026-06-08 cs.CV cs.AI 新提交 79%

MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

MotionEnhancer: 利用视频扩散模型增强运动感知的视觉-语言模型

Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Beijing Digital Native Digital City Research Center(北京数字原生数字城研究中心) School of Computer Science, Peking University(北京大学计算机学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MotionEnhancer,通过从视频扩散模型中提取运动先验并利用注意力对齐增强视觉-语言模型的运动理解能力,无需额外参数或架构修改,在运动级视频理解基准上取得一致提升。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02919 2026-06-08 cs.CV 版本更新 79%

Pixel Cube: Diffusion-based Portrait Video Relighting Through Realistic Lighting Reproduction

Pixel Cube: 基于扩散的肖像视频重光照通过真实感光照再现

Yufan Zhang, Yu Ji, Ayo Ajiboye, Rundi Wu, Yu Guo, Changxi Zheng, Jinwei Ye

机构 * George Mason University(乔治·马歇尔大学) LightThought LLC Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于扩散的方法,利用混合训练数据集和HDR环境图控制,实现动态肖像视频的真实感重光照,保持时间一致性和身份特征。

Comments ACM SIGGRAPH 2026 Journal Track / ACM Transactions on Graphics, 17 pages. Project page: https://yufanzhang82.github.io/PixelCube/

Journal ref ACM Trans. Graph. 45, 4, Article 119 (July 2026), 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19611 2026-06-08 cs.CV cs.ET 版本更新 79%

Physics Guided Conditional Diffusion Framework for Generative Inverse Design of Manufacturable Metasurface based Absorbers

基于物理引导的条件扩散模型的超材料吸收体逆向设计

Vineetha Joy, Jamshed Palai, Satwik Sahu, Anshuman Kumar, Amit Sethi, Hema Singh

机构 * Centre for Electromagnetics, CSIR-National Aerospace Laboratories(电磁研究中心,国家航空航天实验室) Birla Institute of Technology and Science, Pilani(比拉理工学院,皮兰) Indian Institute of Technology, Bombay(孟买印度理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于物理引导的条件扩散框架,用于设计具有特定电磁响应的超材料吸收体,通过特征线性调制和预训练的替代电磁模拟器,提高了设计效率和条件准确性,实验表明该方法在2-18GHz频率范围内能够快速生成实用的超材料结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10578 2026-06-08 cs.CV 版本更新 79%

Rein3D: Reinforced 3D Indoor Scene Generation with Panoramic Video Diffusion Models

Rein3D: 基于全景视频扩散模型的强化3D室内场景生成

Dehui Wang, Rong Wei, Yue Shi, Congsheng Xu, Shoufa Chen, Dingxiang Luo, Tianshuo Yang, Xiaokang Yang, Wei Sui, Yusen Qin, Rui Tang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Manycore Tech Inc.(Manycore科技公司) D-Robotics The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Rein3D框架,结合3D高斯泼溅与视频扩散模型,通过“恢复-细化”范式从稀疏输入生成全局一致的360度室内场景,并构建PanoV2V-15K数据集,显著提升长距离相机探索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04791 2026-06-08 cs.CV cs.LG 版本更新 79%

Measurement-Consistent Langevin Corrector for Stabilizing Latent Diffusion Inverse Problem Solvers

用于稳定潜在扩散逆问题求解器的测量一致朗之万校正器

Lee Hyoseok, Sohwi Lim, Eunju Cha, Tae-Hyun Oh

机构 * Sookmyung Women's University(成均馆女子大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对潜在扩散模型逆问题求解器的不稳定性,提出测量一致朗之万校正器(MCLC),通过测量一致的朗之万更新缩小求解器与稳定反向扩散之间的差距,实现稳定可靠的潜在空间求解。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09568 2026-06-08 physics.chem-ph cs.AI cs.CV 79%

VEDA: 3D Molecular Generation via Variance-Exploding Diffusion with Annealing

VEDA:通过退火变方差扩散实现3D分子生成

Peining Zhang, Jinbo Bi, Minghu Song

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VEDA结合退火变方差扩散与SE(3)等价架构,高效生成准确的3D分子结构,实现高化学精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06477 2026-06-05 cs.CV 79%

Complexity-Balanced Diffusion Splitting

复杂度平衡的扩散分裂

Noam Issachar, Dani Lischinski, Raanan Fattal

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出复杂度平衡分裂(CBS)框架,通过将扩散时间线划分为等近似负担的段并分配更多容量给困难区域,在多个架构和数据集上提升生成质量而不增加推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06060 2026-06-05 cs.CV 79%

ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE

ReCache: 通过REINFORCE学习扩散模型的预算感知缓存调度

Mishan Aliev, Eva Neudachina, Ilya Bykov, Aleksandr Oganov, Kirill Struminsky, Aibek Alanov, Denis Rakitin

机构 * HSE University(俄罗斯高等经济学院) Yandex Research(Yandex研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ReCache,利用策略梯度学习在给定计算预算下最大化生成质量的去噪步骤重计算调度,无需标注数据且兼容多种缓存机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03998 2026-06-05 eess.SP cs.CV 79%

TGSD: Topology-Guided State-Space Diffusion Framework for EEG Spatial Super-Resolution

TGSD: 拓扑引导的状态空间扩散用于EEG空间超分辨率

Zijian Kang, Weiming Zeng, Yueyang Li, Shengyu Gong, Hongjie Yan, Wai Ting Siok, Nizhuan Wang

机构 * Lab of Digital Image and Intelligent Computation, Shanghai Maritime University(数字图像与智能计算实验室,上海海洋大学) Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系,香港理工大学) Affiliated Lianyungang Hospital of Xuzhou Medical University(徐州医学院连云港医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TGSD框架,通过拓扑引导的状态空间扩散模型,利用分层空间先验编码器和条件状态空间扩散重建器,从低密度EEG恢复高密度信号,在SEED和PhysioNet MM/I数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19839 2026-06-05 cs.CV 79%

When Preference Labels Fall Short: Aligning Diffusion Models from Real Data

当偏好标签不足时:从真实数据对齐扩散模型

Weiyan Chen, Weijian Deng, Yao Xiao, Weijie Tu, ZiYi Dong, Ibrahim Radwan, Liang Lin, Pengxu Wei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了真实数据作为偏好对齐的替代监督源,通过数据驱动的方法,利用真实图像作为参考点,对比生成或扰动样本以构建偏好信号,无需手动标注的偏好对,实验证明真实数据监督能有效对齐扩散模型并达到与现有偏好方法相当的性能。

Comments ICML 2026 Camera Ready; Project Page: https://cwyxx.github.io/RealAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12336 2026-06-05 cs.CV 79%

Unsupervised Monocular 3D Keypoint Discovery from Multi-View Diffusion Priors

无监督单目多视图扩散先验的3D关键点发现

Subin Jeon, In Cho, Junyoung Hong, Woong Oh Cho, Seon Joo Kim

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出KeyDiff3D框架,通过单张图像准确预测3D关键点,利用预训练的多视图扩散模型中的几何先验,将隐式3D先验转化为显式3D特征体,实现关键点估计和3D对象操控。

Comments Accepted at CVPR 2026. Project page: https://subin6.github.io/keydiff3d-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04898 2026-06-04 cs.CV 79%

CDPM-Align: Multi-Scale Guidance-Aligned Diffusion Pretraining for Robust Few-Shot Anatomical Landmark Detection

CDPM-Align:用于鲁棒少样本解剖标志检测的多尺度引导对齐扩散预训练

Roberto Di Via, Irina Voiculescu, Francesca Odone, Vito Paolo Pastore

机构 * MaLGa DIBRIS, University of Genoa(DIBRIS,热那亚大学) University of Genoa(热那亚大学) Department of Computer Science, University of Oxford(奥大利大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出多尺度引导对齐的条件扩散预训练方法CDPM-Align,通过生成式预训练学习鲁棒表示,在少样本和低标注场景下提升解剖标志检测的准确性和不确定性。

Comments Accepted MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04107 2026-06-04 cs.CV 79%

Reflection Separation from a Single Image via Joint Latent Diffusion

基于联合潜在扩散的单图像反射分离

Zheng-Hui Huang, Zhixiang Wang, Yu-Lun Liu, Yung-Yu Chuang

机构 * Shanda AI Research Tokyo(Shanda AI Research东京) National Taiwan University(台湾大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于扩散模型的方法,通过联合生成透射和反射层、跨层自注意力机制、分离采样策略和潜在优化,解决强光或弱反射等极端条件下的单图像反射分离问题。

Comments CVPR 2026. Project page: https://brian90709.github.io/diff-reflection-separation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15741 2026-06-04 cs.CV 79%

HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion

HyperDiT: 用于高保真像素空间扩散的超连接Transformer

Yu He, Lichen Ma, Zipeng Guo, Xinyuan Shan, Jingling Fu, Dong Chen, Junshi Huang, Yan Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对像素空间扩散模型中全局语义与细粒度细节难以兼顾的粒度困境,提出HyperDiT框架,通过超连接跨尺度交互和尺度感知旋转位置编码,结合预训练视觉基础模型的密集语义,在像素空间实现高保真生成,在ImageNet 256×256上取得1.56的SoTA FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20304 2026-06-04 cs.CV 79%

Transferable Multi-Bit Watermarking Across Frozen Diffusion Models via Latent Consistency Bridges

跨冻结扩散模型的可迁移多位水印:基于潜在一致性桥

Hong-Hanh Nguyen-Le, Van-Tuan Tran, Thuc D. Nguyen, Nhien-An Le-Khac

机构 * National Institute of Advanced Intelligence Science and Technology, Japan(日本国家先进人工智能科学与技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DiffMark,一种即插即用的多位水印框架,通过潜在一致性模型实现高效训练,在单个前向传播中提取64位水印,速度提升45倍,并支持跨架构迁移。

Comments Accepted in Second Workshop on Technical AI Governance Research (TAIGR) @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23214 2026-06-04 cs.CV cs.LG eess.IV 79%

Plug-and-Play Diffusion Meets ADMM: Dual-Variable Coupling for Robust Medical Image Reconstruction

即插即用扩散遇见ADMM:双变量耦合用于鲁棒医学图像重建

Chenhe Du, Xuanyu Tian, Qing Wu, Muyu Liu, Jingyi Yu, Hongjiang Wei, Yuyao Zhang

机构 * ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出双耦合即插即用扩散(DC-PnPDP)框架,通过引入经典对偶变量提供积分反馈并采用频谱均匀化(SH)处理结构伪影,解决了现有PnP求解器的稳态偏差和幻觉问题,在CT和MRI重建中实现了最先进的保真度和加速收敛。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.12084 2026-06-04 cs.CV cs.LG cs.NA math.AP math.NA 79%

Networks for Nonlinear Diffusion Problems in Imaging

图像中非线性扩散问题的网络

Simon Arridge, Andreas Hauptmann

机构 * Department of Computer Science(计算机科学系;伦敦大学学院) University College London

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于非线性扩散过程的网络架构DiffNet,用于解决图像中的非线性扩散问题,该网络在可解释性和泛化能力方面优于传统卷积神经网络,并在非线性扩散逆问题上取得了与U-Net相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1509.02223 2026-06-04 cs.CV cs.NA math.NA 79%

Diffusion tensor imaging with deterministic error bounds

具有确定性误差边界的扩散张量成像

Artur Gorokh, Yury Korolev, Tuomo Valkonen

机构 * Faculty of Physics, Lomonosov Moscow State University(莫斯科罗蒙诺索夫国立大学物理系) School of Engineering and Materials Science, Queen Mary University of London(伦敦女王玛丽大学工程与材料科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文在Banach格中利用偏序理论建模逆问题的误差,应用于扩散张量成像中复杂噪声建模问题,通过确定性误差边界方法简化非线性Stejskal-Tanner方程的处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03971 2026-06-03 cs.CV 79%

Video-Mirai: Autoregressive Video Diffusion Models Need Foresight

Video-Mirai: 自回归视频扩散模型需要远见

Yonghao Yu, Lang Huang, Runyi Li, Zerun Wang, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学) National Institute of Informatics(信息处理研究所) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Video-Mirai训练方法,通过冻结的远见编码器从完整生成序列中提取未来信息并蒸馏到因果状态,在不改变推理过程的情况下弥合表示层面的规划差距,提升长视频生成的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03915 2026-06-03 cs.CV 79%

PatchScene: Patch-based Voxel Diffusion for Large-Scale Scene Completion

PatchScene:基于体素块扩散的大规模场景补全

Qingdong Xu, Jiajun Zhu, Shilin Zhu, Xinjing He, Chao Lu, Huanran Wang, Jiyao Zhang

机构 * MEGVII Technology(MEGVII技术有限公司) Qianli Technology(千利技术) Peking University(北京大学) Northeastern University, China(中国东北大学) Northwest Polytechnical University, Xi’an(西北工业大学西安校区)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PatchScene,一种基于体素块扩散的框架,通过局部3D区域细粒度生成、置信度引导的时空融合和环形流扩散策略,实现大规模LiDAR场景补全,在SemanticKITTI上达到最优性能并展现强泛化能力。

Comments 10 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03903 2026-06-03 cs.CV 79%

An Attention-Based Denoising Model for Diffusion Weighted Imaging

一种基于注意力的扩散加权成像去噪模型

Prithviraj Verma, Pawan Kumar, Chandan Deshani, Prasun Chandra Tripathi

机构 * Institute of Infrastructure Technology Research and Management (IITRAM)(基础设施技术研究与管理研究所) University of Sheffield(谢菲尔德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种结合Swin Transformer窗口注意力和多维门控精化的噪声感知注意力驱动去噪框架,用于解决DWI中信号依赖的Rician噪声问题,在1%至15%噪声水平下实现平均PSNR 33.69 dB和SSIM 0.8539。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09708 2026-06-03 cs.LG cs.AI cs.CV cs.NA math.NA 79%

Physics-informed diffusion models in spectral space

谱空间中的物理信息扩散模型

Davide Gallon, Philippe von Wurstemberger, Patrick Cheridito, Arnulf Jentzen

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出物理信息谱扩散(PISD)方法,结合生成式潜扩散模型与物理信息机器学习,在谱表示潜空间中对偏微分方程参数和解进行扩散建模,通过扩散后验采样施加物理约束和测量条件,在泊松、亥姆霍兹和不可压缩纳维-斯托克斯方程上展现出比现有扩散求解器更高的精度和计算效率。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09105 2026-06-03 cs.CV 79%

Hybrid Autoregressive-Diffusion Model for Real-Time Sign Language Production

混合自回归-扩散模型用于实时手语生成

Maoxiao Ye, Xinfeng Ye, Mano Manoharan

机构 * University of Auckland(奥克兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出HybridSign混合自回归-扩散模型,结合因果帧生成与流式扩散精炼,实现低延迟高质量手语生成,在PHOENIX14T和How2Sign上取得最佳质量-效率权衡。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1202.5414 2026-06-03 math.AP cs.CV cs.NA math.NA math.RT 79%

Left-Invariant Diffusion on the Motion Group in terms of the Irreducible Representations of SO(3)

基于SO(3)不可约表示的运动群上的左不变扩散

Marco Reisert, Henrik Skibbe

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 利用SO(3)不可约表示将SE(3)上的左不变向量场表示为平移坐标的微分形式和旋转的代数形式,避免了对SO(3)或S2的显式离散化,并应用于扩散加权磁共振成像和目标检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02532 2026-06-02 cs.CV 79%

Improving Combined Detection and Classification of TEM Defects via Mask-Conditioned Latent Diffusion Augmentation

通过掩码条件潜在扩散增强改善TEM缺陷的联合检测与分类

Ni Li, Nuohao Liu, Ryan Jacobs, Ajay Annamareddy, Maciej P. Polak, Kevin Field, Izabela Szlufarska, Dane Morgan

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Michigan-Ann Arbor(密歇根大学安娜堡分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于掩码条件潜在扩散模型(LDM)的生成式数据增强方法,用于合成可控、自动标注的多类缺陷掩码的TEM图像,以提升小样本下Mask R-CNN模型的缺陷检测与分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02129 2026-06-02 cs.CV 79%

Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization

均衡扩散:面向均衡图像定制的频率感知文本嵌入

Liyuan Ma, Xueji Fang, Guo-Jun Qi

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出均衡扩散方法,通过频率空间分解概念特征并独立优化嵌入,实现风格与主体解耦,提升定制图像的保真度和文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02105 2026-06-02 cs.CV 79%

Multimodal Action Diffusion for Robust End-to-End Autonomous Driving

多模态动作扩散用于鲁棒的端到端自动驾驶

Jorge Daniel Rodríguez-Vidal, Diego Porres, Gabriel Villalonga Pineda, Antonio M. López Peña

机构 * Computer Vision Center (CVC)(计算机视觉中心) Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出动作扩散变换器(ADT),通过多模态动作建模和最近邻匹配,在闭环Bench2Drive基准上超越先前最优方法,同时延迟降低十倍。

Comments Preprint. June 1st, 2026. Corresponding author: Jorge Daniel Rodríguez-Vidal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02000 2026-06-02 cs.CV cs.AI eess.IV 79%

Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization

迈向3D感知视频扩散模型:基于网格标记化的无渲染人体运动控制

Jingyun Liang, Min Wei, Shikai Li, Yizeng Han, Hangjie Yuan, Lei Sun, Weihua Chen, Fan Wang

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团大模型实验室) Hupan Lab(虎盘实验室) Zhejiang University(浙江大学) INSAIT

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种无渲染框架,通过压缩的3D人体网格标记直接条件化视频生成,实现精确的人体运动控制,减少2D引导伪影并提升3D结构建模能力。

Comments Project page: https://jingyunliang.github.io/MeshToken/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01048 2026-06-02 cs.CV 79%

Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation

解耦残差去噪扩散模型用于统一且数据高效的图像到图像翻译

Ziyue Lin, Jiahe Hou, Hongyu Xia, Xinrui Xie, Feifei Wang, Yuyin Zhou, Wei Wang, Jiawei Liu, Liangqiong Qu

机构 * The University of Hong Kong(香港大学) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) The Chinese University of Hong Kong(香港中文大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出解耦残差去噪扩散模型(DRDD),通过将扩散过程解耦为随机噪声扩散和确定性残差扩散两个独立阶段,实现统一且数据高效的图像到图像翻译。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00957 2026-06-02 cs.CV 79%

Boundary-Protection W8A8 HiFloat8 Quantization for Large-Scale Text-to-Video Diffusion Transformers

面向大规模文生视频扩散Transformer的边界保护W8A8 HiFloat8量化

Yiming Zhao

机构 * Yiming Zhao(赵毅铭)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对Wan2.1-T2V-14B模型,提出一种边界保护策略的W8A8 HiF8后训练量化方法,通过保留首尾边界块为BF16而量化中间块,在VBench五个维度上匹配或略优于BF16基线。

Comments 6 pages, 5 figures. Accepted to ICME 2026 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏