arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2502.06432 2026-03-10 cs.CV cs.AI 79%

Prompt-SID: Learning Structural Representation Prompt via Latent Diffusion for Single-Image Denoising

Prompt-SID: 通过潜在扩散学习结构表示提示进行单图像去噪

Huaqiu Li, Wang Zhang, Xiaowan Hu, Tao Jiang, Zikang Chen, Haoqian Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Prompt-SID通过潜在扩散学习结构表示提示,提升单图像去噪效果,有效保留结构细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07169 2026-03-10 cs.CV 79%

RDM: Recurrent Diffusion Model for Human Motion Generation

RDM:用于人类动作生成的递归扩散模型

Mirgahney Mohamed, Harry Jake Cunningham, Marc P. Deisenroth, Lourdes Agapito

机构 * Department of Computer Science, University College London(计算机科学系,伦敦大学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RDM通过递归扩散模型生成长序列人类动作,利用归一化流建模循环连接,提升效率并保持概率性质。

Comments v2: Major revision with extensive text polishing and structural updates. Added new experiments on the rollout effect, specifically analyzing the trade-offs between compute time and sequence length. Includes several new visualizations (Figures 6, 9, 10) and an expanded discussion in Section 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06696 2026-03-10 cs.CV 79%

HARP: HARmonizing in-vivo diffusion MRI using Phantom-only training

HARP: 仅使用假体数据进行体内扩散磁共振成像的协调

Hwihun Jeong, Qiang Liu, Kathryn E. Keenan, Elisabeth A. Wilde, Walter Schneider, Sudhir Pathak, Anthony Zuccolotto, Lauren J. O'Donnell, Lipeng Ning, Yogesh Rathi

机构 * Department of Psychiatry(精神医学系) Brigham and Women's Hospital(布里奇沃特医院) Harvard Medical School(哈佛医学院) College of Engineering(工程学院) Northeastern University(东北大学) National Institute of Standards and Technology(国家标准技术研究院) University of Utah School of Medicine(犹他大学医学院) George E. Wahlen Veterans Affairs Medical Center(乔治·E·瓦伦的退伍军人事务医疗中心) University of Pittsburgh(匹兹堡大学) Department of Radiology(放射医学系) Harvard-MIT Health Sciences and Technology(哈佛-麻省理工健康科学与技术)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HARP通过仅使用假体数据训练深度学习模型,实现了无需多站点活体数据的扩散磁共振成像协调,有效降低了扫描仪间变异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06640 2026-03-10 cs.CV cs.LG 79%

Roots Beneath the Cut: Uncovering the Risk of Concept Revival in Pruning-Based Unlearning for Diffusion Models

剪枝之下:揭示基于剪枝的去学习中概念复兴的风险

Ci Zhang, Zhaojun Ding, Chence Yang, Jun Liu, Xiaoming Zhai, Shaoyi Huang, Beiwen Li, Xiaolong Ma, Jin Lu, Geng Yuan

机构 * University of Georgia(佐治亚大学) Carnegie Mellon University(卡内基梅隆大学) Northeastern University(东北大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Arizona(亚利桑那大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文揭示基于剪枝的去学习中概念复兴的风险,提出攻击框架可无数据恢复被擦除概念,并探讨安全剪枝机制。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12719 2026-03-10 cs.CV 79%

S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation

S2DiT:用于移动流媒体视频生成的 Sandwich Diffusion Transformer

Lin Zhao, Yushu Wu, Aleksei Lebedev, Dishani Lahiri, Meng Dong, Arpit Sahni, Michael Vasilkovsky, Hao Chen, Ju Hu, Aliaksandr Siarohin, Sergey Tulyakov, Yanzhi Wang, Anil Kag, Yanyu Li

机构 * Snap Inc. Northeastern University(东北大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 S2DiT 通过高效注意力机制和 2-in-1 深度学习框架,在移动设备上实现高质量、高速度的流式视频生成。

Comments https://snap-research.github.io/S2DiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00790 2026-03-10 cs.CV cs.AI 79%

LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling

LD-RPS:通过潜势扩散递归后验采样实现零样本统一图像修复

Huaqiu Li, Yong Wang, Tongwen Huang, Hailang Huang, Haoqian Wang, Xiangxiang Chu

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里云(AMAP))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LD-RPS通过潜势扩散递归后验采样实现零样本统一图像修复,结合多模态模型和轻量模块提升修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17788 2026-03-10 cs.CV cs.AI 79%

From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two-Hand Reconstruction

从二维对齐到三维合理性:统一异构二维先验和无穿透扩散以实现抗遮挡的双手重建

Gaoge Han, Yongkang Cheng, Zhe Chen, Shaoli Huang, Tongliang Liu

机构 * AgiBot Mohamed bin Zayed University of Artificial Intelligence The University of Sydney La Trobe University

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出统一异构二维先验和无穿透扩散模型,以实现抗遮挡的双手重建,提升交互对齐和穿透抑制性能。

Comments Accepted by CVPR 2026 Main, Project: https://gaogehan.github.io/A2P/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09396 2026-03-10 cs.SD cs.CV eess.AS 79%

ExpGest: Expressive Speaker Generation Using Diffusion Model and Hybrid Audio-Text Guidance

ExpGest:利用扩散模型和混合音频-文本引导的表达性说话生成

Yongkang Cheng, Mingjiang Liang, Shaoli Huang, Gaoge Han, Jifeng Ning, Wei Liu

机构 * Northwest A&F University(西北农林科技大学) University of Technology Sydney(悉尼大学) Tencent AILab(腾讯AI实验室) City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ExpGest通过结合文本和音频信息,利用扩散模型生成更自然、可控的全身表达性手势。

Comments Accepted by ICME 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19931 2026-03-10 cs.CV cs.AI cs.LG 79%

Exploring Diffusion Models' Corruption Stage in Few-Shot Fine-tuning and Mitigating with Bayesian Neural Networks

探索扩散模型在少样本微调中的腐蚀阶段并利用贝叶斯神经网络缓解

Xiaoyu Wu, Jiaru Zhang, Yang Hua, Bohan Lyu, Hao Wang, Tao Song, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Queen’s University Belfast(女王学院 Belfast) Tsinghua University(清华大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究通过贝叶斯神经网络缓解扩散模型在少样本微调中的腐蚀阶段问题,提升生成图像质量。

Comments Accepted by KDD' 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06399 2026-03-09 cs.CV 79%

DiffInf: Influence-Guided Diffusion for Supervision Alignment in Facial Attribute Learning

DiffInf: 基于影响的扩散法用于面部属性学习中的监督对齐

Basudha Pal, Rama Chellappa

机构 * Departement of Electrical and Computer Engineering(电气与计算机工程系) Departement of Biomedical Engineering(生物医学工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffInf通过自影响引导的扩散方法,修复面部属性学习中的标注不一致,提升分类泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06057 2026-03-09 cs.CV cs.AI cs.LG cs.SD 79%

TempoSyncDiff: Distilled Temporally-Consistent Diffusion for Low-Latency Audio-Driven Talking Head Generation

TempoSyncDiff: 压缩时间一致扩散用于低延迟音频驱动说话头生成

Soumya Mazumdar, Vineet Kumar Rakesh

机构 * Computer and Informatics Group, Variable Energy Cyclotron Centre(计算机与信息组,变能循环中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TempoSyncDiff通过压缩扩散模型实现低延迟音频驱动说话头生成,结合教师-学生压缩和时间正则化以提高生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22654 2026-03-09 cs.CV 79%

Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache

去噪作为路径规划:通过DPCache实现扩散模型的训练免费加速

Bowen Cui, Yuanbin Wang, Huajiang Xu, Biaolong Chen, Aixi Zhang, Hao Jiang, Zhengzheng Jin, Xu Liu, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DPCache通过全局路径规划框架实现扩散模型的高效加速,减少计算开销并提升生成质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17830 2026-03-09 cs.CV 79%

SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training

SRA 2: 变分自编码器自表示对齐用于高效的扩散训练

Mengmeng Wang, Dengyang Jiang, Liuzhuozheng Li, Yucheng Lin, Guojiang Shen, Xiangjie Kong, Yong Liu, Guang Dai, Jingdong Wang

机构 * Zhejiang University of Technology(浙江工业大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Zhejiang University(浙江大学) Baidu(百度)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SRA 2通过利用预训练变分自编码器特征,提供一种轻量级的内在引导框架,提升扩散模型的生成质量和训练效率,仅增加4%的计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19319 2026-03-09 cs.CV 79%

SyncMV4D: Synchronized Multi-view Joint Diffusion of Appearance and Motion for Hand-Object Interaction Synthesis

SyncMV4D: 同步多视角联合生成外观与运动的 hand-object 交互合成

Lingwei Dang, Zonghan Li, Juntong Li, Hongwen Zhang, Liang An, Yebin Liu, Qingyao Wu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SyncMV4D通过联合生成多视角手-物体交互视频和4D运动,提升了视觉真实性和运动合理性。

Comments The structure and logic of writing will undergo a complete revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15335 2026-03-09 cs.CV cs.AI 79%

ExDD: Explicit Dual Distribution Learning for Surface Defect Detection via Diffusion Synthesis

ExDD:通过扩散合成实现表面缺陷检测的显式双分布学习

Muhammad Aqeel, Federico Leonardi, Francesco Setti

机构 * Dept. of Engineering for Innovation Medicine, University of Verona(创新医学工程系,威尼斯大学) Qualyco S.r.l.(Qualyco公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ExDD通过显式建模双分布和潜在扩散模型生成合成缺陷,提升工业表面缺陷检测的准确率和鲁棒性。

Comments Accepted to ICIAP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18663 2026-03-09 cs.CV 79%

DVD-Quant: Data-free Video Diffusion Transformers Quantization

DVD-Quant: 数据无依赖的视频扩散变换器量化

Zhiteng Li, Hanxuan Li, Junyi Wu, Kai Liu, Haotong Qin, Linghe Kong, Guihai Chen, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DVD-Quant通过无数据量化框架实现视频DiT模型的高效量化,提升运行速度并保持视觉质量。

Comments Code and models will be available at https://github.com/lhxcs/DVD-Quant

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19509 2026-03-09 cs.CV cs.LG cs.SD eess.AS 79%

Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head Synthesis

Ditto:用于可控实时说话头合成的运动空间扩散

Tianqi Li, Ruobing Zheng, Minghui Yang, Jingdong Chen, Ming Yang

机构 * Ant Group(蚂蚁集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Ditto通过运动空间扩散模型实现可控实时说话头合成,优化架构与训练策略以提升生成质量与实时性能。

Comments Project Page: https://digital-avatar.github.io/ai/Ditto/

Journal ref ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05315 2026-03-06 cs.CV 79%

Frequency-Aware Error-Bounded Caching for Accelerating Diffusion Transformers

面向频率的误差有界缓存用于加速扩散变换器

Guandong Li

机构 * iFLYTEK

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SpectralCache通过统一缓存框架提升扩散变换器推理速度,实现2.46倍加速,质量与TeaCache相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04638 2026-03-06 cs.CV cs.LG q-bio.QM 79%

Spinverse: Differentiable Physics for Permeability-Aware Microstructure Reconstruction from Diffusion MRI

Spinverse: 可微物理用于从扩散MRI中感知渗透性的微结构重建

Prathamesh Pradeep Khole, Mario M. Brenes, Zahra Kais Petiwala, Ehsan Mirafzali, Utkarsh Gupta, Jing-Rebecca Li, Andrada Ianus, Razvan Marinescu

机构 * University of California Santa Cruz(加州大学圣克鲁兹分校) University of California San Diego(加州大学圣地亚哥分校) Inria-Saclay(Inria-萨克莱实验室) Kings College London(伦敦国王学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Spinverse通过可微物理方法从扩散MRI中感知渗透性,重建微结构并优化渗透性参数以提高边界准确性和结构有效性。

Comments 10 Pages, 5 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23589 2026-03-06 cs.AI cs.CV cs.LG 79%

BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving

BridgeDrive: 基于扩散桥的闭环轨迹规划扩散策略

Shu Liu, Wenlin Chen, Weihao Li, Zheng Wang, Lijin Yang, Jianing Huang, Yipin Zhang, Zhongzhan Huang, Ze Cheng, Hao Yang

机构 * Bosch (China) Investment Ltd(博世(中国)投资有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 BridgeDrive提出一种基于锚点的扩散桥策略,通过实时闭环轨迹规划提升自动驾驶的安全性和效率。

Comments Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18534 2026-03-06 cs.CV cs.LG 79%

Elucidating the Design Space of Arbitrary-Noise-Based Diffusion Models

阐明基于任意噪声的扩散模型的设计空间

Xingyu Qiu, Mengying Yang, Xinghua Ma, Dong Liang, Fanding Li, Gongning Luo, Wei Wang, Kuanquan Wang, Shuo Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Case Western Reserve University(凯斯西储大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EDA通过扩展噪声模式灵活性并保持模块化,提升图像恢复任务的泛化能力。

Comments 16 pages, 4 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04307 2026-03-05 cs.CV 79%

Dual Diffusion Models for Multi-modal Guided 3D Avatar Generation

多模态引导的3D人像生成双扩散模型

Hong Li, Yutang Feng, Minqi Meng, Yichen Yang, Xuhui Liu, Baochang Zhang

机构 * Beihang University(北航大学) KAUST(卡塔尔科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出PromptAvatar,通过双扩散模型实现多模态引导的3D人像生成,提升生成质量与效率。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03792 2026-03-05 cs.CV cs.LG 79%

TAP: A Token-Adaptive Predictor Framework for Training-Free Diffusion Acceleration

TAP:一种用于无训练扩散加速的令牌自适应预测框架

Haowei Zhu, Tingxuan Huang, Xing Wang, Tianyu Zhao, Jiexi Wang, Weifeng Chen, Xurui Peng, Fangmin Chen, Junhai Yong, Bin Wang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TAP通过为每个令牌自适应选择预测器,实现无训练的扩散模型加速,提升生成效率并减少感知质量损失。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03602 2026-03-05 cs.CV 79%

DM-CFO: A Diffusion Model for Compositional 3D Tooth Generation with Collision-Free Optimization

DM-CFO: 一种用于无碰撞优化的组合3D牙齿生成扩散模型

Yan Tian, Pengcheng Xue, Weiping Ding, Mahmoud Hassaballah, Karen Egiazarian, Aura Conci, Abdulkadir Sengur, Leszek Rutkowski

机构 * School of Computer Science and Technology, Zhejiang Gongshang University(浙江工商大学计算机科学与技术学院) AGH University of Krakow(克拉科夫AGH大学) Polish Ministry of Science and Higher Education(波兰教育部) Tongxiang Institute of General Artificial Intelligence(同祥通用人工智能研究院) State Key Laboratory of Advanced Medical Materials and Devices(先进医学材料与器件国家重点实验室) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院) Department of Computer Science, College of Computer Engineering and Sciences, Prince Sattam Bin Abdulaziz University(普莱斯·本·阿卜杜勒阿齐兹大学计算机科学系) Department of Computer Science, Qena University(基纳大学计算机科学系) Department of Computing Sciences, Tampere University(塔尔库大学计算科学系) Department of Computer Science, Universidade Federal Fluminense(里约热内卢联邦大学计算机科学系) Shining3D Tech Co., Ltd.(Shining3D科技有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DM-CFO通过扩散模型和无碰撞优化生成组合3D牙齿,提升生成牙齿的多视图一致性和真实性。

Comments Received by IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21574 2026-03-05 cs.CV cs.LG 79%

Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models

我们是否需要所有合成数据?通过扩散模型的目标图像增强

Dang Nguyen, Jiping Li, Jinghao Zheng, Baharan Mirzasoleiman

机构 * University of California Los Angeles (UCLA)(加州大学洛杉矶分校) Ecole Polytechnique Federale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TADA通过选择性增强训练初期未被学习的示例,利用扩散模型提高图像分类的泛化能力,实验表明仅增强30-40%的数据即可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19289 2026-03-05 cs.CV 79%

FINE: Factorizing Knowledge for Initialization of Variable-sized Diffusion Models

FINE: 用于变量大小扩散模型初始化的知识因子化

Yucheng Xie, Fu Feng, Ruixiao Shi, Jianlu Shen, Jing Wang, Yong Rui, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(计算机科学与工程学院,东南大学,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用关键实验室(东南大学),教育部,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FINE通过分解知识为learngenes,实现变量大小扩散模型的高效初始化,无需重复预训练,提升资源受限部署下的性能与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07093 2026-03-05 cs.CV cs.AI 79%

3D Wavelet-Based Structural Priors for Controlled Diffusion in Whole-Body Low-Dose PET Denoising

基于3D小波的结构先验用于控制扩散的全身体低剂量PET去噪

Peiyuan Jing, Yue Yang, Chun-Wun Cheng, Zhenxuan Zhang, Liutao Yang, Thiago V. Lima, Klaus Strobel, Antoine Leimgruber, Angelica Aviles-Rivero, Guang Yang, Javier A. Montoya-Zegarra

机构 * School of Engineering, Zurich University of Applied Sciences, CH Bioengineering Department Imperial-X, Imperial College London, UK DAMTP, University of Cambridge, UK Lucerne University Teaching Research Hospital, CH Lung Institute, Imperial College London, UK Cardiovascular Research Centre, Royal Brompton Hospital, UK School of Biomedical Engineering \& Imaging Sciences, King's College London, UK Yau Mathematical Sciences Center, Tsinghua University, CN

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WCC-Net通过引入3D小波结构先验,提升低剂量PET去噪效果,实现更稳定的解剖结构与噪声分离。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03265 2026-03-04 cs.CV 79%

DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction

DuoMo:用于世界空间人体重建的双动差分

Yufu Wang, Evonne Ng, Soyong Shin, Rawal Khirodkar, Yuan Dong, Zhaoen Su, Jinhyung Park, Kris Kitani, Alexander Richard, Fabian Prada, Michael Zollhofer

机构 * Meta Reality Labs University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DuoMo通过双扩散模型实现世界空间人体运动重建,有效处理噪声和不完整输入,提升重建精度。

Comments CVPR 2026. Project page: https://yufu-wang.github.io/duomo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02882 2026-03-04 cs.CV 79%

SIGMark: Scalable In-Generation Watermark with Blind Extraction for Video Diffusion

SIGMark: 用于视频扩散模型的可扩展生成内水印与盲提取

Xinjie Zhu, Zijing Zhao, Hui Jin, Qingxiao Guo, Yilong Ma, Yunhao Wang, Xiaobing Guo, Weifeng Zhang

机构 * Lenovo Research(联想研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SIGMark是一种用于视频扩散模型的可扩展生成内水印框架,通过盲提取技术实现无损水印并提升鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02710 2026-03-04 cs.CV 79%

MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration

MiM-DiT:基于扩散变换器的MoE在MoE中实现全功能图像修复

Lingshun Kong, Jiawei Zhang, Zhengpeng Duan, Xiaohe Wu, Yueqi Yang, Xiaotao Wang, Dongqing Zou, Lei Lei, Jinshan Pan

机构 * Nanjing University of Science and Technology(南京理工大学) Nankai University(南开大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MiM-DiT通过双层MoE架构与预训练扩散模型,实现对多种图像退化类型的统一修复,提升复杂真实场景下的修复效果。

Comments Project website: https://github.com/kkkls/MIM-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏