arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2605.20624 2026-05-21 cs.CV cs.AI cs.LG 79%

Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models

用自回归扩散模型加速视频逆问题求解器

Taesung Kwon, Jonghyun Park, Hyungjin Chung, Jong Chul Ye

机构 * KAIST(韩国科学技术院) EverEx

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出自回归视频逆问题求解器(AVIS),通过自回归扩散模型实现流式视频恢复,显著降低初始延迟并提高吞吐量,同时保持高质量的恢复效果,并进一步提出加速变体AVIS Flash,实现更高的吞吐量和更优的效率-性能权衡,为实时部署铺平道路。

Comments Project page is available here: https://avis-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04068 2026-05-21 cs.CV cs.AI 79%

Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models

注意生成细节:面向视频扩散模型的直接局部化细节偏好优化

Zitong Huang, Kaidong Zhang, Yukang Ding, Chao Gao, Rui Ding, Ying Chen, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Alibaba Group - Taobao & Tmall Group(阿里巴巴集团-淘宝 & 天猫集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LocalDPO,一种新的后训练框架,通过从真实视频中构建局部偏好对,并在时空区域层面优化对齐,以提高视频生成的质量和人类偏好评分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20502 2026-05-21 cs.LG cs.AI cs.CV stat.AP stat.ML 79%

Tippett-minimum Fusion of Representation-space Diffusion Models for Multi-Encoder Out-of-Distribution Detection

基于表示空间扩散模型的Tippett最小融合多编码器异常检测

Neelkamal Bhuyan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种多编码器融合的表示空间扩散模型,通过统计分析每个编码器对特定分布偏移类型的敏感性,引入EncMin2L门控机制,无需使用OOD标签即可在较低参数成本下提升异常检测性能,同时在四种分布偏移类型上均达到0.94以上的AUROC。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20470 2026-05-21 cs.CV cs.AI physics.med-ph 79%

EPC-3D-Diff: Equivariant Physics Consistent Conditional 3D Latent Diffusion for CBCT to CT Synthesis

EPC-3D-Diff: 基于CBCT到CT合成的等价物理一致条件3D潜在扩散模型

Alzahra Altalib, Chunhui Li, Haytham Al Ewaidat, Khaled Alawneh, Ahmad Qendel, Alessandro Perelli

机构 * School of Science and Engineering, University of Dundee UK(邓迪大学科学与工程学院) Faculty of Applied Sciences, Jordan University of Science and Technology(约旦科学技术大学应用科学学院) Experia Healthcare, Jordan(约旦Experia医疗) School of Cardiovascular and Metabolic Health, University of Glasgow UK(格拉斯哥大学心血管与代谢健康学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出EPC-3D-Diff,一种新的条件3D潜在扩散框架,用于体积CBCT到CT合成,通过引入从成像物理导出的投影域等价损失,提高了物理一致性。该方法在训练过程中通过正向投影旋转合成的CT体积,并将其与相应角度偏移的投影进行匹配,从而在扩散目标中集成物理一致的等价约束。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20274 2026-05-21 cs.GR cs.AI 79%

PolycubeNet: A Dual-latent Diffusion Model for Polycube-Based Hexahedral Mesh Generation

PolycubeNet: 一种基于多立方体的双潜在扩散模型用于六面体网格生成

Lu He, Qitao Deng, Junjiang Deng, Liangbin Deng, Yanjun Liang, Wenting Yang, Guoqiang Wang, Na Lei

机构 * Dalian University of Technology(大连理工大学) Jiangxi University of Science and Technology(江西理工大学) School of Mathematical Sciences, Guangxi Minzu University(广西民族大学数学与计算机科学学院) Caohejing Hi-Tech Park Development Co., Ltd.(曹家京高科技园发展有限公司) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出了一种基于条件扩散模型的端到端框架,用于生成基于多立方体的六面体网格,通过双潜在条件扩散架构有效解耦了计算复杂度与输入输出分辨率,提高了生成效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19865 2026-05-20 cs.CV 79%

Landscape-Awareness for Geometric View Diffusion Model

面向几何视角的扩散模型

Yan-Ting Chen, Hao-Wei Chen, Tsu-Ching Hsiao, Chun-Yi Lee

机构 * Elsa Lab, National Taiwan University(国家台湾大学 Elsa 实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种面向几何视角的扩散模型,通过重塑优化景观来引导更新至真实视角,并通过视角条件扩散模型进行细化,以提高收敛性、减少对暴力采样依赖并实现更高的样本效率。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19804 2026-05-20 cs.CV cs.AI cs.LG 79%

Stitched Value Model for Diffusion Alignment

用于扩散对齐的拼接价值模型

Hyojun Go, Hyungjin Chung, Prune Truong, Goutam Bhat, Li Mi, Zhaochong An, Zixiang Zhao, Dominik Narnhofer, Serge Belongie, Federico Tombari, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) University of Copenhagen(哥本哈根大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出StitchVM,一种将预训练的干净图像奖励模型转移到噪声潜在空间的拼接框架,通过高效转移和微调,提升扩散对齐的效率和效果。

Comments Project page: https://gohyojun15.github.io/StitchVM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19556 2026-05-20 cs.CV 79%

EpiDiffVO: Geometry-Aware Epipolar Diffusion for Robust Visual Odometry

EpiDiffVO: 一种基于几何的视差扩散用于鲁棒视觉里程计

Prateeth Rao

机构 * International Institute of Information Technology Bangalore(国际信息科技学院班加罗尔)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种稀疏视差匹配框架,通过优化几何一致性来减少冗余,并结合视差扩散过程和图神经网络实现高效的视觉里程计。

Comments 8 pages, 5 figures, in revision to be submitted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19378 2026-05-20 cs.CV 79%

Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock

视觉扩散变换器中稀疏专家混合路由的稀疏性:从路由崩溃到选择性死锁的诊断、边界校准和进化路线图

Haiying Sha

机构 * Haiying Sha(海ying Sha)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文系统诊断了Token-Choice稀疏混合专家(MoE)在视频扩散变换器中的训练失败模式,通过分析超过6500万个标记的路由决策时间序列,提出了功能冗余假说,并总结了从视觉统一到世界模型的三步进化路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14530 2026-05-20 cs.CV 79%

Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models

缓解大扩散视觉-语言模型中的遮蔽先验漂移和位置注意力崩溃

Sujung Hong, Chanyong Yoon, Seong Jae Hwang

机构 * Department of Artificial Intelligence, Yonsei University, Seoul, Republic of Korea(首尔大学人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了大扩散视觉-语言模型在长形式生成中的重复生成和视觉 grounding 退化问题,提出了一种无需训练的解决方案来缓解遮蔽先验漂移和位置注意力崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20981 2026-05-20 cs.CV 79%

Distribution Prototype Diffusion Learning for Open-set Supervised Anomaly Detection

分布原型扩散学习用于开放集监督异常检测

Fuyun Wang, Tong Zhang, Yuanzhi Wang, Yide Qiu, Xin Liu, Xu Guo, Zhen Cui

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing SeetaCloud Technology(南京海康威视科技) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种分布原型扩散学习方法,通过构建可学习的高斯原型来创建潜在表示空间,以提高正常样本的判别边界,并通过Schroedinger桥促进正常样本向原型的扩散,同时将异常样本推离,从而提升异常检测性能。

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18719 2026-05-19 cs.CV 79%

SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

SafeDiffusion-R1: 在线奖励引导用于安全扩散后训练

Komal Kumar, Ankan Deria, Abhishek Basu, Fahad Shamshad, Hisham Cholakkal, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种在线强化学习框架,通过在负样本和正样本文本提示上进行后训练,利用组相对策略优化(GRPO)解决数据稀缺和模型退化问题,引入了引导奖励机制以提高扩散模型的安全性,实验表明其在减少不适当内容和提升生成质量方面表现优异。

Comments Page 28, Image 20, Table 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18190 2026-05-19 cs.LG cs.CV 79%

Dual-Rate Diffusion: Accelerating diffusion models with an interleaved heavy-light network

双速率扩散:通过交错重-轻网络加速扩散模型

Grigory Bartosh, David Ruhe, Emiel Hoogeboom, Jonathan Heek, Thomas Mensink, Tim Salimans

机构 * Google DeepMind Amsterdam(谷歌深Mind阿姆斯特丹) Amsterdam University of Amsterdam(阿姆斯特丹大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出双速率扩散方法,通过交错执行高容量上下文编码器和轻量解噪模型,加速扩散模型推理,同时保持样本质量,在ImageNet基准上实现性能与计算成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14330 2026-05-19 cs.CV cs.LG 79%

LURE: Latent Space Unblocking for Multi-Concept Reawakening in Diffusion Models

LURE: 用于扩散模型多概念重新唤醒的潜在空间解阻

Mengyu Sun, Ziyuan Yang, Andrew Beng Jin Teoh, Junxu Liu, Haibo Hu, Yi Zhang

机构 * Sichuan University(四川大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LURE方法,通过重建潜在空间和引导采样轨迹,实现多概念的高保真重新唤醒,解决了现有方法在多概念场景下的梯度冲突和特征纠缠问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18991 2026-05-19 cs.CV 79%

Fast Kernel-Space Diffusion for Remote Sensing Pansharpening

快速核空间扩散用于遥感全色锐化

Hancong Jin, Zihan Cao, Liang-jian Deng, Jingjing Li

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出KSDiff框架,通过整合低秩核心张量生成器和统一因子生成器,利用结构感知的多头注意力机制生成增强全局上下文的卷积核,以提升全色锐化质量并加速推理,实验表明其在性能和效率上均优于现有方法。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17850 2026-05-19 stat.ML cs.CV cs.LG cs.NA math.NA math.PR 79%

Simple Approximation and Derivative Free Inference-Time Scaling for Diffusion Models via Sequential Monte Carlo on Path Measures

通过路径测度的序列蒙特卡洛实现扩散模型的简单近似与无导数推理时间缩放

Chenyang Wang, Weizhong Wang, Yinuo Ren, Jose Blanchet, Yiping Lu

机构 * School of Mathematical Sciences, Peking University, Beijing, China School of Mathematical Sciences, Fudan University, Shanghai, China Department of Industrial Engineering \& Management Sciences, Northwestern University, Evanston, IL, United States Institute for Computational \& Mathematical Engineering, Stanford University, Stanford, CA, United States Management Science \& Engineering, Stanford University, Stanford, CA, United States

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出URGE算法,一种无需梯度的推理时间缩放方法,通过路径重要性重加权提升扩散模型样本质量,同时在合成测试和扩散模型基准中表现出色,且实现简单且无梯度依赖。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17527 2026-05-19 cs.CV 79%

Designing streetscapes from street-view imagery using diffusion models

利用扩散模型从街景图像中设计街道景观

Yuzhou Chen, Yuebing Liang, Lingqian Hu, Kailai Sun, Qingqi Song, Chang Zhao, Shenhao Wang

机构 * Department of Urban and Regional Planning, University of Florida(城市与区域规划系,佛罗里达大学) Singapore-MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工联合研究中心(SMART)) Department of Landscape Architecture and Urban Planning, Texas A&M University(景观建筑与城市规划系,德克萨斯大学安德森分校) Department of Agronomy, University of Florida(农业系,佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种生成多模态AI框架,通过目标视觉指标生成替代的街道景观,提升了城市规划和设计中的视觉探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02198 2026-05-19 cs.CV 79%

SlimDiffSR: Toward Lightweight and Efficient Remote Sensing Image Super-Resolution via Diffusion Model Distillation

SlimDiffSR: 向轻量高效遥感图像超分辨率迈进:通过扩散模型蒸馏

Ce Wang, Zhenyu Hu, Wanjie Sun

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SlimDiffSR,一种轻量高效的基于扩散模型的遥感图像超分辨率框架,通过引入不确定性引导的时间步分配策略和结构化剪枝策略,提升模型效率和重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12755 2026-05-19 cs.CV 79%

Towards reconstructing experimental sparse-view X-ray CT data with diffusion models

向稀疏视角X射线CT数据重建迈进:基于扩散模型

Nelas J. Thomsen, Xinyuan Wang, Felix Lucka, Ezgi Demircan-Tureyen

机构 * 1 Martin-Luther-University Halle-Wittenberg, Institute of Physics, Halle, Germany 2 Centrum Wiskunde \& Informatica, Computational Imaging Group, Amsterdam, The Netherlands

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了如何利用扩散模型重建稀疏视角X射线CT数据,探讨了训练数据不匹配(域偏移)和正向模型不匹配对实验数据应用的影响,发现域偏移在不同程度上影响模型性能,而正向模型不匹配可通过退火似然权重调度缓解。

Comments 5 pages + references, 4 figures, 2 tables, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11130 2026-05-19 cs.LG cs.CV 79%

Meltdown: Circuits and Bifurcations in Point-Cloud-Conditioned 3D Diffusion Transformers

Meltdown: 点云条件化3D扩散变换器中的电路与分叉

Maximilian Plattner, Fabian Paischer, Johannes Brandstetter, Arturs Berzins

机构 * Institute for Machine Learning, JKU Linz(机器学习研究所,林茨大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究探讨了点云条件化3D扩散变换器在输入变化下的失败模式,揭示了Meltdown现象,通过机制性案例研究展示了其成因,并提出了PowerRemap方法以抑制该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12598 2026-05-19 cs.CV 79%

Setting the Stage: Text-Driven Scene-Consistent Image Generation

设定舞台:基于文本的场景一致图像生成

Cong Xie, Che Wang, Yan Zhang, Ruiqi Yu, Han Zou, Zheng Pan, Zhenpeng Zhan

机构 * Global Business Unit, Baidu Inc.(百度公司全球业务部)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文研究了场景构建任务,通过结合参考场景图像和文本条件生成符合空间关系的演员图像,提出了一种新的数据构建管道和对应关系引导的注意力损失,以提高场景一致性和文本-图像一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06384 2026-05-19 eess.IV cs.CV 79%

Mitigating 3D Prostate Biparametric MRI Data Scarcity through Domain Adaptation using Locally-Trained Latent Diffusion Models for Prostate Cancer Detection

通过使用本地训练的潜在扩散模型进行领域适应以缓解3D前列腺双参数MRI数据稀缺问题

Emerson P. Grabke, Babak Taati, Masoom A. Haider

机构 * Institute of Biomedical Engineering, University of Toronto(多伦多大学生物医学工程研究所) Lunenfeld-Tanenbaum Research Institute, Mount Sinai Hospital(圣心医院卢内尔-塔内本研究所) KITE Research Institute, Toronto Rehabilitation Institute, University Health Network(多伦多康复研究所、KITE研究所在大学健康网络) Joint Department of Medical Imaging, University of Toronto, Princess Margaret Hospital, and Sinai Health systems(多伦多大学联合医学影像部门、玛格丽特医院及辛纳医疗系统) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Faculty Affiliate of the Vector Institute, Toronto(向量研究所教职员工)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CCELLA++,一种新的潜在扩散模型流程,用于同时生成3D双参数前列腺MRI(bpMRI),包括轴向T2加权(AxT2)、高b值扩散系列(HighB)和表观扩散系数图(ADC),以克服数据稀缺问题。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18158 2026-05-19 cs.CV eess.IV 79%

Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion

语义解耦与组合用于具有高效LLM推理和生成扩散的通用图像编码

Jinming Liu, Yuntao Wei, Junyan Lin, Shengyang Zhao, Heming Sun, Zhibo Chen, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Ningbo Institute of Digital Twin(宁波数字孪生研究院) Eastern Institute of Technology(东部技术研究院) University of Science and Technology of China(中国科学技术大学) Yokohama National University(Yokohama国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UniCodec,一种基于语义解耦和组合生成的通用图像编码框架,通过高效LLM推理和生成扩散模型实现人类和机器需求的统一压缩,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17248 2026-05-19 cs.CV 79%

Image-to-Video Diffusion: From Foundations to Open Frontiers

图像到视频扩散:从基础到开放前沿

Xianlong Wang, Wenbo Pan, Shijia Zhou, Ke Li, Yuqi Wang, Zeyu Ye, Hangtao Zhang, Leo Yu Zhang, Xiaohua Jia

机构 * IEEE Publication Technology Group(IEEE出版技术组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了图像到视频扩散生成的核心问题,通过梳理任务定义、模型架构、数据集和评估指标,提出了一种基于架构和训练范式的分类方法,并总结了四个核心设计:条件编码、时间建模、噪声先验设计和空间时间上采样,探讨了代表性应用场景和主要开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17087 2026-05-19 cs.CV 79%

The Learnability Gap in Medical Latent Diffusion

医学潜在扩散中的可学习差距

Mischa Dombrowski, Felix Nützel, Bernhard Kainz

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了医学图像中潜在扩散模型在处理类别不平衡问题时的可学习差距,指出尽管预训练的自动编码器能有效编码判别特征,但其潜在表示的结构性使分类器难以学习,通过开发噪声条件潜在分类器和图像空间蒸馏技术,提高了效率并改善了潜在空间质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16990 2026-05-19 cs.CV 79%

DreamEdit3D: Personalization of Multi-View Diffusion Models for 3D Editing

DreamEdit3D: 多视角扩散模型的3D编辑个性化

Jinxin Ai, Matthias Nießner, Ziya Erkoç

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DreamEdit3D,通过自然语言实现多视角扩散模型的3D编辑个性化,通过提取语义组件并学习不同组件的token嵌入,实现多视角一致的高质量3D编辑。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16949 2026-05-19 cs.CV 79%

Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers

超越点对点匹配:为加速扩散变换器的结构表示对齐

Shaodong Xu, Zhendong Wang, Litong Gong, Zexian Li, Wengang Zhou, Tiezheng Ge, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出sREPA框架,通过显式结构约束来对齐特征图的相对几何关系,以提高生成质量并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16918 2026-05-19 cs.CV 79%

HighSync: High-Quality Lip Synchronization via Latent Diffusion Models

HighSync: 通过潜在扩散模型实现高质量唇部同步

Saeed Firouzi Daghigh, Majid Iranpour Mobarekeh, Mostafa Alavi, Mehdi Bagheri

机构 * Department of Computer Engineering and Information Technology, Payam Noor University(Payam Noor大学计算机工程与信息科技系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HighSync,一种端到端的扩散框架,用于生成与任意输入音频对齐的逼真说话人脸视频。该方法同时解决了图像质量和同步准确性之间的矛盾,是首个原生在512*512分辨率上运行的唇部同步模型,适用于电影和广播行业等专业生产环境。

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16807 2026-05-19 cs.CV 79%

DecoRec: Decomposed 3D Scene Reconstruction from Single-View Images via Object-Level Diffusion

DecoRec: 通过物体级扩散进行单视图图像的分解3D场景重建

Yuhan Ping, Yuan Liu, Xiaoxiao Long, Peng Wang, Junhui Hou, Jianyi Zheng, Jia Pan, Xin Li, Cheng Lin

机构 * Department of Computer Science, the University of Hong Kong(香港大学计算机科学系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Faculty of Humanities and Arts, Macau University of Science and Technology(澳门科学理工学院人文艺术学院) Department of Computer Science and Engineering, Texas A&M University(德克萨斯A&M大学计算机科学与工程系) Department of Computer Science and Engineering, Macau University of Science and Technology(澳门科学理工学院计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DecoRec系统,通过物体级扩散方法实现单视图图像的分解3D场景重建,解决了现有方法在场景重建中出现的精度问题,并通过可微渲染和扩散引导细化技术提升重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14223 2026-05-19 cs.CV 79%

StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion Model

StreamingTalker: 基于音频的3D面部动画与自回归扩散模型

Yifan Yang, Zhi Cen, Sida Peng, Xiangwei Chen, Yifu Deng, Xinyu Zhu, Fan Jia, Xiaowei Zhou, Hujun Bao

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) College of Computer Science, Zhejiang University(浙江大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于自回归扩散模型的StreamingTalker,解决音频驱动3D面部动画中长音频处理延迟和超训练范围的问题,通过动态条件生成高质量实时面部动作。

详情

展开后加载摘要…

URL PDF HTML 收藏