arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2602.19180 2026-02-24 cs.CV 79%

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19064 2026-02-24 cs.CV 79%

L3DR: 3D-aware LiDAR Diffusion and Rectification

L3DR:基于3D感知的LiDAR扩散与校正

Quan Liu, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 L3DR通过3D-aware的LiDAR扩散和校正框架,在3D空间中消除RV伪影并恢复局部几何结构,实现更真实的3D几何生成。

Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15082 2026-02-24 cs.SD cs.AI cs.MM 79%

S-PRESSO: Ultra Low Bitrate Sound Effect Compression With Diffusion Autoencoders And Offline Quantization

S-PRESSO:基于扩散自编码器和离线量化的小 bitrate 声音效果压缩

Zineb Lahrichi, Gaëtan Hadjeres, Gaël Richard, Geoffroy Peeters

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 S-PRESSO通过扩散自编码器和离线量化,在极低bitrate下实现高质量声音效果压缩。

Journal ref International Conference on Acoustics, Speech, and Signal Processing (ICASSP), May 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05571 2026-02-24 cs.CV 79%

MedDIFT: Multi-Scale Diffusion-Based Correspondence in 3D Medical Imaging

MedDIFT:3D医学影像中的多尺度扩散对应方法

Xingyu Zhang, Anna Reithmeir, Fryderyk Kögl, Rickmer Braren, Julia A. Schnabel, Daniel M. Lang

机构 * 1 School of Computation, Information Technology, Technical University of Munich 2 Institute of Machine Learning in Biomedical Imaging, Helmholtz Munich 3 Munich Center for Machine Learning (MCML) 4 Institute for Diagnostic Interventional Radiology, Klinkum Rechts der Isar 5 School of Biomedical Engineering \& Imaging Sciences, King’s College London

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MedDIFT通过多尺度扩散特征融合实现无需训练的3D医学影像对应,有效提升解剖结构匹配精度。

Comments Updated results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05016 2026-02-24 cs.CV 79%

Generative Neural Video Compression via Video Diffusion Prior

基于视频扩散先验的生成神经视频压缩

Qi Mao, Hao Cheng, Tinghan Yang, Libiao Jin, Siwei Ma

机构 * School of Information and Communication Engineering, Communication University of China(信息与通信工程学院,通信大学) School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GNVC-VD通过结合视频扩散先验和序列级去噪,实现了高效的生成神经视频压缩,显著减少了闪烁伪影并提升了感知质量。

Comments accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19166 2026-02-24 cs.MM 79%

Step-Aware Residual-Guided Diffusion for EEG Spatial Super-Resolution

步感知残差引导扩散用于EEG空间超分辨率

Hongjun Liu, Leyu Zhou, Zijianghao Yang, Chao Yao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 SRGDiff通过步感知残差引导扩散模型,提升EEG空间超分辨率的保真度与一致性,实现高达40%的性能提升。

Comments ICLR 2026 Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23377 2026-02-24 cs.CV cs.AI cs.SD eess.AS 79%

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

JavisDiT:具有层次化时空先验同步的联合音频视频扩散变换器

Kai Liu, Wei Li, Lai Chen, Shengqiong Wu, Yanhao Zheng, Jiayi Ji, Fan Zhou, Jiebo Luo, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 JavisDiT通过层次化时空先验同步机制,实现了高质量的音频视频同步生成,解决了现实场景中的同步评估问题。

Comments Accepted by ICLR 2026. Homepage: https://javisverse.github.io/JavisDiT-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18874 2026-02-24 cs.CV cs.AI 79%

Structure-Level Disentangled Diffusion for Few-Shot Chinese Font Generation

结构层面解耦的扩散模型用于少样本中文字体生成

Jie Li, Suorong Yang, Jian Zhao, Furao Shen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(人工智能学院) Department of Computer Science and Technology, Nanjing University, China(计算机科学与技术系) School of Electronic Science and Engineering, Nanjing University, China(电子科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SLD-Font通过结构层面解耦和参数高效微调,实现少样本中文字体生成中更高的风格保真度和内容准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18428 2026-02-23 cs.LG cs.CV eess.IV 79%

The Geometry of Noise: Why Diffusion Models Don't Need Noise Conditioning

噪声的几何学:为什么扩散模型不需要噪声条件

Mojtaba Sahraee-Ardakan, Mauricio Delbracio, Peyman Milanfar

机构 * Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究通过形式化边际能量,揭示了自主生成模型在噪声无关条件下的稳定生成机制,并证明其通过黎曼梯度流实现稳定吸引子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11603 2026-02-20 cs.CV 79%

CoreEditor: Correspondence-constrained Diffusion for Consistent 3D Editing

CoreEditor: 基于对应关系的扩散模型用于一致的3D编辑

Zhe Zhu, Honghua Chen, Peng Li, Mingqiang Wei

机构 * School of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Shenzhen Research Institute, Nanjing University of Aeronautics and Astronautics(南京航空航天大学深圳研究院) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CoreEditor通过引入对应关系约束的注意力机制,实现了高质量且一致的3D编辑,显著优于现有方法。

Comments Accepted by IEEE TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16968 2026-02-20 cs.CV cs.AI 79%

DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers

DDiT: 动态补丁调度用于高效的扩散变换器

Dahye Kim, Deepti Ghadiyaram, Raghudeep Gadde

机构 * Boston University(波士顿大学) Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DDiT通过动态调整补丁大小,在保持生成质量的同时显著提升扩散变换器的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07835 2026-02-20 cs.CV 79%

VFace: A Training-Free Approach for Diffusion-Based Video Face Swapping

VFace:一种无需训练的基于扩散模型的视频人脸交换方法

Sanoojan Baliah, Yohan Abeysinghe, Rusiru Thushara, Khan Muhammad, Abhinav Dhall, Karthik Nandakumar, Muhammad Haris Khan

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VFace提出一种无需训练的视频人脸交换方法,通过频率谱注意力插值、目标结构引导和流引导注意力时间平滑机制,提升时间一致性和视觉保真度。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00191 2026-02-19 cs.LG cs.CV 79%

GEPC: Group-Equivariant Posterior Consistency for Out-of-Distribution Detection in Diffusion Models

GEPC: 组等变后验一致性用于扩散模型中的分布外检测

Yadang Alexis Rouzoumka, Jean Pinsolle, Eugénie Terreaux, Christèle Morisseau, Jean-Philippe Ovarlez, Chengfang Ren

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GEPC通过测量分数在有限群下的变换一致性,实现扩散模型中分布外检测的后验一致性,提供轻量级且可解释的检测方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15030 2026-02-17 cs.CV 79%

Image Generation with a Sphere Encoder

基于球体编码器的图像生成

Kaiyu Yue, Menglin Jia, Ji Hou, Tom Goldstein

机构 * Meta University of Maryland(马里兰大学)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 Sphere Encoder通过球形潜在空间生成图像,以更少的步骤实现与多步扩散模型相当的性能,且推理成本更低。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16117 2026-02-17 cs.LG cs.AI cs.CV 79%

DiffusionNFT: Online Diffusion Reinforcement with Forward Process

DiffusionNFT: 在线扩散强化学习与正向过程

Kaiwen Zheng, Huayu Chen, Haotian Ye, Haoxiang Wang, Qinsheng Zhang, Kai Jiang, Hang Su, Stefano Ermon, Jun Zhu, Ming-Yu Liu

机构 * Tsinghua University(清华大学) NVIDIA Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffusionNFT通过正向过程优化扩散模型,结合正负生成对比提升强化学习效率,无需CFG且比FlowGRPO更高效。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14577 2026-02-17 cs.CV 79%

DriveFine: Refining-Augmented Masked Diffusion VLA for Precise and Robust Driving

DriveFine: 通过细化增强的掩码扩散VLA实现精确且鲁棒的驾驶

Chenxu Dang, Sining Ang, Yongkang Li, Haochen Tian, Jie Wang, Guang Li, Hangjun Ye, Jie Ma, Long Chen, Yan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DriveFine提出一种结合灵活解码与自我纠正能力的掩码扩散VLA模型,通过插件式块MoE和混合强化学习策略提升自动驾驶规划的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13993 2026-02-17 cs.CV 79%

Elastic Diffusion Transformer

弹性扩散变换器

Jiangshan Wang, Zeqiang Lai, Jiarui Chen, Jiayi Guo, Hang Guo, Xiu Li, Xiangyu Yue, Chunchao Guo

机构 * Tsinghua University(清华大学) MMLab, CUHK(CUHK实验室) Tencent Hunyuan(腾讯文言)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 E-DiT通过自适应加速框架提升扩散变换器效率,保持生成质量,实现约2倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13361 2026-02-17 cs.CV 79%

The Diffusion Duet: Harmonizing Dual Channels with Wavelet Suppression for Image Separation

扩散双人行:通过小波抑制和谐双通道图像分离

Jingwei Li, Wei Pu

机构 * Zhejiang Gongshang University(浙江工商大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DCDSM模型,通过小波抑制模块和双通道扩散模型提升图像分离性能,在雨雪去除和复杂混合分离中取得优异效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13347 2026-02-17 cs.CV cs.AI cs.RO 79%

Visual Foresight for Robotic Stow: A Diffusion-Based World Model from Sparse Snapshots

机器人存取的视觉预见:一种基于稀疏快照的扩散世界模型

Lijun Zhang, Nikhil Chacko, Petter Nilsson, Ruinian Xu, Shantanu Thakar, Bai Lou, Harpreet Sawhney, Zhebin Zhang, Mudit Agrawal, Bhavana Chandrashekhar, Aaron Parness

机构 * Amazon, Seattle, US(亚马逊(美国西雅图))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FOREST通过基于稀疏快照的扩散模型,提升仓库存取操作的预测精度,为仓储规划提供有效预见信号。

Comments 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13303 2026-02-17 cs.CV cs.AI cs.LG eess.IV 79%

Spectral Collapse in Diffusion Inversion

扩散反演中的谱塌陷

Nicolas Bourriez, Alexandre Verine, Auguste Genovesio

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OVG方法,解决扩散反演中结构与纹理的权衡问题,通过校正ODE动力学以恢复真实纹理并保持结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00787 2026-02-17 cs.CV 79%

Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models

基于CLIP引导的多模态扩散模型的图像到脑信号生成用于视觉假体

Ganxi Xu, Zhao-Rong Lai, Yuting Tang, Yonghao Song, Guoxu Zhou, Boyu wang, Jian Zhu, Jinyi Long

机构 * Jinan University, Guangzhou, China Department of Rehabilitation Medicine, The First Affiliated Hospital of Jinan University, Guangzhou, China Western University, Ontario, Canada Guangdong University of Technology, Guangzhou, China Tsinghua University, Beijing, China

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于CLIP引导的多模态扩散模型,实现图像到脑信号的转换,通过交叉注意力机制和空间-时间位置编码生成生物合理的脑信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13168 2026-02-16 cs.CV cs.LG 79%

Realistic Face Reconstruction from Facial Embeddings via Diffusion Models

通过扩散模型从面部嵌入中重建逼真人脸

Dong Han, Yong Li, Joachim Denzler

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FEM框架,利用扩散模型和KAN网络,从面部嵌入中重建逼真人脸,以评估FR和PPFR系统的隐私安全性和攻击鲁棒性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01091 2026-02-16 cs.CV 79%

DuoCast: Duo-Probabilistic Diffusion for Precipitation Nowcasting

DuoCast:双概率扩散用于降水现在预测

Penghui Wen, Mengwei He, Patrick Filippi, Na Zhao, Feng Zhang, Thomas Francis Bishop, Zhiyong Wang, Kun Hu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DuoCast通过双扩散框架分解降水预报为低频和高频成分,利用正交潜在子空间提升预测精度,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17298 2026-02-16 cs.CV 79%

ProCache: Constraint-Aware Feature Caching with Selective Computation for Diffusion Transformer Acceleration

ProCache:基于约束的特征缓存与选择性计算用于扩散变换器加速

Fanpu Cao, Yaofo Chen, Zeng You, Wei Luo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProCache通过约束感知的特征缓存和选择性计算,有效缓解了扩散变换器的高计算成本问题,实现了显著的加速效果。

Comments Accepted for poster presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06027 2026-02-16 cs.CV cs.LG 79%

Sample-Specific Noise Injection For Diffusion-Based Adversarial Purification

针对扩散的对抗性净化中的样本特定噪声注入

Yuhao Sun, Jiacheng Zhang, Zesheng Ye, Chaowei Xiao, Feng Liu

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算机与信息系统学院) University of Wisconsin, Madison(威斯康星大学麦迪逊分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出样本特定的分数感知噪声注入方法,通过自适应调整噪声水平提升对抗净化的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11704 2026-02-13 eess.IV cs.CV 79%

U-DAVI: Uncertainty-Aware Diffusion-Prior-Based Amortized Variational Inference for Image Reconstruction

U-DAVI:基于不确定性意识的扩散先验的图像重建近似变分推断

Ayush Varshney, Katherine L. Bouman, Berthy T. Feng

机构 * Computing and Mathematical Sciences, California Institute of Technology(计算与数学科学系,加州理工学院) Mathematical Sciences, California Institute of Technology(数学科学系,加州理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 U-DAVI通过引入空间自适应扰动和不确定性估计,改进了基于扩散的图像重建方法,实现更高质量的重建效果。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11703 2026-02-13 cs.CV cs.AI 79%

Semantically Conditioned Diffusion Models for Cerebral DSA Synthesis

具有语义条件的扩散模型用于脑部DSA合成

Qiwen Xu, David Rügamer, Holger Wenz, Johann Fontana, Nora Meggyeshazi, Andreas Bender, Máté E. Maros

机构 * Department of Statistics, LMU Munich(统计学系) Department of Biomedical Informatics (DBMI), Medical Faculty Mannheim, Heidelberg University(生物医学信息学系) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Clinic for Diagnostic and Interventional Neuroradiology, Medical Faculty Mannheim, Heidelberg University(诊断和介入神经放射科) Department of Anesthesiology and Intensive Care Medicine, BG Trauma Center Tuebingen(麻醉和重症医学科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出一种具有语义条件的扩散模型,用于生成具有真实感的脑部DSA图像,以支持医学研究和算法开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11653 2026-02-13 cs.CV 79%

GR-Diffusion: 3D Gaussian Representation Meets Diffusion in Whole-Body PET Reconstruction

GR-Diffusion:3D高斯表示与扩散在全身体PET重建中的结合

Mengxiao Geng, Zijie Chen, Ran Hong, Bingxuan Li, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GR-Diffusion结合3D高斯表示与扩散模型,提升全身体PET重建的图像质量和细节保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11545 2026-02-13 cs.CV 79%

Supervise-assisted Multi-modality Fusion Diffusion Model for PET Restoration

监督辅助多模态融合扩散模型用于PET修复

Yingkai Zhang, Shuang Chen, Ye Tian, Yunyi Gao, Jianyong Jiang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学) Research and Development Center of Agricultural Bank of China(中国农业银行研发中心) Peking University(北京大学) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出监督辅助多模态融合扩散模型,用于从低剂量PET和MR图像中恢复高质量SPET图像,通过优化特征融合和两阶段监督学习策略提升修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11446 2026-02-13 cs.CV cs.AI 79%

Enhanced Portable Ultra Low-Field Diffusion Tensor Imaging with Bayesian Artifact Correction and Deep Learning-Based Super-Resolution

增强型便携式超低场扩散张量成像与贝叶斯伪影校正及基于深度学习的超分辨率

Mark D. Olchanyi, Annabel Sorby-Adams, John Kirsch, Brian L. Edlow, Ava Farnan, Renfei Liu, Matthew S. Rosen, Emery N. Brown, W. Taylor Kimberly, Juan Eugenio Iglesias

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种便携式超低场扩散张量成像序列及贝叶斯伪影校正算法,结合深度学习超分辨率技术,提升白质成像质量并应用于阿尔茨海默病分类。

Comments 38 pages, 8 figures, 2 supplementary figures, and 3 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏