arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2511.20263 2025-11-26 cs.CV 79%

Advancing Image Classification with Discrete Diffusion Classification Modeling

通过离散扩散分类建模推进图像分类

Omer Belhasin, Shelly Golan, Ran El-Yaniv, Michael Elad

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiDiCM框架,利用扩散过程建模类别标签的后验分布,以提升图像分类在高不确定性条件下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13344 2025-11-26 cs.CV cs.AI cs.LG 79%

RoPECraft: Training-Free Motion Transfer with Trajectory-Guided RoPE Optimization on Diffusion Transformers

RoPECraft:基于轨迹引导的RoPE优化实现无需训练的运动迁移

Ahmet Berke Gokmen, Yigit Ekin, Bahri Batuhan Bilecen, Aysegul Dundar

机构 * Bilkent University(比尔肯大学) ETH Zurich(苏黎世联邦理工学院) Max Planck Institute(马克斯·普朗克研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RoPECraft通过轨迹引导的RoPE优化实现无需训练的视频运动迁移,有效编码运动并提升生成质量。

Comments https://berkegokmen1.github.io/RoPECraft/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15631 2025-11-26 eess.IV cs.CV 79%

A Diffusion Model for Simulation Ready Coronary Anatomy with Morpho-skeletal Control

一种具有形态-骨骼控制的可用于模拟的冠状动脉解剖扩散模型

Karim Kadry, Shreya Gupta, Jonas Sogbadji, Michiel Schaap, Kersten Petersen, Takuya Mizukami, Carlos Collet, Farhad R. Nezami, Elazer R. Edelman

机构 * Institute of Medical Engineering, MIT(麻省理工学院医学工程研究所) Brigham and Women's Hospital, Harvard(哈佛大学布莱尔妇女医院) HeartFlow(HeartFlow公司) Showa University(昭和大学) OLV Aalst

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于潜在扩散模型的冠状动脉解剖生成方法,通过形态-骨骼控制实现可控的解剖合成,用于虚拟干预研究。

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19274 2025-11-25 cs.CV 79%

Diffusion Reconstruction-based Data Likelihood Estimation for Core-Set Selection

基于扩散重建的数据似然估计的核心集选择

Mingyang Chen, Jiawei Du, Bo Huang, Yi Wang, Xiaobo Zhang, Wei Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散重建的数据似然估计方法,通过重建偏差作为评分标准,有效提升核心集选择性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19049 2025-11-25 cs.CV 79%

Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation

超越奖励边际:通过视频生成重新思考和解决扩散模型中的似然位移

Ruojun Xu, Yu Kai, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Tianxiang Zheng, Qinhlin Lu

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出PG-DPO方法,通过结合ARS和IPR缓解扩散模型中的似然位移问题,提升视频生成任务的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18991 2025-11-25 cs.CV 79%

View-Consistent Diffusion Representations for 3D-Consistent Video Generation

用于3D一致视频生成的视图一致扩散表示

Duolikun Danier, Ge Gao, Steven McDonagh, Changjian Li, Hakan Bilen, Oisin Mac Aodha

机构 * University of Edinburgh(爱丁堡大学) University of Bristol(布里斯托大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ViCoDR通过学习多视图一致的扩散表示,提升视频生成的3D一致性,适用于图像到视频、文本到视频和多视图生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18786 2025-11-25 cs.CV 79%

STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution

STCDiT:一种时空一致的扩散变换器用于高质量视频超分辨率

Junyang Chen, Jiangxin Dong, Long Sun, Yixin Yang, Jinshan Pan

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 STCDiT通过结合运动感知的VAE重建和锚帧指导方法,实现了高质量视频超分辨率,提升了结构保真度和时间一致性。

Comments Project page: https://jychen9811.github.io/STCDiT_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18516 2025-11-25 cs.CV 79%

Breaking Forgetting: Training-Free Few-Shot Class-Incremental Learning via Conditional Diffusion

打破遗忘:通过条件扩散实现无训练的少样本类增量学习

Haidong Kang, Ketong Qian, Yi Lu

机构 * Northeastern University(东北大学) School of Information and Intelligent Science(信息与智能科学学院) Whiting School of Engineering(工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出无训练的少样本类增量学习方法,通过条件扩散过程替代梯度优化,缓解灾难性遗忘并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01047 2025-11-25 cs.CV cs.AI cs.CL cs.LG 79%

In-Situ Tweedie Discrete Diffusion Models

原位 Tweedie 离散扩散模型

Xiao Li, Jiaqi Zhang, Shuxiang Zhang, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出原位 Tweedie 离散扩散模型,通过在离散一热空间中直接执行扩散过程,实现对离散任务的有效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00062 2025-11-25 cs.CV cs.AI cs.LG 79%

Scaffold Diffusion: Sparse Multi-Category Voxel Structure Generation with Discrete Diffusion

Scaffold Diffusion: 通过离散扩散模型生成稀疏多类体素结构

Justin Jung

机构 * Biohub Redwood City, USA(Biohub 红木城,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Scaffold Diffusion通过离散扩散模型生成稀疏多类3D体素结构,克服稀疏性带来的挑战,生成逼真且连贯的结构。

Comments Accepted at NeurIPS 2025 Structured Probabilistic Inference & Generative Modeling Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03177 2025-11-25 cs.CV 79%

PanoDiffusion: 360-degree Panorama Outpainting via Diffusion

PanoDiffusion:通过扩散模型实现360度全景补全

Tianhao Wu, Chuanxia Zheng, Tat-Jen Cham

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PanoDiffusion通过双模潜在扩散模型实现360度全景补全,提升全景环绕一致性并生成高质量深度全景图。

Comments Project Page: https://sm0kywu.github.io/panodiffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18473 2025-11-25 cs.CV 79%

Uncertainty Quantification in HSI Reconstruction using Physics-Aware Diffusion Priors and Optics-Encoded Measurements

利用物理感知扩散先验和光学编码测量的超光谱图像重建不确定性量化

Juan Romero, Qiang Fu, Matteo Ravasi, Wolfgang Heidrich

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) Shearwater Geoservices(Shearwater地服务公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HSDiff框架,利用物理感知扩散先验和光学编码测量,提升超光谱图像重建的不确定性校准能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18104 2025-11-25 cs.CV 79%

Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning

通过统一多模态伪造学习巩固扩散生成视频检测

Xiaohong Liu, Xiufeng Song, Huayu Zheng, Lei Bai, Xiaoming Liu, Guangtao Zhai

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MM-Det++算法,通过统一多模态学习检测扩散生成视频,结合时空分支和多模态分支,提升视频伪造检测的准确性和泛化能力。

Comments Code and dataset are available at https://github.com/SparkleXFantasy/MM-Det-Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17839 2025-11-25 cs.CV 79%

Show Me: Unifying Instructional Image and Video Generation with Diffusion Models

Show Me: 用扩散模型统一指令图像和视频生成

Yujiang Pu, Zhanbo Huang, Vishnu Boddeti, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ShowMe通过统一视频扩散模型的空间和时间组件,提升指令图像和视频生成的性能与一致性。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13848 2025-11-25 cs.CV cs.LG 79%

SpecDiff: Accelerating Diffusion Model Inference with Self-Speculation

SpecDiff: 通过自推测加速扩散模型推理

Jiayi Pan, Jiaming Xu, Yongkang Zhou, Guohao Dai

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SpecDiff通过自推测引入未来信息,提出无需训练的多级特征缓存策略,实现扩散模型推理的高效加速。

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12953 2025-11-25 cs.CV 79%

Frame-wise Conditioning Adaptation for Fine-Tuning Diffusion Models in Text-to-Video Prediction

基于帧级条件的微调扩散模型用于文本到视频预测

Zheyuan Liu, Junyan Wang, Zicheng Duan, Cristian Rodriguez-Opazo, Anton van den Hengel

专题命中 扩散模型 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出帧级条件适应方法,通过引入帧级文本嵌入提升文本到视频预测的连续性与生成质量。

Comments Accepted by TMLR, 11/2025. 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03931 2025-11-25 cs.CV 79%

MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers

MagicMirror: 视频扩散变换器中的身份保留视频生成

Yuechen Zhang, Yaoyang Liu, Bin Xia, Bohao Peng, Zexin Yan, Eric Lo, Jiaya Jia

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MagicMirror通过双分支特征提取器和两阶段训练策略,在视频扩散变换器中实现高质量身份保留视频生成,优于现有方法。

Comments ICCV 2025, It is best viewed in Acrobat. Project Page: https://julianjuaner.github.io/projects/MagicMirror/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13930 2025-11-25 eess.IV cs.CV 79%

RN-SDEs: Limited-Angle CT Reconstruction with Residual Null-Space Diffusion Stochastic Differential Equations

RN-SDEs: 有限角度CT重建与残差零空间扩散随机微分方程

Jiaqi Guo, Santiago Lopez-Tapia, Wing Shun Li, Yunan Wu, Marcelo Carignano, Martin Kröger, Vinayak P. Dravid, Igal Szleifer, Vadim Backman, Aggelos K. Katsaggelos

机构 * Department of Electrical and Computer Engineering, Northwestern University(电气与计算机工程系,西北大学) Department of Materials Science and Engineering, Northwestern University(材料科学与工程系,西北大学) Applied Physics Program, Northwestern University(应用物理项目,西北大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出RN-SDEs方法,通过均值回复随机微分方程和范围-零空间分解技术,实现有限角度CT重建中的高质量图像恢复和优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17481 2025-11-24 cs.CV 79%

Counterfactual World Models via Digital Twin-conditioned Video Diffusion

通过数字孪生条件的视频扩散实现反事实世界模型

Yiqing Shen, Aiza Maksutova, Chenjia Li, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CWMDT通过构建数字孪生和应用大语言模型,实现反事实世界模型,提升对视频正向模拟的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17150 2025-11-24 cs.CV 79%

DiffRefiner: Coarse to Fine Trajectory Planning via Diffusion Refinement with Semantic Interaction for End to End Autonomous Driving

DiffRefiner: 通过扩散细化与语义交互实现从粗到细的轨迹规划用于端到端自动驾驶

Liuhan Yin, Runkun Ju, Guodong Guo, Erkang Cheng

机构 * Nullmax

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffRefiner通过两阶段框架结合扩散细化与语义交互,实现更精确的端到端自动驾驶轨迹规划,取得新纪录。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16662 2025-11-21 cs.CV 79%

TriDiff-4D: Fast 4D Generation through Diffusion-based Triplane Re-posing

TriDiff-4D:通过基于扩散的三平面重定位实现快速4D生成

Eddie Pokming Sheung, Qihao Liu, Wufei Ma, Prakhar Kaushik, Jianwen Xie, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Lambda Inc(Lambda公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TriDiff-4D通过基于扩散的三平面重定位技术,实现高效可控的4D虚拟人物生成,显著提升生成质量和效率。

Comments 8 pages, 10 figures, Under review at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16642 2025-11-21 cs.CV 79%

TRIM: Scalable 3D Gaussian Diffusion Inference with Temporal and Spatial Trimming

TRIM:基于时间和空间剪裁的可扩展3D高斯扩散推断

Zeyuan Yin, Xiaoming Liu

机构 * Department of Computer Science and Engineering, Michigan State University(计算机科学与工程系,密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TRIM通过引入时间和空间剪裁策略,提升3D高斯扩散模型的推断效率与生成质量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04470 2025-11-21 cs.CV cs.AI 79%

DiffuSyn Bench: Evaluating Vision-Language Models on Real-World Complexities with Diffusion-Generated Synthetic Benchmarks

DiffuSyn Bench: 评估视觉-语言模型在现实世界复杂性中的能力,通过扩散生成的合成基准

Haokun Zhou, Yipeng Hong

机构 * Imperial College London(伦敦帝国理工学院) Shanghai University(上海大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 DiffuSyn Bench通过扩散生成的合成基准评估视觉-语言模型在现实世界复杂性中的能力,揭示其区分AI与人类图像的性能及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16161 2025-11-21 cs.CV 79%

Simba: Towards High-Fidelity and Geometrically-Consistent Point Cloud Completion via Transformation Diffusion

Simba: 通过变换扩散实现高保真的几何一致点云补全

Lirui Zhang, Zhengkai Zhao, Zhi Zuo, Pan Gao, Jie Qin

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Simba通过变换扩散方法,结合对称先验和扩散模型,实现高保真的点云补全,解决传统方法的过拟合和噪声敏感问题,取得最先进性能。

Comments Accepted for publication at the 40th AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16117 2025-11-21 cs.CV 79%

Decoupling Complexity from Scale in Latent Diffusion Model

在潜在扩散模型中解耦复杂度与尺度

Tianxiong Zhong, Xingye Tian, Xuebo Wang, Boyuan Jiang, Xin Tao, Pengfei Wan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DCS-LDM通过解耦信息复杂度与尺度,实现灵活的计算-质量权衡和多尺度视觉生成。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03329 2025-11-21 cs.CV 79%

FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing

FLUX-Text: 一种简单且先进的扩散变换器基线用于场景文本编辑

Rui Lan, Yancheng Bai, Xu Duan, Mingxing Li, Dongyang Jin, Ryan Xu, Dong Nie, Lei Sun, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FLUX-Text通过轻量级模块和两阶段训练策略,实现了高效多语言场景文本编辑,提升视觉质量和文本保真度。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01406 2025-11-21 cs.CV cs.CR cs.LG 79%

VIDSTAMP: A Temporally-Aware Watermark for Ownership and Integrity in Video Diffusion Models

VIDSTAMP:一种时间感知的水印用于视频扩散模型中的所有权和完整性

Mohammadreza Teymoorianfard, Siddarth Sitaraman, Shiqing Ma, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Brown University(布朗大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VidStamp通过帧级信息嵌入和动态控制信号实现高容量、低感知影响的视频水印,提升视频扩散模型的版权和完整性保障能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24006 2025-11-20 cs.LG cs.AI cs.CV 79%

SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention

Jintao Zhang, Haoxu Wang, Kai Jiang, Shuo Yang, Kaiwen Zheng, Haocheng Xi, Ziteng Wang, Hongzhou Zhu, Min Zhao, Ion Stoica, Joseph E. Gonzalez, Jun Zhu, Jianfei Chen

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21117 2025-11-20 cs.CV 79%

ReassembleNet: Learnable Keypoints and Diffusion for 2D Fresco Reconstruction

Adeela Islam, Stefano Fiorini, Stuart James, Pietro Morerio, Alessio Del Bue

机构 * Fondazione Istituto Italiano di Tecnologia(意大利技术研究院) University of Genova(热那亚大学) Durham University(杜伦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10488 2025-11-20 cs.LG cs.CV cs.HC 79%

Streaming Generation of Co-Speech Gestures via Accelerated Rolling Diffusion

Evgeniia Vu, Andrei Boiarov, Dmitry Vetrov

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted at the 40th AAAI Conference on Artificial Intelligence (AAAI-26) Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏