arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70196 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70196 篇

2511.18786 2025-11-25 cs.CV 79%

STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution

STCDiT:一种时空一致的扩散变换器用于高质量视频超分辨率

Junyang Chen, Jiangxin Dong, Long Sun, Yixin Yang, Jinshan Pan

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 STCDiT通过结合运动感知的VAE重建和锚帧指导方法,实现了高质量视频超分辨率,提升了结构保真度和时间一致性。

Comments Project page: https://jychen9811.github.io/STCDiT_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18516 2025-11-25 cs.CV 79%

Breaking Forgetting: Training-Free Few-Shot Class-Incremental Learning via Conditional Diffusion

打破遗忘:通过条件扩散实现无训练的少样本类增量学习

Haidong Kang, Ketong Qian, Yi Lu

机构 * Northeastern University(东北大学) School of Information and Intelligent Science(信息与智能科学学院) Whiting School of Engineering(工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出无训练的少样本类增量学习方法,通过条件扩散过程替代梯度优化,缓解灾难性遗忘并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01047 2025-11-25 cs.CV cs.AI cs.CL cs.LG 79%

In-Situ Tweedie Discrete Diffusion Models

原位 Tweedie 离散扩散模型

Xiao Li, Jiaqi Zhang, Shuxiang Zhang, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出原位 Tweedie 离散扩散模型,通过在离散一热空间中直接执行扩散过程,实现对离散任务的有效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00062 2025-11-25 cs.CV cs.AI cs.LG 79%

Scaffold Diffusion: Sparse Multi-Category Voxel Structure Generation with Discrete Diffusion

Scaffold Diffusion: 通过离散扩散模型生成稀疏多类体素结构

Justin Jung

机构 * Biohub Redwood City, USA(Biohub 红木城,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Scaffold Diffusion通过离散扩散模型生成稀疏多类3D体素结构,克服稀疏性带来的挑战,生成逼真且连贯的结构。

Comments Accepted at NeurIPS 2025 Structured Probabilistic Inference & Generative Modeling Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03177 2025-11-25 cs.CV 79%

PanoDiffusion: 360-degree Panorama Outpainting via Diffusion

PanoDiffusion:通过扩散模型实现360度全景补全

Tianhao Wu, Chuanxia Zheng, Tat-Jen Cham

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PanoDiffusion通过双模潜在扩散模型实现360度全景补全,提升全景环绕一致性并生成高质量深度全景图。

Comments Project Page: https://sm0kywu.github.io/panodiffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18473 2025-11-25 cs.CV 79%

Uncertainty Quantification in HSI Reconstruction using Physics-Aware Diffusion Priors and Optics-Encoded Measurements

利用物理感知扩散先验和光学编码测量的超光谱图像重建不确定性量化

Juan Romero, Qiang Fu, Matteo Ravasi, Wolfgang Heidrich

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) Shearwater Geoservices(Shearwater地服务公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HSDiff框架,利用物理感知扩散先验和光学编码测量,提升超光谱图像重建的不确定性校准能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18104 2025-11-25 cs.CV 79%

Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning

通过统一多模态伪造学习巩固扩散生成视频检测

Xiaohong Liu, Xiufeng Song, Huayu Zheng, Lei Bai, Xiaoming Liu, Guangtao Zhai

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MM-Det++算法,通过统一多模态学习检测扩散生成视频,结合时空分支和多模态分支,提升视频伪造检测的准确性和泛化能力。

Comments Code and dataset are available at https://github.com/SparkleXFantasy/MM-Det-Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17839 2025-11-25 cs.CV 79%

Show Me: Unifying Instructional Image and Video Generation with Diffusion Models

Show Me: 用扩散模型统一指令图像和视频生成

Yujiang Pu, Zhanbo Huang, Vishnu Boddeti, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ShowMe通过统一视频扩散模型的空间和时间组件,提升指令图像和视频生成的性能与一致性。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13848 2025-11-25 cs.CV cs.LG 79%

SpecDiff: Accelerating Diffusion Model Inference with Self-Speculation

SpecDiff: 通过自推测加速扩散模型推理

Jiayi Pan, Jiaming Xu, Yongkang Zhou, Guohao Dai

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SpecDiff通过自推测引入未来信息,提出无需训练的多级特征缓存策略,实现扩散模型推理的高效加速。

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12953 2025-11-25 cs.CV 79%

Frame-wise Conditioning Adaptation for Fine-Tuning Diffusion Models in Text-to-Video Prediction

基于帧级条件的微调扩散模型用于文本到视频预测

Zheyuan Liu, Junyan Wang, Zicheng Duan, Cristian Rodriguez-Opazo, Anton van den Hengel

专题命中 扩散模型 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出帧级条件适应方法,通过引入帧级文本嵌入提升文本到视频预测的连续性与生成质量。

Comments Accepted by TMLR, 11/2025. 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03931 2025-11-25 cs.CV 79%

MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers

MagicMirror: 视频扩散变换器中的身份保留视频生成

Yuechen Zhang, Yaoyang Liu, Bin Xia, Bohao Peng, Zexin Yan, Eric Lo, Jiaya Jia

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MagicMirror通过双分支特征提取器和两阶段训练策略,在视频扩散变换器中实现高质量身份保留视频生成,优于现有方法。

Comments ICCV 2025, It is best viewed in Acrobat. Project Page: https://julianjuaner.github.io/projects/MagicMirror/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13930 2025-11-25 eess.IV cs.CV 79%

RN-SDEs: Limited-Angle CT Reconstruction with Residual Null-Space Diffusion Stochastic Differential Equations

RN-SDEs: 有限角度CT重建与残差零空间扩散随机微分方程

Jiaqi Guo, Santiago Lopez-Tapia, Wing Shun Li, Yunan Wu, Marcelo Carignano, Martin Kröger, Vinayak P. Dravid, Igal Szleifer, Vadim Backman, Aggelos K. Katsaggelos

机构 * Department of Electrical and Computer Engineering, Northwestern University(电气与计算机工程系,西北大学) Department of Materials Science and Engineering, Northwestern University(材料科学与工程系,西北大学) Applied Physics Program, Northwestern University(应用物理项目,西北大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出RN-SDEs方法,通过均值回复随机微分方程和范围-零空间分解技术,实现有限角度CT重建中的高质量图像恢复和优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17481 2025-11-24 cs.CV 79%

Counterfactual World Models via Digital Twin-conditioned Video Diffusion

通过数字孪生条件的视频扩散实现反事实世界模型

Yiqing Shen, Aiza Maksutova, Chenjia Li, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CWMDT通过构建数字孪生和应用大语言模型,实现反事实世界模型,提升对视频正向模拟的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17150 2025-11-24 cs.CV 79%

DiffRefiner: Coarse to Fine Trajectory Planning via Diffusion Refinement with Semantic Interaction for End to End Autonomous Driving

DiffRefiner: 通过扩散细化与语义交互实现从粗到细的轨迹规划用于端到端自动驾驶

Liuhan Yin, Runkun Ju, Guodong Guo, Erkang Cheng

机构 * Nullmax

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffRefiner通过两阶段框架结合扩散细化与语义交互,实现更精确的端到端自动驾驶轨迹规划,取得新纪录。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16662 2025-11-21 cs.CV 79%

TriDiff-4D: Fast 4D Generation through Diffusion-based Triplane Re-posing

TriDiff-4D:通过基于扩散的三平面重定位实现快速4D生成

Eddie Pokming Sheung, Qihao Liu, Wufei Ma, Prakhar Kaushik, Jianwen Xie, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Lambda Inc(Lambda公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TriDiff-4D通过基于扩散的三平面重定位技术,实现高效可控的4D虚拟人物生成,显著提升生成质量和效率。

Comments 8 pages, 10 figures, Under review at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16642 2025-11-21 cs.CV 79%

TRIM: Scalable 3D Gaussian Diffusion Inference with Temporal and Spatial Trimming

TRIM:基于时间和空间剪裁的可扩展3D高斯扩散推断

Zeyuan Yin, Xiaoming Liu

机构 * Department of Computer Science and Engineering, Michigan State University(计算机科学与工程系,密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TRIM通过引入时间和空间剪裁策略,提升3D高斯扩散模型的推断效率与生成质量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04470 2025-11-21 cs.CV cs.AI 79%

DiffuSyn Bench: Evaluating Vision-Language Models on Real-World Complexities with Diffusion-Generated Synthetic Benchmarks

DiffuSyn Bench: 评估视觉-语言模型在现实世界复杂性中的能力,通过扩散生成的合成基准

Haokun Zhou, Yipeng Hong

机构 * Imperial College London(伦敦帝国理工学院) Shanghai University(上海大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 DiffuSyn Bench通过扩散生成的合成基准评估视觉-语言模型在现实世界复杂性中的能力,揭示其区分AI与人类图像的性能及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16161 2025-11-21 cs.CV 79%

Simba: Towards High-Fidelity and Geometrically-Consistent Point Cloud Completion via Transformation Diffusion

Simba: 通过变换扩散实现高保真的几何一致点云补全

Lirui Zhang, Zhengkai Zhao, Zhi Zuo, Pan Gao, Jie Qin

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Simba通过变换扩散方法,结合对称先验和扩散模型,实现高保真的点云补全,解决传统方法的过拟合和噪声敏感问题,取得最先进性能。

Comments Accepted for publication at the 40th AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16117 2025-11-21 cs.CV 79%

Decoupling Complexity from Scale in Latent Diffusion Model

在潜在扩散模型中解耦复杂度与尺度

Tianxiong Zhong, Xingye Tian, Xuebo Wang, Boyuan Jiang, Xin Tao, Pengfei Wan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DCS-LDM通过解耦信息复杂度与尺度,实现灵活的计算-质量权衡和多尺度视觉生成。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03329 2025-11-21 cs.CV 79%

FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing

FLUX-Text: 一种简单且先进的扩散变换器基线用于场景文本编辑

Rui Lan, Yancheng Bai, Xu Duan, Mingxing Li, Dongyang Jin, Ryan Xu, Dong Nie, Lei Sun, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FLUX-Text通过轻量级模块和两阶段训练策略,实现了高效多语言场景文本编辑,提升视觉质量和文本保真度。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01406 2025-11-21 cs.CV cs.CR cs.LG 79%

VIDSTAMP: A Temporally-Aware Watermark for Ownership and Integrity in Video Diffusion Models

VIDSTAMP:一种时间感知的水印用于视频扩散模型中的所有权和完整性

Mohammadreza Teymoorianfard, Siddarth Sitaraman, Shiqing Ma, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Brown University(布朗大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VidStamp通过帧级信息嵌入和动态控制信号实现高容量、低感知影响的视频水印,提升视频扩散模型的版权和完整性保障能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24006 2025-11-20 cs.LG cs.AI cs.CV 79%

SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention

Jintao Zhang, Haoxu Wang, Kai Jiang, Shuo Yang, Kaiwen Zheng, Haocheng Xi, Ziteng Wang, Hongzhou Zhu, Min Zhao, Ion Stoica, Joseph E. Gonzalez, Jun Zhu, Jianfei Chen

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21117 2025-11-20 cs.CV 79%

ReassembleNet: Learnable Keypoints and Diffusion for 2D Fresco Reconstruction

Adeela Islam, Stefano Fiorini, Stuart James, Pietro Morerio, Alessio Del Bue

机构 * Fondazione Istituto Italiano di Tecnologia(意大利技术研究院) University of Genova(热那亚大学) Durham University(杜伦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10488 2025-11-20 cs.LG cs.CV cs.HC 79%

Streaming Generation of Co-Speech Gestures via Accelerated Rolling Diffusion

Evgeniia Vu, Andrei Boiarov, Dmitry Vetrov

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted at the 40th AAAI Conference on Artificial Intelligence (AAAI-26) Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01767 2025-11-20 cs.CV cs.AI 79%

Wonder3D++: Cross-domain Diffusion for High-fidelity 3D Generation from a Single Image

Yuxiao Yang, Xiao-Xiao Long, Zhiyang Dou, Cheng Lin, Yuan Liu, Qingsong Yan, Yuexin Ma, Haoqian Wang, Zhiqiang Wu, Wei Yin

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Wright State University(威斯汀大学) Horizon Robotics University of Hong Kong(香港大学) Macau University of Science and Technology(澳门科技大学) Hong Kong University of Science and Technology(香港科学大学) Wuhan University(武汉大学) ShanghaiTech University(上海科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments 21 pages, 19 figures, accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01689 2025-11-20 cs.CV 79%

InvFusion: Bridging Supervised and Zero-shot Diffusion for Inverse Problems

Noam Elata, Hyungjin Chung, Jong Chul Ye, Tomer Michaeli, Michael Elad

机构 * Technion(技术学院) EverEx KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14716 2025-11-19 cs.CV 79%

Diffusion As Self-Distillation: End-to-End Latent Diffusion In One Model

Xiyuan Wang, Muhan Zhang

机构 * Institute of Artificial Intelligence(人工智能研究院) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Tech Report. 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14481 2025-11-19 cs.CV 79%

Segmentation-Aware Latent Diffusion for Satellite Image Super-Resolution: Enabling Smallholder Farm Boundary Delineation

Aditi Agarwal, Anjali Jain, Nikita Saxena, Ishan Deshpande, Michal Kazmierski, Abigail Annkah, Nadav Sherman, Karthikeyan Shanmugam, Alok Talekar, Vaibhav Rajan

机构 * Google DeepMind(谷歌DeepMind) Google(谷歌) Google Research(谷歌研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12089 2025-11-19 cs.CV 79%

Playmate2: Training-Free Multi-Character Audio-Driven Animation via Diffusion Transformer with Reward Feedback

Xingpei Ma, Shenneng Huang, Jiaran Cai, Yuansheng Guan, Shen Zheng, Hanfeng Zhao, Qiang Zhang, Shunsi Zhang

机构 * Project lead & Corresponding Author(项目负责人及通讯作者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01196 2025-11-19 cs.RO cs.AI cs.CV 79%

OG-VLA: Orthographic Image Generation for 3D-Aware Vision-Language Action Model

Ishika Singh, Ankit Goyal, Stan Birchfield, Dieter Fox, Animesh Garg, Valts Blukis

机构 * University of Southern California(美国南加州大学) NVIDIA(英伟达)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏