arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2603.02691 2026-03-04 cs.CV 79%

ReCo-Diff: Residual-Conditioned Deterministic Sampling for Cold Diffusion in Sparse-View CT

ReCo-Diff:基于残差的确定性采样用于稀疏视角CT中的冷扩散

Yong Eun Choi, Hyoung Suk Park, Kiwan Jeon, Hyun-Cheol Park, Sung Ho Kang

机构 * National Institute for Mathematical Sciences, Daejeon, 34047, Republic of Korea(韩国全南数学研究所) Department of Computer Engineering, Korea National University of Transportation, Chungju, 27469, Republic of Korea(韩国交通国立大学计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ReCo-Diff通过残差条件化的确定性采样提升稀疏视角CT重建的精度与稳定性。

Comments 10 pages, 4 figures. Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17561 2026-03-04 cs.CV cs.AI 79%

Model Already Knows the Best Noise: Bayesian Active Noise Selection via Attention in Video Diffusion Model

模型已知最佳噪声:通过注意力的贝叶斯主动噪声选择在视频扩散模型中

Kwanyoung Kim, Sanghyun Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合系,光州科学技术院) Samsung Research(三星研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过注意力机制的贝叶斯主动噪声选择方法,提升视频扩散模型的生成质量与时间一致性。

Comments Cam ready version of ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02035 2026-03-03 cs.RO cs.CV 79%

LAD-Drive: Bridging Language and Trajectory with Action-Aware Diffusion Transformers

LAD-Drive: 通过动作感知扩散变换器弥合语言与轨迹

Fabian Schmidt, Karol Fedurko, Markus Enzweiler, Abhinav Valada

机构 * Institute for Intelligent Systems, Esslingen University of Applied Sciences(智能系统研究所,埃斯林根应用科学大学) Department of Computer Science, University of Freiburg(计算机科学系,弗赖堡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LAD-Drive通过动作感知扩散变换器,将语言模型的意图与连续轨迹生成结合,提升自动驾驶中的多模态规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02012 2026-03-03 cs.CV cs.AI 79%

MAP-Diff: Multi-Anchor Guided Diffusion for Progressive 3D Whole-Body Low-Dose PET Denoising

MAP-Diff: 多锚点引导的扩散模型用于渐进式三维全身低剂量PET去噪

Peiyuan Jing, Chun-Wun Cheng, Liutao Yang, Zhenxuan Zhang, Thiago V. Lima, Klaus Strobel, Antoine Leimgruber, Angelica Aviles-Rivero, Guang Yang, Javier A. Montoya-Zegarra

机构 * School of Engineering, Zurich University of Applied Sciences, CH Bioengineering Department Imperial-X, Imperial College London, UK DAMTP, University of Cambridge, UK Lucerne University Teaching Research Hospital, CH Lung Institute, Imperial College London, UK Cardiovascular Research Centre, Royal Brompton Hospital, UK School of Biomedical Engineering \& Imaging Sciences, King's College London, UK Yau Mathematical Sciences Center, Tsinghua University, CN

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MAP-Diff通过多锚点引导的扩散模型实现低剂量PET图像的渐进式去噪,提升PSNR和SSIM,降低NMAE,优于多种基线方法。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01926 2026-03-03 cs.IR cs.CV 79%

MealRec: Multi-granularity Sequential Modeling via Hierarchical Diffusion Models for Micro-Video Recommendation

MealRec: 基于分层扩散模型的多粒度序列建模用于微视频推荐

Xinxin Dong, Haokai Ma, Yuze Zheng, Yongfu Zha, Yonghui Yang, Xiaodong Wang

机构 * National University of Defense Technology(国防科技大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MealRec通过分层扩散模型实现多粒度序列建模,解决微视频推荐中的偏好无关表示和模态冲突问题,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01913 2026-03-03 cs.CV 79%

Zero-shot Low-Field MRI Enhancement via Diffusion-Based Adaptive Contrast Transport

零场MRI增强通过扩散基于自适应对比传输

Muyu Liu, Chenhe Du, Xuanyu Tian, Qing Wu, Xiao Wang, Haonan Zhang, Hongjiang Wei, Yuyao Zhang

机构 * School of Information Science and Technology, ShanghaiTech University, Shanghai, China(信息科学与技术学院,上海科技大学) School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China(生物医学工程学院,上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DACT框架,通过扩散模型和自适应对比传输技术,在无配对监督的情况下实现低场MRI到高场MRI的高质量图像重建,提升组织对比和结构细节。

Comments 11 pages, 4 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01688 2026-03-03 cs.CV 79%

CoopDiff: A Diffusion-Guided Approach for Cooperation under Corruptions

CoopDiff: 一种基于扩散的协作方法以应对腐蚀

Gong Chen, Chaokun Zhang, Pengcheng Lv

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) School of Cybersecurity, Tianjin University(天津大学网络安全学院) School of Future Technology, Tianjin University(天津大学未来技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CoopDiff是一种基于扩散的协作感知方法,通过教师-学生范式和去噪机制有效应对腐蚀,提升了鲁棒性和泛化能力。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01686 2026-03-03 cs.CV 79%

DiffusionXRay: A Diffusion and GAN-Based Approach for Enhancing Digitally Reconstructed Chest Radiographs

DiffusionXRay: 一种基于扩散和GAN的方法用于增强数字重建的胸部X光影像

Aryan Goyal, Ashish Mittal, Pranav Rao, Manoj Tadepalli, Preetham Putha

机构 * Indian Institute of Technology Bombay, India(印度理工学院班加罗尔学院) Qure.ai, India

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffusionXRay通过结合扩散模型和GAN解决胸部X光影像质量退化问题,提升诊断价值。

Comments Published at MICCAI 2025

Journal ref Data Engineering in Medical Imaging: Third MICCAI Workshop, DEMI 2025, Held in Conjunction with MICCAI 2025, Daejeon, South Korea, September 27, 2025, Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01659 2026-03-03 cs.CV 79%

A Diffusion-Driven Fine-Grained Nodule Synthesis Framework for Enhanced Lung Nodule Detection from Chest Radiographs

一种基于扩散的细粒度结节合成框架,用于增强胸部X光片上结节检测

Aryan Goyal, Shreshtha Singh, Ashish Mittal, Manoj Tadepalli, Piyush Kumar, Preetham Putha

机构 * Indian Institute of Technology, Bombay(印度理工学院,孟买)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散的细粒度结节合成框架,通过低秩适应适配器实现对结节特征的精确控制,提升了胸部X光片上结节检测的性能。

Comments Accepted at MIDL 2026 (Poster). Published on OpenReview on February 14, 2026. Proceedings version pending. OpenReview: https://openreview.net/forum?id=7DL7cu8Ui8

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01253 2026-03-03 cs.CV 79%

Cross-Modal Guidance for Fast Diffusion-Based Computed Tomography

跨模态引导用于快速扩散基于计算机断层扫描

Timofey Efimov, Singanallur Venkatakrishnan, Maliha Hossain, Haley Duba-Sullivan, Amirkoushyar Ziabari

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需重新训练扩散模型的跨模态引导方法,用于提升稀疏视图中子CT的重建质量。

Comments Accepted at the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01103 2026-03-03 cs.CV 79%

Data-Efficient Brushstroke Generation with Diffusion Models for Oil Painting

基于扩散模型的数据高效笔触生成用于油画

Dantong Qin, Alessandro Bozzon, Xian Yang, Xun Zhang, Yike Guo, Pan Wang

机构 * Delft University of Technology(代尔夫特理工大学) The University of Manchester(曼彻斯特大学) The Hong Kong University of Science(香港科学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出StrokeDiff模型,通过平滑正则化技术实现基于扩散模型的数据高效笔触生成,用于油画创作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26818 2026-03-03 cs.SD cs.AI cs.MM eess.AS 79%

GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment

GACA-DiT:基于扩散的舞蹈到音乐生成,具有风格自适应节奏和上下文感知对齐

Jinting Wang, Chenxing Li, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tencent AI Lab(腾讯AI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 GACA-DiT通过风格自适应节奏提取和上下文感知时间对齐模块,实现了舞蹈到音乐生成的节奏一致性和时间对齐,提升了生成音乐与舞蹈动作的同步精度。

Comments 5 pages, 4 figures, submitted to Interspeech2026

Journal ref sumbitted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15301 2026-03-03 cs.CV cs.AI 79%

Latent Diffusion Model without Variational Autoencoder

无变分自编码器的潜在扩散模型

Minglei Shi, Haolin Wang, Wenzhao Zheng, Ziyang Yuan, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SVG提出了一种无需变分自编码器的潜在扩散模型,通过自监督表示提升视觉生成的效率和质量。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06027 2026-03-03 cs.CV eess.IV 79%

OSDM-MReg: Multimodal Image Registration based One Step Diffusion Model

OSDM-MReg: 基于一步扩散模型的多模态图像配准

Xiaochen Wei, Weiwei Guo, Wenxian Yu, Feiming Wei, Dongying Li

机构 * Shanghai Key Laboratory of Intelligent Sensing and Recognition(上海智能感知与识别重点实验室) Shanghai Jiao Tong University(上海交通大学) Center of Digital Innovation(数字创新中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OSDM-MReg通过一步扩散模型和多模态融合策略,实现多模态图像配准的高效准确配准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09935 2026-03-03 cs.CV 79%

Precise Parameter Localization for Textual Generation in Diffusion Models

扩散模型中文本生成的精确参数定位

Łukasz Staniszewski, Bartosz Cywiński, Franziska Boenisch, Kamil Deja, Adam Dziedzic

机构 * Warsaw University of Technology(华沙技术大学) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍茨中心) IDEAS NCBR

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过局部化扩散模型中负责文本生成的注意力层,提升文本生成效率和性能,同时防止生成有毒文本。

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00756 2026-03-03 cs.CV cs.AI 79%

Stroke outcome and evolution prediction from CT brain using a spatiotemporal diffusion autoencoder

基于CT脑部扫描的中风结果与演变预测:时空扩散自编码器

Adam Marcus, Paul Bentley, Daniel Rueckert

机构 * Imperial College London(帝国理工学院伦敦分校) Technische Universität München(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于CT图像的时空扩散自编码器,用于预测中风结果与演变,通过自监督学习生成语义表示并结合纵向数据提升预测性能。

Comments Accepted in The 6th International Workshop on Machine Learning in Clinical Neuroimaging (MLCN 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00519 2026-03-03 cs.CV 79%

Jano: Adaptive Diffusion Generation with Early-stage Convergence Awareness

Jano:具有早期阶段收敛意识的自适应扩散生成

Yuyang Chen, Linqian Zeng, Yijin ZHou, Hengjie Li, Jidong Zhai

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Jano通过自适应区域感知生成方法,提升扩散模型的生成效率,实现2.0至2.4倍的加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00458 2026-03-03 cs.CV 79%

Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution

改进的对抗扩散压缩用于现实世界视频超分辨率

Bin Chen, Weiqi Li, Shijie Zhao, Xuanyu Zhang, Junlin Li, Li Zhang, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) ByteDance Inc(字节跳动公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出改进的对抗扩散压缩方法,通过蒸馏和轻量化设计,实现现实世界视频超分辨率的高效模型压缩,显著提升效率并保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00382 2026-03-03 cs.CV 79%

DiffSOS: Acoustic Conditional Diffusion Model for Speed-of-Sound Reconstruction in Ultrasound Computed Tomography

DiffSOS:用于超声计算断层成像中声速重建的声学条件扩散模型

Yujia Wu, Shuoqi Chen, Shiru Wang, Yucheng Tang, Petr Bruza, Geoffrey P. Luke

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院工程学院) NVIDIA Corp(NVIDIA公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffSOS通过条件扩散模型实现超声计算断层成像中声速的高精度重建,结合物理波测量与混合损失函数,提升重建质量和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00337 2026-03-03 cs.CV 79%

Diffusion-Based Low-Light Image Enhancement with Color and Luminance Priors

基于扩散模型的低光照图像增强与颜色和亮度先验

Xuanshuo Fu, Lei Kang, Javier Vazquez-Corral

机构 * Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的低光照图像增强方法,通过结构化控制嵌入模块结合物理先验,实现高质量的图像增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06871 2026-03-03 cs.CV 79%

RFDM: Residual Flow Diffusion Model for Efficient Causal Video Editing

RFDM: 基于残差流扩散模型的高效因果视频编辑

Mohammadreza Salehi, Mehdi Noroozi, Luca Morreale, Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Ramos, Abhinav Mehrotra

机构 * Samsung AI Center, Cambridge(三星人工智能中心,剑桥)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RFDM通过残差流扩散模型实现高效因果视频编辑,超越I2I方法并竞争于全时空视频生成模型。

Comments Accepted at CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23258 2026-03-03 cs.CV 79%

Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization

通过累积误差最小化实现扩散变换器加速的即插即用保真优化

Tong Shao, Yusen Fu, Guoying Sun, Jingde Kong, Zhuotao Tian, Jingyong Su

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过累积误差最小化实现扩散变换器加速的即插即用保真优化,提升生成保真度并优于现有方法。

Comments 29 pages, ICLR2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20123 2026-03-03 cs.CV 79%

UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers

UltraViCo: 突破视频扩散变换器的 extrapolation 限制

Min Zhao, Hongzhou Zhu, Yingze Wang, Bokai Yan, Jintao Zhang, Guande He, Ling Yang, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, THU-Bosch ML Center, Tsinghua University(清华大学计算机科学与技术系,BNRist中心,THU-Bosch机器学习中心,清华大学) ShengShu(盛书) Gaoling School of Artificial Intelligence, Renmin University of China(北京理工大学人工智能学院,中国人民大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UltraViCo通过抑制超出训练窗口的token注意力,突破视频扩散变换器的extrapolation限制,提升泛化能力和性能。

Comments ICLR2026. Project page: https://thu-ml.github.io/UltraViCo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24711 2026-03-03 cs.CV 79%

Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance

MoE中的路由问题:通过显式路由指导扩展扩散Transformer

Yujie Wei, Shiwei Zhang, Hangjie Yuan, Yujin Han, Zhekai Chen, Jiayu Wang, Difan Zou, Xihui Liu, Yingya Zhang, Yu Liu, Hongming Shan

机构 * Fudan University(复旦大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) MMLab Institute of Science and Technology for Brain-inspired Intelligence, MOE Frontiers Center for Brain Science, Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, and State Key Laboratory of Brain Function and Disorders, Fudan University(脑启发智能科学技术研究院、MOE前沿脑科学中心、计算神经科学与脑启发智能重点实验室、脑功能与疾病国家重点实验室,复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProMoE通过显式路由指导提升视觉MoE性能,结合两步路由策略和原型路由机制,在ImageNet基准上优于现有方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23624 2026-03-03 cs.CV 79%

DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation

DiffInk: 基于字形和风格的潜在扩散变换器用于文本到在线手写生成

Wei Pan, Huiguo He, Hiuyi Cheng, Yilin Shi, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffInk通过结合字形和风格的潜在扩散变换器,实现了高效且准确的完整文本行手写生成。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17050 2026-03-03 cs.CV 79%

Geodesic Prototype Matching via Diffusion Maps for Interpretable Fine-Grained Recognition

通过扩散映射的测地原型匹配用于可解释的细粒度识别

Junhao Jia, Yunyou Liu, Yifei Sun, Huangwei Chen, Feiwei Qin, Changmiao Wang, Yong Peng

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过扩散映射的测地原型匹配方法,用于可解释的细粒度识别,通过内在几何结构提升原型的语义对应性。

Comments The paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13789 2026-03-03 cs.CV cs.AI 79%

BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching

BWCache: 通过块级缓存加速视频扩散变换器

Hanshuai Cui, Zhiqing Tang, Zhifei Xu, Zhi Yao, Wenyi Zeng, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing 100875, China(人工智能学院,北京师范大学,北京) Institute of Artificial Intelligence and Future Networks, Beijing Normal University, Zhuhai 519087, China(人工智能与未来网络研究院,北京师范大学,珠海)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 BWCache通过块级缓存技术加速视频扩散变换器,减少计算冗余,提升生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08628 2026-03-03 cs.CV 79%

LADB: Latent Aligned Diffusion Bridges for Semi-Supervised Domain Translation

LADB: 隐式对齐扩散桥梁用于半监督域翻译

Xuqin Wang, Tao Wu, Yanfeng Zhang, Lu Liu, Dong Wang, Mingwei Sun, Yongliang Wang, Niclas Zeller, Daniel Cremers

机构 * Huawei Technologies(华为技术) Technical University of Munich(慕尼黑技术大学) Karlsruhe University of Applied Sciences(卡尔斯鲁厄应用科学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LADB通过隐式对齐扩散桥梁实现半监督域翻译,有效利用部分配对数据弥合领域差距,平衡保真度与多样性,适用于多源多目标翻译场景。

Journal ref Pattern Recognition. DAGM GCPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16557 2026-03-03 eess.IV cs.AI cs.CV 79%

Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution

面向现实图像超分辨率的时序一步扩散网络

Tianyi Zhang, Zheng-Peng Duan, Peng-Tao Jiang, Bo Li, Ming-Ming Cheng, Chun-Le Guo, Chongyi Li

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) vivo Mobile Communication Co. Ltd(vivo移动通信有限公司) NKIARI, Shenzhen Futian(深圳福田NKIARI)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TADSR通过时间感知的变分自编码器和VSD损失,实现现实图像超分辨率的高效一步式生成,平衡保真度与现实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11484 2026-03-03 cs.CV 79%

CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models

CineTrans: 通过掩码扩散模型学习生成具有电影过渡的视频

Xiaoxue Wu, Bingjie Gao, Yu Qiao, Yaohui Wang, Xinyuan Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CineTrans通过掩码扩散模型生成具有电影风格的多镜头视频,利用镜头边界与注意力图的对应关系,实现稳定且高质量的视频过渡。

Comments ICLR2026 Accept; Project Page:https://uknowsth.github.io/CineTrans/

详情

展开后加载摘要…

URL PDF HTML 收藏