arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-03 至 2026-03-03 共收录 161 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 117 篇

2603.01103 2026-03-03 cs.CV 79%

Data-Efficient Brushstroke Generation with Diffusion Models for Oil Painting

基于扩散模型的数据高效笔触生成用于油画

Dantong Qin, Alessandro Bozzon, Xian Yang, Xun Zhang, Yike Guo, Pan Wang

机构 * Delft University of Technology(代尔夫特理工大学) The University of Manchester(曼彻斯特大学) The Hong Kong University of Science(香港科学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出StrokeDiff模型,通过平滑正则化技术实现基于扩散模型的数据高效笔触生成,用于油画创作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26818 2026-03-03 cs.SD cs.AI cs.MM eess.AS 79%

GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment

GACA-DiT:基于扩散的舞蹈到音乐生成,具有风格自适应节奏和上下文感知对齐

Jinting Wang, Chenxing Li, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tencent AI Lab(腾讯AI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 GACA-DiT通过风格自适应节奏提取和上下文感知时间对齐模块,实现了舞蹈到音乐生成的节奏一致性和时间对齐,提升了生成音乐与舞蹈动作的同步精度。

Comments 5 pages, 4 figures, submitted to Interspeech2026

Journal ref sumbitted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15301 2026-03-03 cs.CV cs.AI 79%

Latent Diffusion Model without Variational Autoencoder

无变分自编码器的潜在扩散模型

Minglei Shi, Haolin Wang, Wenzhao Zheng, Ziyang Yuan, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SVG提出了一种无需变分自编码器的潜在扩散模型,通过自监督表示提升视觉生成的效率和质量。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06027 2026-03-03 cs.CV eess.IV 79%

OSDM-MReg: Multimodal Image Registration based One Step Diffusion Model

OSDM-MReg: 基于一步扩散模型的多模态图像配准

Xiaochen Wei, Weiwei Guo, Wenxian Yu, Feiming Wei, Dongying Li

机构 * Shanghai Key Laboratory of Intelligent Sensing and Recognition(上海智能感知与识别重点实验室) Shanghai Jiao Tong University(上海交通大学) Center of Digital Innovation(数字创新中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OSDM-MReg通过一步扩散模型和多模态融合策略,实现多模态图像配准的高效准确配准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09935 2026-03-03 cs.CV 79%

Precise Parameter Localization for Textual Generation in Diffusion Models

扩散模型中文本生成的精确参数定位

Łukasz Staniszewski, Bartosz Cywiński, Franziska Boenisch, Kamil Deja, Adam Dziedzic

机构 * Warsaw University of Technology(华沙技术大学) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍茨中心) IDEAS NCBR

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过局部化扩散模型中负责文本生成的注意力层,提升文本生成效率和性能,同时防止生成有毒文本。

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00756 2026-03-03 cs.CV cs.AI 79%

Stroke outcome and evolution prediction from CT brain using a spatiotemporal diffusion autoencoder

基于CT脑部扫描的中风结果与演变预测:时空扩散自编码器

Adam Marcus, Paul Bentley, Daniel Rueckert

机构 * Imperial College London(帝国理工学院伦敦分校) Technische Universität München(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于CT图像的时空扩散自编码器,用于预测中风结果与演变,通过自监督学习生成语义表示并结合纵向数据提升预测性能。

Comments Accepted in The 6th International Workshop on Machine Learning in Clinical Neuroimaging (MLCN 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00519 2026-03-03 cs.CV 79%

Jano: Adaptive Diffusion Generation with Early-stage Convergence Awareness

Jano:具有早期阶段收敛意识的自适应扩散生成

Yuyang Chen, Linqian Zeng, Yijin ZHou, Hengjie Li, Jidong Zhai

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Jano通过自适应区域感知生成方法,提升扩散模型的生成效率,实现2.0至2.4倍的加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00458 2026-03-03 cs.CV 79%

Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution

改进的对抗扩散压缩用于现实世界视频超分辨率

Bin Chen, Weiqi Li, Shijie Zhao, Xuanyu Zhang, Junlin Li, Li Zhang, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) ByteDance Inc(字节跳动公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出改进的对抗扩散压缩方法,通过蒸馏和轻量化设计,实现现实世界视频超分辨率的高效模型压缩,显著提升效率并保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00382 2026-03-03 cs.CV 79%

DiffSOS: Acoustic Conditional Diffusion Model for Speed-of-Sound Reconstruction in Ultrasound Computed Tomography

DiffSOS:用于超声计算断层成像中声速重建的声学条件扩散模型

Yujia Wu, Shuoqi Chen, Shiru Wang, Yucheng Tang, Petr Bruza, Geoffrey P. Luke

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院工程学院) NVIDIA Corp(NVIDIA公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffSOS通过条件扩散模型实现超声计算断层成像中声速的高精度重建,结合物理波测量与混合损失函数,提升重建质量和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00337 2026-03-03 cs.CV 79%

Diffusion-Based Low-Light Image Enhancement with Color and Luminance Priors

基于扩散模型的低光照图像增强与颜色和亮度先验

Xuanshuo Fu, Lei Kang, Javier Vazquez-Corral

机构 * Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的低光照图像增强方法,通过结构化控制嵌入模块结合物理先验,实现高质量的图像增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06871 2026-03-03 cs.CV 79%

RFDM: Residual Flow Diffusion Model for Efficient Causal Video Editing

RFDM: 基于残差流扩散模型的高效因果视频编辑

Mohammadreza Salehi, Mehdi Noroozi, Luca Morreale, Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Ramos, Abhinav Mehrotra

机构 * Samsung AI Center, Cambridge(三星人工智能中心,剑桥)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RFDM通过残差流扩散模型实现高效因果视频编辑,超越I2I方法并竞争于全时空视频生成模型。

Comments Accepted at CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23258 2026-03-03 cs.CV 79%

Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization

通过累积误差最小化实现扩散变换器加速的即插即用保真优化

Tong Shao, Yusen Fu, Guoying Sun, Jingde Kong, Zhuotao Tian, Jingyong Su

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过累积误差最小化实现扩散变换器加速的即插即用保真优化,提升生成保真度并优于现有方法。

Comments 29 pages, ICLR2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20123 2026-03-03 cs.CV 79%

UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers

UltraViCo: 突破视频扩散变换器的 extrapolation 限制

Min Zhao, Hongzhou Zhu, Yingze Wang, Bokai Yan, Jintao Zhang, Guande He, Ling Yang, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, THU-Bosch ML Center, Tsinghua University(清华大学计算机科学与技术系,BNRist中心,THU-Bosch机器学习中心,清华大学) ShengShu(盛书) Gaoling School of Artificial Intelligence, Renmin University of China(北京理工大学人工智能学院,中国人民大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UltraViCo通过抑制超出训练窗口的token注意力,突破视频扩散变换器的extrapolation限制,提升泛化能力和性能。

Comments ICLR2026. Project page: https://thu-ml.github.io/UltraViCo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24711 2026-03-03 cs.CV 79%

Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance

MoE中的路由问题:通过显式路由指导扩展扩散Transformer

Yujie Wei, Shiwei Zhang, Hangjie Yuan, Yujin Han, Zhekai Chen, Jiayu Wang, Difan Zou, Xihui Liu, Yingya Zhang, Yu Liu, Hongming Shan

机构 * Fudan University(复旦大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) MMLab Institute of Science and Technology for Brain-inspired Intelligence, MOE Frontiers Center for Brain Science, Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, and State Key Laboratory of Brain Function and Disorders, Fudan University(脑启发智能科学技术研究院、MOE前沿脑科学中心、计算神经科学与脑启发智能重点实验室、脑功能与疾病国家重点实验室,复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProMoE通过显式路由指导提升视觉MoE性能,结合两步路由策略和原型路由机制,在ImageNet基准上优于现有方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23624 2026-03-03 cs.CV 79%

DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation

DiffInk: 基于字形和风格的潜在扩散变换器用于文本到在线手写生成

Wei Pan, Huiguo He, Hiuyi Cheng, Yilin Shi, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffInk通过结合字形和风格的潜在扩散变换器,实现了高效且准确的完整文本行手写生成。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17050 2026-03-03 cs.CV 79%

Geodesic Prototype Matching via Diffusion Maps for Interpretable Fine-Grained Recognition

通过扩散映射的测地原型匹配用于可解释的细粒度识别

Junhao Jia, Yunyou Liu, Yifei Sun, Huangwei Chen, Feiwei Qin, Changmiao Wang, Yong Peng

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过扩散映射的测地原型匹配方法,用于可解释的细粒度识别,通过内在几何结构提升原型的语义对应性。

Comments The paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13789 2026-03-03 cs.CV cs.AI 79%

BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching

BWCache: 通过块级缓存加速视频扩散变换器

Hanshuai Cui, Zhiqing Tang, Zhifei Xu, Zhi Yao, Wenyi Zeng, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing 100875, China(人工智能学院,北京师范大学,北京) Institute of Artificial Intelligence and Future Networks, Beijing Normal University, Zhuhai 519087, China(人工智能与未来网络研究院,北京师范大学,珠海)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 BWCache通过块级缓存技术加速视频扩散变换器,减少计算冗余,提升生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08628 2026-03-03 cs.CV 79%

LADB: Latent Aligned Diffusion Bridges for Semi-Supervised Domain Translation

LADB: 隐式对齐扩散桥梁用于半监督域翻译

Xuqin Wang, Tao Wu, Yanfeng Zhang, Lu Liu, Dong Wang, Mingwei Sun, Yongliang Wang, Niclas Zeller, Daniel Cremers

机构 * Huawei Technologies(华为技术) Technical University of Munich(慕尼黑技术大学) Karlsruhe University of Applied Sciences(卡尔斯鲁厄应用科学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LADB通过隐式对齐扩散桥梁实现半监督域翻译,有效利用部分配对数据弥合领域差距,平衡保真度与多样性,适用于多源多目标翻译场景。

Journal ref Pattern Recognition. DAGM GCPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16557 2026-03-03 eess.IV cs.AI cs.CV 79%

Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution

面向现实图像超分辨率的时序一步扩散网络

Tianyi Zhang, Zheng-Peng Duan, Peng-Tao Jiang, Bo Li, Ming-Ming Cheng, Chun-Le Guo, Chongyi Li

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) vivo Mobile Communication Co. Ltd(vivo移动通信有限公司) NKIARI, Shenzhen Futian(深圳福田NKIARI)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TADSR通过时间感知的变分自编码器和VSD损失,实现现实图像超分辨率的高效一步式生成,平衡保真度与现实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11484 2026-03-03 cs.CV 79%

CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models

CineTrans: 通过掩码扩散模型学习生成具有电影过渡的视频

Xiaoxue Wu, Bingjie Gao, Yu Qiao, Yaohui Wang, Xinyuan Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CineTrans通过掩码扩散模型生成具有电影风格的多镜头视频,利用镜头边界与注意力图的对应关系,实现稳定且高质量的视频过渡。

Comments ICLR2026 Accept; Project Page:https://uknowsth.github.io/CineTrans/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18950 2026-03-03 cs.CV 79%

Target-Aware Video Diffusion Models

面向目标的视频扩散模型

Taeksoo Kim, Hanbyul Joo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种面向目标的视频扩散模型,通过引入目标掩码和特殊标记提升视频生成中演员与目标的互动准确性,并在两个下游任务中验证其有效性。

Comments ICLR 2026. The project page is available at https://taeksuu.github.io/tavid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00194 2026-03-03 cs.CV cs.AI cs.CR 79%

SKeDA: A Generative Watermarking Framework for Text-to-video Diffusion Models

SKeDA:一种面向文本到视频扩散模型的生成水印框架

Yang Yang, Xinze Zou, Zehua Ma, Han Fang, Weiming Zhang

机构 * School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院) Anhui Province Key Laboratory of Digital Security and the CAS Key Laboratory of Electromagnetic Space Information, University of Science and Technology of China(安徽省数字安全重点实验室和中国科学院电磁空间信息重点实验室,中国科学技术大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SKeDA是一种专为文本到视频扩散模型设计的生成水印框架,通过分布保持采样和差分注意机制提升水印的鲁棒性和可靠性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00150 2026-03-03 cs.CV cs.CY 79%

Attention to Neural Plagiarism: Diffusion Models Can Plagiarize Your Copyrighted Images!

对神经剽窃的关注:扩散模型可以剽窃您的受版权保护的图像!

Zihang Zou, Boqing Gong, Liqiang Wang

机构 * University of Central Florida(中央佛罗里达大学) Boston University(波士顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于梯度的神经剽窃方法,通过扰动扩散模型的交叉注意机制,使模型能够绕过版权保护措施,揭示了扩散模型在复制受版权图像方面的潜在风险。

Comments Accepted to ICCV 2025. Code available at: https://github.com/zzzucf/Neural-Plagiarism

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02171 2026-03-03 cond-mat.str-el 78%

Anomalous Diffusion and Superdiffusion in Integrable Spin Chains via a Hard-Rod Gas Mapping

可积自旋链中异常扩散与超扩散的硬杆气体映射

Andrew Urilyon, Romain Vasseur, Sarang Gopalakrishnan, Jacopo De Nardis

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过硬杆气体映射研究可积自旋链中的异常扩散与超扩散,揭示了KPZ波动的微观机制。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02147 2026-03-03 cond-mat.soft 78%

Anisotropic Diffusion in Lyotropic Chromonic Liquid Crystal using Fluorescence Recovery After Photobleaching

利用荧光恢复后光漂白研究向列型液晶中各向异性扩散

Kyu Hwan Choi, Jiyong Cheon, Joonwoo Jeong, Sho C. Takatori

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过FRAP技术揭示了向列型液晶中各向异性扩散的机制,发现分子相互作用与微观结构共同调控扩散行为。

Comments 11 pages, 3 figures, 9 videos, 1 supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02005 2026-03-03 cs.LG cs.AI cs.SI 78%

Mitigating topology biases in Graph Diffusion via Counterfactual Intervention

通过反事实干预缓解图扩散中的拓扑偏见

Wendi Wang, Jiaxi Yang, Yongkang Du, Lu Lin

机构 * Purdue University(帕克大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 FairGDiff通过反事实干预缓解图扩散中的拓扑偏见,平衡公平性与实用性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01984 2026-03-03 cs.SD cs.SC 78%

ViTex: Visual Texture Control for Multi-Track Symbolic Music Generation via Discrete Diffusion Models

ViTex: 通过离散扩散模型实现多轨符号音乐生成的视觉纹理控制

Xiaoyu Yi, Qi He, Gus Xia, Ziyu Wang

机构 * School of EECS, Peking University(电子工程系,北京大学) Music X Lab, MBZUAI(音乐X实验室,MBZUAI) Courant Institute of Mathematical Sciences, New York University(数学科学学院,纽约大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ViTex通过离散扩散模型实现多轨符号音乐生成的视觉纹理控制,结合乐器选择、音高时间及笔触属性,生成高质量音乐并支持纹理级操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22835 2026-03-03 cs.LG stat.CO stat.ML 78%

Clustering by Denoising: Latent plug-and-play diffusion for single-cell data

去噪聚类:单细胞数据的潜在插件扩散

Dominik Meier, Shixing Yu, Sagnik Nandy, Promit Ghosal, Kyra Gan

机构 * Cornell Tech(康奈尔技术学院) Ohio State University(俄亥俄州立大学) University of Chicago(芝加哥大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过去噪的潜在插件扩散方法提升单细胞数据聚类精度和生物相干性

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01837 2026-03-03 cs.LG stat.ML 78%

Constrained Particle Seeking: Solving Diffusion Inverse Problems with Just Forward Passes

受约束的粒子寻找:仅通过正向传递解决扩散逆问题

Hongkun Dou, Zike Chen, Zeyu Li, Hongjue Li, Lijun Yang, Yue Deng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 受约束的粒子寻找方法通过无梯度优化高效解决图像和科学逆问题,性能优于传统方法。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01833 2026-03-03 math.AP 78%

Inverse problem for a multi-term time-fractional diffusion equation with the Caputo derivatives

具有Caputo导数的多项时间分数扩散方程的反问题

Ravshan Ashurov, Damir Shamuratov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对具有Caputo导数的多项时间分数扩散方程的反源问题,通过过定条件重建未知源项,并利用Mittag-Leffler函数的谱表示和渐近展开,推导了经典解的存在性和唯一性条件。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏