arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-15 至 2026-01-15 共收录 33 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 33 篇

2504.06803 2026-01-15 cs.CV 85%

DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation

DyDiT++: 带时间步和空间动态的扩散变换器用于高效的视觉生成

Wangbo Zhao, Yizeng Han, Jiasheng Tang, Kai Wang, Hao Luo, Yibing Song, Gao Huang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 DyDiT++通过动态调整时间步和空间计算,提升视觉生成效率,减少计算成本并拓展应用范围。

Comments This paper was accepted to the IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) on January 9, 2026. arXiv admin note: substantial text overlap with arXiv:2410.03456

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09213 2026-01-15 cs.CV cs.AI 83%

SpikeVAEDiff: Neural Spike-based Natural Visual Scene Reconstruction via VD-VAE and Versatile Diffusion

SpikeVAEDiff: 通过VD-VAE和多功能扩散实现神经尖峰基于的自然视觉场景重建

Jialu Li, Taiyan Zhou

机构 * HKUST Clear Water Bay(香港科技大学清水湾分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 SpikeVAEDiff通过VD-VAE和多功能扩散模型,利用神经尖峰数据实现高分辨率自然视觉场景重建,提升时间与空间分辨率,验证了特定脑区对重建质量的关键作用。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07530 2026-01-15 cs.CV 83%

Universal Few-Shot Spatial Control for Diffusion Models

通用少样本空间控制用于扩散模型

Kiet T. Nguyen, Chanhyuk Lee, Donggyun Kim, Dong Hoon Lee, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 UFC通过通用少样本控制适配器实现对扩散模型的通用空间控制,能够在少量示例下实现与全监督基线相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16233 2026-01-15 astro-ph.GA cs.LG 80%

Can AI Dream of Unseen Galaxies? Conditional Diffusion Model for Galaxy Morphology Augmentation

AI能否梦见未见的星系?面向星系形态增强的条件扩散模型

Chenrui Ma, Zechang Sun, Tao Jing, Zheng Cai, Yuan-Sen Ting, Song Huang, Mingyu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen China(清华大学深圳国际研究生院,清华大学,深圳中国) Department of Strategic and Advanced Interdisciplinary Research, Pengcheng Laboratory, Shenzhen China(战略与先进跨学科研究部,鹏城实验室,深圳中国) Department of Astronomy, Tsinghua University, Beijing China(天文学系,清华大学,北京中国) School of Mathematics and Physics, Qinghai University, Xining China(数学物理学院,青海大学,西宁中国) Department of Astronomy, The Ohio State University, Columbus, OH 43210, USA(天文学系,俄亥俄州立大学,哥伦布,OH 43210,美国) Center for Cosmology and AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH 43210, USA(宇宙学与天体粒子物理中心(CCAPP),俄亥俄州立大学,哥伦布,OH 43210,美国)

专题命中 扩散模型 :diffusion(title,abstract);image generation(comments)

AI总结 本研究提出条件扩散模型GalaxySD,通过合成逼真的星系图像增强ML训练数据,提升标准形态分类性能,并有效提高罕见星系检测的实例数量。

Comments 29 pages, 17 figures, accepted version for ApJS. Comments welcome. See another independent work for further reference, Category-based Galaxy Image Generation via Diffusion Models (Fan, Tang et al.)

Journal ref The Astrophysical Journal Supplement Series, 282, 25 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09697 2026-01-15 cs.CV 79%

Efficient Camera-Controlled Video Generation of Static Scenes via Sparse Diffusion and 3D Rendering

通过稀疏扩散和3D渲染实现静态场景的高效摄像机控制视频生成

Jieying Chen, Jeffrey Hu, Joan Lasenby, Ayush Tewari

机构 * University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SRENDER方法,通过稀疏扩散和3D渲染生成静态场景的高效视频,使视频生成速度提升40倍,保持高质量和稳定性。

Comments Project page: https://ayushtewari.com/projects/srender/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21032 2026-01-15 cs.CV cs.AI cs.LG 79%

FeatInv: Spatially resolved mapping from feature space to input space using conditional diffusion models

FeatInv: 通过条件扩散模型实现从特征空间到输入空间的空间解析映射

Nils Neukirch, Johanna Vielhaben, Nils Strodthoff

机构 * Division AI4Health(AI4Health部门) Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学) Explainable Artificial Intelligence Group(可解释人工智能小组) Fraunhofer Heinrich-Hertz-Institute(弗劳恩霍夫海因里希-赫兹研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FeatInv通过条件扩散模型实现从特征空间到输入空间的空间解析映射,提升深度学习模型的可解释性与理解能力。

Comments Version published by Transactions on Machine Learning Research in 2025 (TMLR ISSN 2835-8856) at https://openreview.net/forum?id=UtE1YnPNgZ. 32 pages, 27 figures. This work builds on an earlier manuscript (arXiv:2505.21032) and crucially extends it. Code is available at https://github.com/AI4HealthUOL/FeatInv

Journal ref Version published by Transactions on Machine Learning Research in 2025 (TMLR ISSN 2835-8856) https://openreview.net/forum?id=UtE1YnPNgZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09333 2026-01-15 cs.SD cs.MM 79%

Research on Piano Timbre Transformation System Based on Diffusion Model

基于扩散模型的钢琴音色转换系统研究

Chun-Chieh Hsu, Tsai-Ling Hsu, Chen-Chen Yeh, Shao-Chien Lu, Cheng-Han Wu, Bing-Ze Liu, Timothy K. Shih, Yu-Cheng Lin

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 本文提出基于扩散模型的钢琴音色转换系统,通过提取音高和响度特征实现高质量音乐转换,适用于多种音乐风格和场景,未来将拓展至更多音色转换任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09044 2026-01-15 eess.IV cs.CV 79%

POWDR: Pathology-preserving Outpainting with Wavelet Diffusion for 3D MRI

POWDR: 基于小波扩散的病理保持3D MRI外推

Fei Tan, Ashok Vardhan Addala, Bruno Astuto Arouche Nunes, Xucheng Zhu, Ravi Soni

机构 * GE HealthCare(GE健康护理)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 POWDR通过小波扩散模型生成病理保持的3D MRI外推数据,解决医学影像数据稀缺和类别不平衡问题,提升肿瘤分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01761 2026-01-15 cs.CV 79%

Adverse Weather Conditions Augmentation of LiDAR Scenes with Latent Diffusion Models

基于潜在扩散模型的激光雷达场景在恶劣天气下的增强

Andrea Matteazzi, Pascal Colling, Michael Arnold, Dietmar Tutsch

机构 * University of Wuppertal(乌珀塔尔大学) Aptiv Services Deutschland GmbH(Aptiv Services德国公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于潜在扩散模型的方法,通过生成模型增强激光雷达场景在恶劣天气下的真实性,提升自动驾驶系统的鲁棒性。

Comments This is an intermediate version of our work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09657 2026-01-15 math.NA cs.NA 78%

Explaining oscillatory behavior in convection-diffusion discretization

解释对流-扩散离散化中的振荡行为

Constantin Bacuta

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了对流-扩散离散化中的振荡现象,提出消除振荡的方法,并介绍了新的误差分析方法,用于构建多维对流占优问题的稳健离散化方案。

Comments 8 figures on 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09676 2026-01-15 cs.LG cs.AI stat.ML 78%

Coupled Data and Measurement Space Dynamics for Enhanced Diffusion Posterior Sampling

耦合数据与测量空间动态用于增强扩散后验采样

Shayan Mohajer Hamidi, En-Hui Yang, Ben Liang

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出C-DPS框架,通过耦合数据与测量空间动态,实现逆问题中更准确的扩散后验采样,提升高噪声条件下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03307 2026-01-15 math.AP 78%

Refining Hölder regularity theory in degenerate drift-diffusion equations

细化退化漂diffusion方程中的Hölder正则性理论

Tobias Black

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了退化漂diffusion方程中弱解的Hölder正则性,通过引入特定的函数条件和积分约束,证明了有界解的Hölder连续性,并扩展至初边界值问题。

Comments 49 pages, v2: added more details for the boundary regularity

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09344 2026-01-15 cond-mat.mtrl-sci 78%

The Diffusion Kinetics of Ba Cations in Perovskite BaTiO$_3$: A Combined Tracer Diffusion and Metadynamics Study

在钙钛矿氧化物BaTiO$_3$立方相中Ba离子的扩散动力学:一种结合示踪扩散和元动力学研究

Sylvia Koerfer, Bianca Dißmann, Norman Schier, Han-Ill Yoo, Manfred Martin, Roger A. De Souza

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过结合示踪扩散和元动力学方法,揭示Ba离子在BaTiO$_3$立方相中的扩散机制,发现缺陷相关物迁移而非孤立空位迁移是主要机制,并指出仅依赖活化焓解释扩散数据的风险。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08963 2026-01-15 cs.LG q-bio.QM 78%

Breaking the Bottlenecks: Scalable Diffusion Models for 3D Molecular Generation

突破瓶颈:用于3D分子生成的可扩展扩散模型

Adrita Das, Peiran Jiang, Dantong Zhu, Barnabas Poczos, Jose Lugo-Martinez

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过反向转移核框架重新解释DDDM,解决分子扩散中的瓶颈问题,提升推理效率和结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21153 2026-01-15 cs.LG cs.AI 78%

Uncertainty-Aware Multi-Objective Reinforcement Learning-Guided Diffusion Models for 3D De Novo Molecular Design

具有不确定性的多目标强化学习引导的扩散模型用于3D从头分子设计

Lianghong Chen, Dongkyu Eugene Kim, Mike Domaratzki, Pingzhao Hu

机构 * Department of Computer Science, Western University(计算机科学系,西部大学) Department of Biochemistry, Western University(生物化学系,西部大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于强化学习的扩散模型,用于多目标优化3D分子设计,提升生成分子的质量和属性优化性能。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18977 2026-01-15 cond-mat.stat-mech 78%

Linear approximations of large deviations: Cubic diffusion test

大偏差的线性近似:三次扩散测试

Pelerine Tsobgni Nyawo, Hugo Touchette

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于线性化方法的大偏差近似技术,并通过三次扩散模型验证了其在大波动区域的准确性。

Comments v1: 8 pages, 3 figures, v2-3: typos corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13087 2026-01-15 cs.RO cs.AI cs.LG 78%

IKDiffuser: a Diffusion-based Generative Inverse Kinematics Solver for Kinematic Trees

IKDiffuser: 一种基于扩散的生成逆运动学求解器用于运动链

Zeyu Zhang, Ziyuan Jiao

机构 * Zeyu Zhang, Ziyuan Jiao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 IKDiffuser是一种基于扩散模型的逆运动学求解器,通过学习配置空间分布,实现高精度、多样化的逆运动学求解,并提升复杂冗余系统求解效率。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14822 2026-01-15 stat.AP cs.AI cs.LG 78%

Controlling Ensemble Variance in Diffusion Models: An Application for Reanalyses Downscaling

在扩散模型中控制集合方差:用于再分析降尺度的应用

Fabio Merizzi, Davide Evangelista, Harilaos Loukos

机构 * The Climate Data Factory (TCDF)(气候数据工厂)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于DDIM的集合扩散模型,通过调整扩散步骤数量来控制集合方差,用于高分辨率的再分析降尺度应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08873 2026-01-15 cs.CV cs.AI cs.LG cs.MM 62%

ForensicFormer: Hierarchical Multi-Scale Reasoning for Cross-Domain Image Forgery Detection

ForensicFormer: 基于层次多尺度推理的跨领域图像伪造检测

Hema Hariharan Samson

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 ForensicFormer通过层次多尺度推理框架,实现跨领域图像伪造检测的高准确率与鲁棒性,显著提升对AI生成图像的检测能力。

Comments 9 pages, 4 figures, 5 tables. Technical report on hierarchical multi-scale image forgery detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09528 2026-01-15 cs.CV 57%

GlovEgo-HOI: Bridging the Synthetic-to-Real Gap for Industrial Egocentric Human-Object Interaction Detection

GlovEgo-HOI:弥合合成数据与真实数据之间的差距以实现工业视角的人-物体交互检测

Alfio Spoto, Rosario Leonardi, Francesco Ragusa, Giovanni Maria Farinella

机构 * Department of Mathematics and Computer Science, University of Catania(数学与计算机科学系,卡塔尼亚大学) Next Vision s.r.l.(Next Vision公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GlovEgo-HOI通过合成数据与扩散过程结合,生成真实世界图像中的PPE,提出新基准数据集和模型,提升工业视角的人-物体交互检测效果。

Comments 8 pages, accepted as a Short Paper at VISAPP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09518 2026-01-15 cs.RO cs.AI cs.CV 57%

Learning Whole-Body Human-Humanoid Interaction from Human-Human Demonstrations

从人与人示范中学习全身体态的人与人机交互

Wei-Jin Huang, Yue-Yi Zhang, Yi-Lin Wei, Zhi-Wei Xia, Juantao Tan, Yuan-Ming Li, Zhilin Zhao, Wei-Shi Zheng

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PAIR和D-STAR方法,从人与人示范中学习高质量的全身体态交互,通过解耦时空推理实现同步协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05966 2026-01-15 cs.CV cs.AI 57%

VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction

VideoAR: 通过下一帧与尺度预测实现自回归视频生成

Longbin Ji, Xiaoxiong Liu, Junyuan Shang, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 VideoAR通过多尺度下一帧预测与自回归建模,实现高效、一致的视频生成,提升性能并减少计算成本。

Comments Project page: https://ernie-research.github.io/VideoAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09591 2026-01-15 cond-mat.supr-con 50%

Submicrometer tunnel ferromagnetic Josephson junctions with transmon energy scale

亚微米级隧道铁磁铝/氧化铝/铝/镍铁/铝约瑟夫森结

R. Satariano, R. Ferraiuolo, F. Calloni, H. G. Ahmad, D. Gatta, F. Tafuri, A. Bruno, D. Massarotti

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究实现了亚微米级隧道铁磁约瑟夫森结,其性能接近transmon的能级范围,为实现铁磁transmon提供了重要基础。

Comments 7 pages, 5 figures

Journal ref Appl. Phys. Lett. 127, 252601 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09420 2026-01-15 cond-mat.str-el 50%

Quasiparticle to local moment crossover in bad metals

非常规金属中准粒子到局域时刻的交叉

A. Chen, F. B. Kugler, P. Doležal, Y. Saito, A. Kawamoto, A. Georges, A. Pustogow

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究非常规金属中准粒子到局域时刻的交叉,通过实验和理论分析揭示温度依赖性输运行为的驱动机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08006 2026-01-15 math.NA cs.NA math-ph math.MP 50%

A Structure-Preserving Penalization Method for the Single-species Rosenbluth-Fokker-Planck Equation

一种保持结构的惩罚方法用于单物种罗森布卢特-福克-普朗克方程

Hamad El Kahza, Luis Chacón, William Taitano, Jingmei Qiu, Jingwei Hu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种结构保持的惩罚方法,用于解决单物种罗森布卢特-福克-普朗克方程的刚性问题,通过三种新方法保证了守恒性和正性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21289 2026-01-15 math.NA cs.NA 50%

Multiscale Spectral Generalized Finite Element Methods for Discontinuous Galerkin Schemes

多尺度谱广义有限元方法用于不连续伽辽金方案

Christian Alber, Lukas Holbach

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种多尺度谱广义有限元方法,用于改进不连续伽辽金方案在高异性扩散问题中的求解精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12079 2026-01-15 cs.LG 50%

Content Accuracy and Quality Aware Resource Allocation Based on LP-Guided DRL for ISAC-Driven AIGC Networks

基于LP引导DRL的ISAC驱动AIGC网络内容准确性与质量感知资源分配

Ningzhe Shi, Yiqing Zhou, Ling Liu, Jinglin Shi, Yihao Wu, Haiwei Shi, Hanxiao Yu

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所过程实验室) Beijing Key Laboratory of Mobile Computing and Pervasive Device(北京移动计算与普适设备关键实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出LP引导DRL算法,用于优化ISAC驱动AIGC网络中的资源分配,提升内容准确性和质量。

Comments Accepted by IEEE TMC

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16649 2026-01-15 math.AP math.DS 50%

Attractors for Singular-Degenerate Porous Medium Type Equations Arising in Models for Biofilm Growth

生物膜生长模型中出现的奇异退化孔隙介质类型方程的吸引子

Zehra Şen, Stefanie Sonner

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了生物膜生长模型中出现的奇异退化孔隙介质类型方程的吸引子存在性及性质。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12234 2026-01-15 math.PR math.AP 50%

Quantitative homogenization and hydrodynamic limit of non-gradient exclusion process

非梯度排斥过程的定量均质化与流体动力学极限

Tadahisa Funaki, Chenlin Gu, Han Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过粗粒化方法和梯度耦合,解决了非梯度排斥过程中粒子数约束问题,实现了扩散矩阵和电导率的定量均质化,并推导了流体动力学极限。

Comments 109 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08934 2026-01-15 physics.ins-det hep-ex nucl-ex 50%

Hybrid-Contact Planar HPGe Process Vehicle Toward Ring-Contact Designs

混合接触平面高纯锗过程车向环形接触设计

Kunming Dong, Dongming Mei, Shasika Panamaldeniya, Anupama Karki, Patrick Burns, Sanjay Bhataarai

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种混合接触平面HPGe工艺,用于制造高纯锗探测器,验证了锂悬浮涂料与薄膜a-Ge/Al接触的兼容性,实现了低噪声和高能量分辨率的探测性能。

Comments 25 pages and 13 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏