arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-06 至 2026-01-06 共收录 60 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 60 篇

2601.02098 2026-01-06 cs.CV 88%

InpaintHuman: Reconstructing Occluded Humans with Multi-Scale UV Mapping and Identity-Preserving Diffusion Inpainting

InpaintHuman: 通过多尺度UV映射和身份保持扩散修复重建被遮挡的人类

Jinlong Fan, Shanshan Zhao, Liang Zheng, Jing Zhang, Yuxiang Yang, Mingming Gong

机构 * Hangzhou Dianzi University(杭州电子科技大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Wuhan University(武汉大学) University of Melbourne(墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 InpaintHuman通过多尺度UV映射和身份保持扩散修复技术,从被遮挡的单目视频中生成高保真、完整且可动画的3D人类化身。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02036 2026-01-06 cs.LG cs.CV 83%

GDRO: Group-level Reward Post-training Suitable for Diffusion Models

GDRO:适用于扩散模型的组级奖励后训练

Yiyang Wang, Xi Chen, Xiaogang Xu, Yu Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 GDRO通过组级奖励后训练优化,提升扩散模型奖励分数并增强抗奖励黑客能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23239 2026-01-06 cs.CV 83%

RS-Prune: Training-Free Data Pruning at High Ratios for Efficient Remote Sensing Diffusion Foundation Models

RS-Prune: 无需训练的数据裁剪以高比例提升高效遥感扩散基础模型

Fan Wei, Runmin Dong, Yushan Lai, Yixiang Yang, Zhaoyang Luo, Jinxiao Zhang, Miao Yang, Shuai Yuan, Jiyao Zhao, Bin Luo, Haohuan Fu

机构 * Department of Earth System Science, Tsinghua University(清华大学地球系统科学系) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院) Department of Geography, The University of Hong Kong(香港大学地理系) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 RS-Prune提出一种无需训练的高比例数据裁剪方法,通过局部信息与全局多样性结合,提升遥感扩散模型的收敛性和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01487 2026-01-06 cs.CV cs.AI 83%

DeepInv: A Novel Self-supervised Learning Approach for Fast and Accurate Diffusion Inversion

DeepInv: 一种用于快速准确扩散逆向的新型自监督学习方法

Ziyue Zhang, Luxi Lin, Xiaolin Hu, Chao Chang, HuaiXi Wang, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学) National University of Defense Technology(国防科技大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 DeepInv通过自监督学习和数据增强策略,实现快速准确的扩散逆向,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00546 2026-01-06 cs.CV 83%

Seal2Real: Prompt Prior Learning on Diffusion Model for Unsupervised Document Seal Data Generation and Realisation

Seal2Real: 基于扩散模型的提示先验学习用于无监督文档印章数据生成与实现

Mingfu Yan, Jiancheng Huang, Shifeng Chen

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Shenzhen University of Advanced Technology(深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 Seal2Real通过基于预训练扩散模型的提示先验学习,生成大规模标注的文档印章数据,提升真实数据中印章相关任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01914 2026-01-06 cs.CV 79%

Learning Action Hierarchies via Hybrid Geometric Diffusion

通过混合几何扩散学习动作层次结构

Arjun Ramesh Kaushik, Nalini K. Ratha, Venu Govindaraju

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HybridTAS框架,通过混合欧几里得和双曲几何提升时间动作分割的层次结构建模能力,实验表明其在多个数据集上达到最优性能。

Comments Accepted at WACV-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24015 2026-01-06 cs.CV 79%

On Exact Editing of Flow-Based Diffusion Models

关于基于流的扩散模型的精确编辑

Zixiang Li, Yue Song, Jianing Peng, Ting Liu, Jun Huang, Xiaochao Qu, Luoqi Liu, Wei Wang, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学) Visual Intelligence +X International Cooperation Joint Laboratory of MOE(视觉智能+X国际合作联合实验室) MT Lab, Meitu Inc(美图实验室,美图公司) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CVC通过双视角速度转换机制改进基于流的扩散编辑,实现更稳定的潜在动态和更准确的图像转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01507 2026-01-06 cs.CV 79%

DiffKD-DCIS: Predicting Upgrade of Ductal Carcinoma In Situ with Diffusion Augmentation and Knowledge Distillation

DiffKD-DCIS:基于扩散增强与知识蒸馏的导管癌原位癌升级预测

Tao Li, Qing Li, Na Li, Hui Xie

机构 * School of Medical Imaging, Laboratory Medicine and Rehabilitation, Xiangnan University(医学影像学院、实验室医学与康复学院,湘南大学) Department of Radiotherapy, Affiliated Hospital (Clinical College) of Xiangnan University(放疗科,湘南大学附属医院(临床学院)) Faculty of Applied Sciences, Macao Polytechnic University(应用科学学院,澳门 polytechnic 大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffKD-DCIS通过扩散增强与知识蒸馏方法,实现对导管癌原位癌升级的准确预测,提升诊断效率与临床价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01425 2026-01-06 cs.CV 79%

DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer

DreamID-V:弥合图像到视频的差距,通过扩散变换器实现高保真的面部交换

Xu Guo, Fulong Ye, Xinghui Li, Pengqi Tu, Pengze Zhang, Qichao Sun, Songtao Zhao, Xiangwang Hou, Qian He

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamID-V通过扩散变换器框架实现高保真视频面部交换,结合新型数据管道和强化学习策略,提升身份一致性和视觉真实性。

Comments Project: https://guoxu1233.github.io/DreamID-V/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01141 2026-01-06 eess.IV cs.CV 79%

YODA: Yet Another One-step Diffusion-based Video Compressor

YODA: 另一种一步扩散视频压缩器

Xingchen Li, Junzhe Zhang, Junqi Shi, Ming Lu, Zhan Ma

机构 * School of Electronic Science and Engineering, Nanjing University(电子科学与工程学院,南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 YODA通过嵌入时间参考的多尺度特征,结合线性扩散变换器,实现了更高效的视频压缩,其在多个感知指标上均优于现有方法。

Comments Code will be available at https://github.com/NJUVISION/YODA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22615 2026-01-06 cs.CV cs.CL 79%

Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone

Dream-VL & Dream-VLA: 基于扩散语言模型的开放视觉语言和视觉语言-动作模型

Jiacheng Ye, Shansan Gong, Jiahui Gao, Junming Fan, Shuang Wu, Wei Bi, Haoli Bai, Lifeng Shang, Lingpeng Kong

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 基于扩散语言模型构建的Dream-VL和Dream-VLA在视觉语言和视觉语言-动作任务中表现出色,实现了领先的性能。

Comments Add real-world experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14681 2026-01-06 eess.IV cs.CV 79%

Virtual Multiplex Staining for Histological Images using a Marker-wise Conditioned Diffusion Model

使用标记条件扩散模型进行虚拟多标记染色

Hyun-Jic Oh, Junsik Kim, Zhiyi Shi, Yichen Wu, Yu-An Chen, Peter K Sorger, Hanspeter Pfister, Won-Ki Jeong

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于条件扩散模型的虚拟多标记染色方法,利用预训练模型生成多标记图像,提升了H&E图像的分子层面分析能力。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02043 2026-01-06 cs.CV 79%

Conditional Diffusion Model with Anatomical-Dose Dual Constraints for End-to-End Multi-Tumor Dose Prediction

具有解剖剂量双约束的条件扩散模型用于端到端多肿瘤剂量预测

Hui Xie, Haiqin Hu, Lijuan Ding, Qing Li, Yue Sun, Tao Tan

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工大学应用科学学院) Affiliated Hospital of Xiangnan University(湘南大学附属医院) Jiangxi Cancer Hospital(江西省肿瘤医院) Chenzhou Third People's Hospital(郴州第三人民医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ADDiff-Dose通过条件扩散模型实现多肿瘤剂量预测,结合解剖和剂量约束,提升预测精度与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01799 2026-01-06 math.AP cs.NA math.NA 79%

Self-Similar Solutions and Global Existence for Nonlinear Reaction-Diffusion Systems in Industrial Ammonia Synthesis

自相似解与非线性反应扩散系统在工业氨合成中的全局存在性

Jamshid Khasanov, Sokhibjan Muminov, Sardor Jumaniyozov, Oybek Djabborov, Khudayberganov Shuhrat

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过李群分析和比较原理,研究非线性反应扩散方程组的自相似解及全局解存在性,揭示浓度剖面的幂律行为并验证其在氨合成中的应用。

Comments 15 pages, numerical simulations, Keywords: Nonlinear parabolic systems; Reaction-diffusion; Ammonia production; Self-similar reduction; Global solutions; Asymptotic expansions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01948 2026-01-06 cs.RO 78%

Learning Diffusion Policy from Primitive Skills for Robot Manipulation

从基本技能学习扩散策略用于机器人操作

Zhihao Gu, Ming Yang, Difan Zou, Dong Xu

机构 * Dong Xu(东旭教授)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SDP,一种基于技能的扩散策略,通过整合可解释的技能学习与条件动作规划,提升机器人操作中技能一致性与性能。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21170 2026-01-06 cs.CL 78%

Cosmos: Compressed and Smooth Latent Space for Text Diffusion Modeling

Cosmos: 用于文本扩散建模的压缩和平滑潜在空间

Viacheslav Meshchaninov, Egor Chimbulatov, Alexander Shabalin, Aleksandr Abramov, Dmitry Vetrov

机构 * HSE University(俄罗斯高等经济大学) Constructor University(建设大学) SaluteDevices

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Cosmos通过压缩和平滑的潜在空间提升文本生成效率,实现比传统方法更快的推理速度和相当的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09922 2026-01-06 cs.LG 78%

Improving the Euclidean Diffusion Generation of Manifold Data by Mitigating Score Function Singularity

通过缓解分数函数奇异性和改进欧几里得扩散生成流形数据

Zichen Liu, Wei Zhang, Tiejun Li

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Zuse Institute Berlin(柏林泽尼茨研究所) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) LMAM and School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Niso-DM和Tango-DM方法,通过缓解分数函数的奇异性和改进欧几里得扩散生成流形数据的准确性。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07348 2026-01-06 cond-mat.str-el cond-mat.mtrl-sci 78%

Stability and diffusion of oxygen vacancies in LaNiO$_3$: a DMFT study

LaNiO$_3$中氧空位的稳定性与扩散:一种DMFT研究

Uthpala Herath, Vijay Singh, Soumya S. Bhat, Hyowon Park, Aldo H. Romero

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文利用DMFT研究LaNiO$_3$中氧空位对金属-绝缘体转变的影响,揭示了量子涨落对能垒高度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10970 2026-01-06 math.AP 78%

The combined non-equilibrium diffusion and low Mach number limits of the compressible Navier-Stokes-Fourier-P1 approximation radiation model

可压缩Navier-Stokes-Fourier-P1辐射模型的非平衡扩散与低马赫数极限的结合

Fucai Li, Shuxing Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了NSF-P1模型在非平衡扩散和低马赫数极限下的收敛性,通过引入等效压力和速度平衡奇异性和建立统一估计,证明其收敛到热传导粘性流系统耦合扩散方程。

Comments 30 pages

Journal ref Mathematical Methods in the Applied Sciences, 49(2026), 694--712

详情

展开后加载摘要…

URL PDF HTML 收藏
1109.1935 2026-01-06 math.AP 78%

Local Hadamard well-posedness and blow-up for reaction-diffusion equations with non-linear dynamical boundary conditions

局部Hadamard可解性及反应扩散方程非线性动态边界条件下的爆破研究

Alessio Fiscella, Enzo Vitillaro

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了非线性动态边界条件下反应扩散方程的局部可解性、全局存在性及爆破问题。

Journal ref Discrete Continuous Dynamical Systems 33 5015 - 5047 (2013)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01731 2026-01-06 math.NA cs.NA 78%

A generalized Scharfetter-Gummel scheme for nonlocal cross-diffusion systems

非局部交叉扩散系统的广义Scharfetter-Gummel方案

Ansgar Jüngel, Panchi Li, Zhiwei Sun

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种广义Scharfetter-Gummel方案用于非局部交叉扩散系统,通过统一估计离散Fisher信息克服了退化问题,并验证了方案的收敛性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01475 2026-01-06 cs.LG 78%

Multi-Subspace Multi-Modal Modeling for Diffusion Models: Estimation, Convergence and Mixture of Experts

多子空间多模态建模用于扩散模型:估计、收敛与专家混合

Ruofeng Yang, Yongcan Li, Bo Jiang, Cheng Chen, Shuai Li

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于多子空间多模态建模的扩散模型,通过引入低秩混合高斯混合结构,有效捕捉多模态信息并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01462 2026-01-06 math.NA cs.NA 78%

Convergence Analysis of PINNs for Fractional Diffusion Equations in Bounded Domains

在有限域内分数扩散方程中PINNs的收敛性分析

Elie Abdo, Lihui Chai, Ruimeng Hu, Xu Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种谱定义的平滑策略,用于在有限域内解决分数扩散方程的PINNs收敛性问题,通过严谨的能量估计证明了PINN在非局部方程中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01448 2026-01-06 cs.IR 78%

Adaptive Diffusion-based Augmentation for Recommendation

自适应扩散增强的推荐方法

Na Li, Fanghui Sun, Yan Zou, Yangfu Zhu, Xiatian Zhu, Ying Ma

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ADAR通过生成可控的负样本提升推荐系统性能,无需修改架构,有效优化决策边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01381 2026-01-06 cond-mat.dis-nn physics.ed-ph 78%

Simulating diffusion and disorder-induced localization in random walks and transmission lines

模拟扩散和由无序引起的局域化现象在随机游走和传输线中

Jake S. Bobowski

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过两种模拟研究了随机游走和传输线中扩散与无序诱导局域化现象,揭示了从正常扩散到粒子局域化及波能指数限制的转变过程。

Comments Main text: 11 pages, 6 figures. Supplementary material: 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01194 2026-01-06 cs.IT eess.SP math.IT 78%

On the Structure of the Optimal Detector for Sub-THz Multi-Hop Relays with Unknown Prior: Over-the-Air Diffusion

关于子太赫兹多跳中继最优检测器结构:空中扩散

Ozgur Ercetin, Mohaned Chraiti

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于DDIMs的最优检测器框架,将子太赫兹多跳中继视为方差保持的扩散过程,通过端到端统计量实现近最优解码,无需中间节点CSI。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01109 2026-01-06 cs.CR 78%

NADD: Amplifying Noise for Effective Diffusion-based Adversarial Purification

NADD: 通过放大噪声实现有效的基于扩散的对抗净化

David D. Nguyen, The-Anh Ta, Yansong Gao, Alsharif Abuadbba

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 NADD通过放大噪声提升基于扩散的对抗净化鲁棒性,实现44.23%的准确率并大幅降低推理时间。

Comments 18

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00986 2026-01-06 math.NA cs.NA 78%

A Simple Weak Galerkin Finite Element Method for Convection-Diffusion-Reaction Equations on Nonconvex Polytopal Meshes

一种简单的弱伽辽金有限元方法用于非凸多边形网格上的对流-扩散-反应方程

Chunmei Wang, Shangyou Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种适用于非凸多边形网格的简单弱伽辽金有限元方法,用于高效求解对流-扩散-反应方程,并通过实验验证了其理论收敛性和计算效率。

Comments 24 pages, 16 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19044 2026-01-06 cs.NI 78%

Diffusion Model-Enhanced Environment Reconstruction in ISAC

基于扩散模型的ISAC环境重建

Nguyen Duc Minh Quang, Chang Liu, Shuangyang Li, Hoai-Nam Vu, Derrick Wing Kwan Ng, Wei Xiang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于扩散模型的ISAC环境重建方法,通过增强点云密度和去噪来提升环境感知精度。

Comments 6 pages, 5 figures, submitted to IEEE WCL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19991 2026-01-06 cs.SD cs.LG 78%

SAMUeL: Efficient Vocal-Conditioned Music Generation via Soft Alignment Attention and Latent Diffusion

SAMUeL:通过软对齐注意力和潜在扩散实现高效的语音条件音乐生成

Hei Shing Cheung, Boya Zhang, Jonathan H. Chan

机构 * Division of Engineering Science University of Toronto(工程科学系 马尼托瓦大学) Innovative Cognitive Computing Center King Mongkut's University of Technology Thonburi(创新认知计算中心 王后大学技术吞武里)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 SAMUeL通过软对齐注意力和潜在扩散技术,实现高效的语音条件音乐生成,参数减少220倍,推理速度提升52倍,性能优于OpenAI Jukebox。

Comments 7 pages, 3 figures, accepted to IEEE/WIC WI-IAT

详情

展开后加载摘要…

URL PDF HTML 收藏