arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-03 至 2026-02-03 共收录 167 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 115 篇

2602.02107 2026-02-03 cs.CV 79%

Teacher-Guided Student Self-Knowledge Distillation Using Diffusion Model

教师引导的学生自知识蒸馏使用扩散模型

Yu Wang, Chuanguang Yang, Zhulin An, Weilun Feng, Jiarui Zhao, Chengqing Yu, Libo Huang, Boyu Diao, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 教师引导的学生自知识蒸馏使用扩散模型,通过轻量级扩散模型和局部敏感哈希方法提升学生模型对教师知识的学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02092 2026-02-03 cs.CV 79%

FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space

FSVideo: 一种在高度压缩潜在空间中的快速速度视频扩散模型

FSVideo Team, Qingyu Chen, Zhiyuan Fang, Haibin Huang, Xinwei Huang, Tong Jin, Minxuan Lin, Bo Liu, Celong Liu, Chongyang Ma, Xing Mei, Xiaohui Shen, Yaojie Shen, Fuwen Tan, Angtian Wang, Xiao Yang, Yiding Yang, Jiamin Yuan, Lingxi Zhang, Yuxin Zhang

机构 * FSVideo Team Intelligent Creation(FSVideo团队智能创作)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FSVideo通过高度压缩的潜在空间和改进的扩散Transformer架构,在速度和质量上实现了高效视频生成。

Comments Project Page: https://kingofprank.github.io/fsvideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01949 2026-02-03 cs.LG cs.CV 79%

Boundary-Constrained Diffusion Models for Floorplan Generation: Balancing Realism and Diversity

边界约束扩散模型用于布局生成:在真实感与多样性之间平衡

Leonardo Stoppani, Davide Bacciu, Shahab Mokarizadeh

机构 * University of Pisa(比萨大学) H&M Group(H&M集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出边界约束扩散模型,通过引入BCA模块提升边界一致性,并引入DS指标平衡布局生成中的真实感与多样性。

Comments Accepted at ESANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01570 2026-02-03 cs.CV 79%

One-Step Diffusion for Perceptual Image Compression

单步扩散用于感知图像压缩

Yiwen Jia, Hao Wei, Yanhui Zhou, Chenyang Ge

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) School of Information and telecommunication(信息与电信学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种单步扩散图像压缩方法,通过紧凑特征表示和判别器提升感知质量,实现46倍更快的推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18623 2026-02-03 cs.CV 79%

Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation

扩散模型中自适应域偏移用于跨模态图像翻译

Zihao Wang, Yuzhou Chen, Shaogang Ren

机构 * Laplace Lab at University of Tennessee(田纳西大学Laplace实验室) University of California Riverside(加州大学河滨分校) University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种自适应域偏移方法,通过在扩散模型生成过程中嵌入域偏移动态,提升跨模态图像翻译的结构保真度和语义一致性。

Comments Paper accepted as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04456 2026-02-03 cs.CV cs.AI 79%

GuidNoise: Single-Pair Guided Diffusion for Generalized Noise Synthesis

GuidNoise:单对引导扩散用于通用噪声合成

Changjin Kim, HyeokJun Lee, YoungJoon Yoo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GuidNoise通过单对引导扩散模型实现通用噪声合成,无需额外元数据,提升去噪性能,尤其适用于轻量模型和有限数据场景。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13745 2026-02-03 cs.CV 79%

UniCalli: A Unified Diffusion Framework for Column-Level Generation and Recognition of Chinese Calligraphy

UniCalli: 一种统一的扩散框架,用于中文书法的列级生成与识别

Tianshuo Xu, Kai Wang, Zhifei Chen, Leyi Wu, Tianshui Wen, Fei Chao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) China University of Geoscience Beijing(中国地质大学(北京)) Xiamen University(厦门大学) HKUST(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniCalli提出一种统一的扩散框架,通过联合训练实现中文书法列级生成与识别,提升生成质量和识别性能,同时扩展至其他古代文字。

Comments Page: https://envision-research.github.io/UniCalli/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20295 2026-02-03 cs.CV 79%

FAST: Foreground-aware Diffusion with Accelerated Sampling Trajectory for Segmentation-oriented Anomaly Synthesis

FAST: 前景感知扩散与加速采样轨迹用于面向分割的异常合成

Xichen Xu, Yanshu Wang, Jinbao Wang, Xiaoning Lei, Guoyang Xie, Guannan Jiang, Zhichao Lu

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University, Shanghai, China(上海交通大学未来技术全球研究院) School of Artificial Intelligence, Shenzhen University, Shenzhen, China(深圳大学人工智能学院) Department of Intelligent Manufacturing, CATL, Ningde, China(CATL智能制造部门) Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FAST提出一种前景感知扩散框架,通过AIAS和FARM模块提升工业异常合成效率与质量,实现更可控的结构特定异常生成。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10701 2026-02-03 cs.CV cs.LG eess.IV 79%

Diffusion-based Layer-wise Semantic Reconstruction for Unsupervised Out-of-Distribution Detection

基于扩散的逐层语义重建用于无监督分布外检测

Ying Yang, De Cheng, Chaowei Fang, Yubiao Wang, Changzhe Jiao, Lechao Cheng, Nannan Wang

机构 * Xidian University(西电大学) Hefei University of Technology(合肥工业大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散的逐层语义重建方法,用于无监督分布外检测,通过特征重建误差区分ID和OOD样本,实现高准确性和效率。

Comments 26 pages, 23 figures, published to Neurlps2024

Journal ref Proceedings of the 38th Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01303 2026-02-03 cs.CV 79%

ReDiStory: Region-Disentangled Diffusion for Consistent Visual Story Generation

ReDiStory: 区域解耦扩散用于一致的视觉故事生成

Ayushman Sarkar, Zhenyu Yu, Chu Chen, Wei Tang, Kangning Cui, Mohd Yamani Idna Idris

机构 * Birbhum Institute of Engineering and Technology(比尔布尔工程科技学院) Universiti Malaya(马来亚大学) City University of Hong Kong(香港城市大学) Wake Forest University(威克森林大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ReDiStory通过推理时的提示嵌入重组,提升多帧视觉故事生成中主体身份的一致性,无需修改扩散参数或额外监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00839 2026-02-03 cs.CV 79%

TransNormal: Dense Visual Semantics for Diffusion-based Transparent Object Normal Estimation

TransNormal: 用于扩散基透明物体法线估计的密集视觉语义

Mingwei Li, Hehe Fan, Yi Yang

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TransNormal通过整合密集视觉语义和多任务学习,提升透明物体法线估计的精度与鲁棒性。

Comments Project Page: https://longxiang-ai.github.io/TransNormal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00739 2026-02-03 cs.CV 79%

Diffusion-Driven Inter-Outer Surface Separation for Point Clouds with Open Boundaries

基于扩散的点云双层表面分离:用于开放边界

Zhengyan Qin, Liyuan Qiu

机构 * Hong Kong University of Science and Technology (HKUST)(香港理工大学) Hong Kong Applied Science and Technology Research Institute (ASTRI)(香港应用科技研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散的算法,用于分离双层点云的内层和外层表面,特别针对具有开放边界的点云,通过提取真实内层来解决重叠表面和法线紊乱问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00583 2026-02-03 cs.CV cs.AI 79%

MAUGen: A Unified Diffusion Approach for Multi-Identity Facial Expression and AU Label Generation

MAUGen: 一种用于多身份面部表情和AU标签生成的统一扩散方法

Xiangdong Li, Ye Lou, Ao Gao, Wei Zhang, Siyang Song

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MAUGen通过统一的扩散方法生成多身份面部表情和AU标签,提升面部动作单元识别系统的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00536 2026-02-03 cs.CV 79%

SADER: Structure-Aware Diffusion Framework with DEterministic Resampling for Multi-Temporal Remote Sensing Cloud Removal

SADER:一种结构感知扩散框架,用于多时相遥感云去除

Yifan Zhang, Qian Chen, Yi Liu, Wengen Li, Jihong Guan

机构 * College of Literature, Science, and the Arts, University of Michigan(文学、科学与艺术学院,密歇根大学) School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SADER通过结构感知扩散框架,结合时间融合和混合注意力机制,有效解决多时相遥感云去除问题,提升云去除效果和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18537 2026-02-03 cs.CV 79%

Zero-Shot Video Deraining with Video Diffusion Models

无监督视频去雨与视频扩散模型

Tuomas Varanka, Juan Luis Gonzalez, Hyeongwoo Kim, Pablo Garrido, Xu Yao

机构 * University of Oulu(奥卢大学) Flawless AI Imperial College London(伦敦帝国理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种无需合成数据和模型微调的无监督视频去雨方法,通过预训练文本到视频扩散模型,利用注意力切换机制提升动态场景中的去雨效果。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25178 2026-02-03 cs.CV cs.AI cs.LG 79%

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

GHOST:诱导幻觉的多模态大语言模型图像生成

Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) University of Maryland(马里兰大学)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 GHOST通过优化隐蔽令牌生成诱导幻觉的图像,评估多模态大语言模型的可靠性,并发现高幻觉成功率及可转移漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01330 2026-02-03 cs.CV 79%

Prior-Guided Residual Diffusion: Calibrated and Efficient Medical Image Segmentation

先验引导残差扩散:校准且高效的医学图像分割

Fuyou Mao, Beining Wu, Yanfeng Jiang, Han Xue, Yan Tang, Hao Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PGRD通过先验引导残差扩散方法,在医学图像分割中实现高精度与高效校准。

Comments Withdrawn by the authors to conduct further methodological refinement and address concerns regarding the originality of the current implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15078 2026-02-03 eess.IV cs.CV physics.med-ph 79%

PET Image Reconstruction Using Deep Diffusion Image Prior

基于深度扩散图像先验的PET图像重建

Fumio Hashimoto, Kuang Gong

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(朱·克雷顿·普瑞特家庭生物医学工程系,佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于深度扩散模型的PET图像重建方法,通过解剖先验引导和半二次分裂算法实现高效重建,适用于多种示踪剂和扫描仪类型。

Comments 11 pages, 12 figures

Journal ref IEEE Trans. Med. Imaging (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23993 2026-02-03 cs.CV cs.AI 79%

DenseFormer: Learning Dense Depth Map from Sparse Depth and Image via Conditional Diffusion Model

DenseFormer: 通过条件扩散模型学习稀疏深度和图像的密集深度图

Ming Yuan, Chuang Zhang, Lei He, Qing Xu, Jianqiang Wang

机构 * the School of Vehicle and Mobility(车辆与移动学院) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DenseFormer通过条件扩散模型,结合特征提取和深度细化模块,实现从稀疏深度和图像生成密集深度图,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02238 2026-02-03 cs.LG cs.AI 78%

Geometry- and Relation-Aware Diffusion for EEG Super-Resolution

基于几何和关系的扩散模型用于EEG超分辨率

Laura Yao, Gengwei Zhang, Moajjem Chowdhury, Yunmei Liu, Tianlong Chen

机构 * Electroencephalography (EEG) provides a noninvasive window into distributed cortical dynamics of brain and is widely used across affective computing(脑电图(EEG)为研究大脑分布式皮层动态提供了一种非侵入性窗口,并广泛应用于情感计算)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出TopoDiff模型,通过结合拓扑感知嵌入和动态通道关系图,提升EEG空间超分辨率的生成保真度和下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02159 2026-02-03 cs.CL 78%

Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing

Focus-dLLM: 通过置信度引导的上下文聚焦加速长上下文扩散语言模型推理

Lingkun Long, Yushi Huang, Shihao Bai, Ruihao Gong, Jun Zhang, Ao Zhou, Jianlei Yang

机构 * Beihang University(北航) Hong Kong University of Science and Technology(香港理工大学) SenseTime Research(商汤科技研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Focus-dLLM通过置信度引导的上下文聚焦技术,实现了长上下文扩散语言模型推理的高效加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02113 2026-02-03 stat.ML cs.LG cs.NA math.NA 78%

Training-free score-based diffusion for parameter-dependent stochastic dynamical systems

无训练的基于分数的扩散模型用于参数依赖的随机动力系统

Minglei Yang, Sicheng He

机构 * Fusion Energy Division, Oak Ridge National Laboratory(奥克兰国家实验室融合能源部门) Department of Mechanical and Aerospace Engineering, University of Tennessee(田纳西大学机械与航空航天工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种无训练的条件扩散模型,用于高效学习参数依赖随机微分方程的随机流映射,通过联合核加权蒙特卡洛估计器实现连续参数域的插值,提升参数研究和不确定性量化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01909 2026-02-03 physics.geo-ph cs.LG 78%

Propagating the prior from far to near offset: A self-supervised diffusion framework for progressively recovering near-offsets of towed-streamer data

从远到近传播先验:一种自监督扩散框架用于逐步恢复拖曳线阵数据的近偏移

Shijun Cheng, Tariq Alkhalifah

机构 * Division of Physical Science and Engineering(物理科学与工程系) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种自监督扩散框架,通过递归外推从远到近恢复拖曳线阵数据的近偏移轨迹,无需地面真实数据,提升地震数据处理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01849 2026-02-03 cs.LG 78%

Self-Rewarding Sequential Monte Carlo for Masked Diffusion Language Models

自奖励序列蒙特卡洛方法用于掩码扩散语言模型

Ziwei Luo, Ziqi Jin, Lei Wang, Lidong Bing, Thomas B. Schön

机构 * Uppsala University, Sweden(乌普萨拉大学,瑞典) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出自奖励序列蒙特卡洛方法,用于提升掩码扩散语言模型的采样质量,通过引入轨迹级置信度信号改进生成多样性。

Comments Project page: https://algolzw.github.io/sr-smc

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01765 2026-02-03 cs.CR cs.AI 78%

Backdoor Sentinel: Detecting and Detoxifying Backdoors in Diffusion Models via Temporal Noise Consistency

后门哨兵:通过时间噪声一致性检测和净化扩散模型中的后门

Bingzheng Wang, Xiaoyan Gu, Hongbo Xu, Hongcheng Li, Zimo Yu, Jiang Zhou, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出TNC-Defense框架,通过时间噪声一致性检测和净化扩散模型中的后门,提升检测准确率并降低净化成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01645 2026-02-03 cs.SD 78%

Membership Inference Attack Against Music Diffusion Models via Generative Manifold Perturbation

通过生成流形扰动对音乐扩散模型进行成员推断攻击

Yuxuan Liu, Peihong Zhang, Rui Sang, Zhixin Li, Yizhou Tan, Yiqiang Cai, Shengchen Li

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出LSA-Probe方法,通过生成流形扰动检测音乐扩散模型中成员训练的稳定性差异,以提升成员推断攻击的效能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01643 2026-02-03 cs.LG cs.AI 78%

De Novo Molecular Generation from Mass Spectra via Many-Body Enhanced Diffusion

从质谱数据生成新分子结构的多体增强扩散

Xichen Sun, Wentao Wei, Jiahua Rao, Jiancong Xie, Yuedong Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 MBGen通过多体增强扩散框架,利用质谱数据生成新分子结构,显著提升异构体区分和复杂碎片化机制的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01608 2026-02-03 cs.AI 78%

Reasoning with Autoregressive-Diffusion Collaborative Thoughts

基于自回归扩散协同思想的推理

Mu Yuan, Liekang Zeng, Guoliang Xing, Lan Zhang, Yunhao Liu

机构 * The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出协同思想框架,通过自回归和扩散模型的闭环协作提升空间推理可靠性与生成可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21437 2026-02-03 cs.LG 78%

Accurate Network Traffic Matrix Prediction via LEAD: a Large Language Model-Enhanced Adapter-Based Conditional Diffusion Model

通过LEAD实现网络流量矩阵的准确预测:一种基于大语言模型的适配器条件扩散模型

Yu Sun, Yaqiong Liu, Nan Cheng, Jiayuan Li, Zihan Jia, Xialin Du, Mugen Peng

机构 * School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(信息与通信工程学院,北京邮电大学) China Mobile Group Design Institute(中国移动集团设计院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LEAD通过结合大语言模型与适配器条件扩散模型,有效提升网络流量矩阵预测的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22738 2026-02-03 cs.CL cs.LG 78%

Enabling Approximate Joint Sampling in Diffusion LMs

在扩散语言模型中实现近似联合采样

Parikshit Bansal, Sujay Sanghavi

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种在扩散语言模型中近似联合采样方法,通过轻量级采样器层实现多token高效生成,提升了语言建模和编码任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏