arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-27 至 2026-01-27 共收录 62 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 62 篇

2601.17927 2026-01-27 cs.CV cs.MM 86%

RemEdit: Efficient Diffusion Editing with Riemannian Geometry

RemEdit: 基于黎曼几何的高效扩散编辑

Eashan Adhikarla, Brian D. Davison

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract);分类 cs.CV、cs.MM

AI总结 RemEdit通过基于黎曼几何的潜在空间导航和任务特定注意力剪枝机制,实现了高效且保真的图像编辑,同时保持实时性能。

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision, WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17259 2026-01-27 cs.CV cs.GR cs.LG 86%

Inference-Time Loss-Guided Colour Preservation in Diffusion Sampling

推理时的损失引导颜色保持在扩散采样中

Angad Singh Ahuja, Aarush Ram Anandh

机构 * Constrained Image-Synthesis Lab(受限图像合成实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种无需额外训练的推理时颜色保持方法,通过区域约束和复合损失引导扩散模型,实现精准颜色控制。

Comments 25 Pages, 12 Figures, 3 Tables, 5 Appendices, 8 Algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26442 2026-01-27 cs.IT math.IT 82%

Diffusion-Aided Bandwidth-Efficient Semantic Communication with Adaptive Requests

扩散辅助的带宽高效语义通信与自适应请求

Xuesong Wang, Xinyan Xie, Mo Li, Zhaoqian Liu

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 本文提出了一种基于反馈的闭环语义通信方案,通过自适应请求减少潜在块的传输,提高带宽效率和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02334 2026-01-27 cs.IT cs.CV cs.MM eess.SP math.IT 81%

Communicate Less, Synthesize the Rest: Latency-aware Intent-based Generative Semantic Multicasting with Diffusion Models

少传多合成:基于意图的生成语义多播与扩散模型

Xinkai Liu, Mahdi Boloursaz Mashhadi, Li Qiao, Yi Ma, Rahim Tafazolli, Mehdi Bennis

机构 * GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey(5GIC与6GIC,通信系统研究所(ICS),萨里大学) School of Information and Electronics, Beijing Institute of Technology(信息电子学院,北京理工大学) Centre for Wireless Communications, University of Oulu(无线通信中心,奥卢大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种基于意图的生成语义多播方法,利用预训练扩散模型减少传输延迟,同时保持高质量信号合成。

Comments Accepted at IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02831 2026-01-27 cs.CV 80%

No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves

无需其他表示组件:扩散变换器本身可以提供表示指导

Dengyang Jiang, Mengmeng Wang, Liuzhuozheng Li, Lei Zhang, Haoyu Wang, Wei Wei, Guang Dai, Yanning Zhang, Jingdong Wang

机构 * Northwestern Polytechnical University(西北工业大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Zhejiang University of Technology(浙江工业大学) Baidu Inc.(百度公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SRA方法,利用扩散变换器自身内部表示进行对齐,无需外部组件即可提升生成模型性能。

Comments ICLR 2026. Self-Representation Alignment for Diffusion Transformers. Code: https://github.com/vvvvvjdy/SRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18556 2026-01-27 cs.CV cs.LG 79%

Generative Diffusion Augmentation with Quantum-Enhanced Discrimination for Medical Image Diagnosis

生成扩散增强与量子增强判别用于医学图像诊断

Jingsong Xia, Siqi Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SDA-QEC通过生成扩散增强与量子增强判别技术,提升医学图像分类的诊断准确性与平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18168 2026-01-27 cs.CV 79%

TempDiffReg: Temporal Diffusion Model for Non-Rigid 2D-3D Vascular Registration

TempDiffReg:用于非刚性2D-3D血管配准的时序扩散模型

Zehua Liu, Shihao Zou, Jincai Huang, Yanfang Zhang, Chao Tong, Weixin Si

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(北京航空航天大学虚拟现实技术与系统国家重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(中国科学院深圳先进技术研究所) School of Computer Science and Control Engineering, Shenzhen University of Advanced Technology, Shenzhen, China(深圳先进技术大学计算机科学与控制工程学院) Department of Interventional Radiology, Shenzhen People’s Hospital, Shenzhen, China(深圳人民医院介入放射科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TempDiffReg通过时序扩散模型和结构感知视角n点模块,实现高精度的2D-3D血管配准,提升TACE手术的准确性和安全性。

Comments Accepted by IEEE BIBM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18832 2026-01-27 cs.CV 79%

Localizing Knowledge in Diffusion Transformers

在扩散变换器中定位知识

Arman Zarei, Samyadeep Basu, Keivan Rezaei, Zihao Lin, Sayan Nag, Soheil Feizi

机构 * University of Maryland(马里兰大学) University of California, Davis(加州大学戴维斯分校) Adobe(Adobe公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种方法,用于在扩散变换器中定位特定类型的知识,通过评估不同模型和知识类别,实现了高效且有针对性的模型更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17228 2026-01-27 cs.CV q-bio.QM 79%

Semi-Supervised Domain Adaptation with Latent Diffusion for Pathology Image Classification

半监督域适应与潜在扩散用于病理图像分类

Tengyue Zhang, Ruiwen Ding, Luoting Zhuang, Yuxiao Wu, Erika F. Rodriguez, William Hsu

机构 * Medical & Imaging Informatics, Department of Radiological Sciences, David Geffen School of Medicine, University of California, Los Angeles(医学与影像信息学系,放射科学系,大卫·盖弗医学院,加州大学洛杉矶分校) Bioengineering Department, Henry Samueli School of Engineering, UCLA(生物工程系,亨利·萨缪尔西工程学院,UCLA) Department of Pathology & Laboratory Sciences, David Geffen School of Medicine, UCLA(病理学与实验室科学系,大卫·盖弗医学院,UCLA)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出利用潜在扩散模型生成目标领域意识的合成数据,提升计算病理学中的域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10917 2026-01-27 cs.CV cs.AI cs.LG 79%

Self-learned representation-guided latent diffusion model for breast cancer classification in deep ultraviolet whole surface images

自学习表征引导的潜在扩散模型用于深紫外全表面图像中的乳腺癌分类

Pouya Afshin, David Helminiak, Tianling Niu, Julie M. Jorns, Tina Yen, Bing Yu, Dong Hye Ye

机构 * Department of Computer Science, Georgia State University(计算机科学系,佐治亚州立大学) Department of Electrical and Computer Engineering, Marquette University(电气与计算机工程系,马基特大学) Joint Dept. of Biomedical Eng., Marquette Univ. and Med. Coll. of Wisconsin(马基特大学与威斯康星医学院联合生物医学工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出自监督学习引导的潜在扩散模型,通过生成高质量合成数据提升深紫外全表面图像中乳腺癌分类的准确率和FID分数。

Comments This paper has been accepted for the IEEE International Symposium on Biomedical Imaging (ISBI) 2026, London, UK, and will be presented in the corresponding session

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03502 2026-01-27 eess.IV cs.AI cs.GR 79%

DC-VSR: Spatially and Temporally Consistent Video Super-Resolution with Video Diffusion Prior

DC-VSR: 基于视频扩散先验的时空一致视频超分辨率

Janghyeok Han, Gyujin Sim, Geonung Kim, Hyun-seung Lee, Kyuha Choi, Youngseok Han, Sunghyun Cho

机构 * POSTECH Visual Display Business, Samsung Electronics(视觉显示业务,三星电子)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 DC-VSR通过引入空间和时间注意力传播机制及细节抑制自注意力引导,实现了视频超分辨率的时空一致性与高质量纹理恢复。

Comments Equal contributions from first two authors

Journal ref In Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers (SIGGRAPH Conference Papers 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18615 2026-01-27 cs.LG 78%

Geometry-Free Conditional Diffusion Modeling for Solving the Inverse Electrocardiography Problem

无几何条件的条件扩散建模用于解决逆电生理图问题

Ramiro Valdes Jara, Adam Meyers

机构 * Department of Industrial and Systems Engineering(工业与系统工程系) University of Miami(迈阿密大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种无几何条件的条件扩散模型,用于解决逆电生理图问题,通过数据驱动的方法提高心脏电生理成像的重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18069 2026-01-27 cs.NI cs.AI 78%

Diffusion Model-based Reinforcement Learning for Version Age of Information Scheduling: Average and Tail-Risk-Sensitive Control

基于扩散模型的强化学习用于版本信息年龄调度:平均与尾风险敏感控制

Haoyuan Pan, Sizhao Chen, Zhaorui Wang, Tse-Tin Chan

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computing and Information Technology, Great Bay University(广东大湾区大学计算机与信息科技学院) Department of Mathematics and Information Technology, The Education University of Hong Kong(香港教育大学数学与信息技术系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的强化学习方法,用于多用户无线系统中平均和尾风险敏感的版本信息年龄调度,通过分布性critic和扩散-based actor实现稳健的尾风险优化。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14784 2026-01-27 eess.AS 78%

MELA-TTS: Joint transformer-diffusion model with representation alignment for speech synthesis

MELA-TTS:联合变压器-扩散模型与表征对齐用于语音合成

Keyu An, Zhiyu Zhang, Changfeng Gao, Yabin Li, Zhendong Peng, Haoxu Wang, Zhihao Du, Han Zhao, Zhifu Gao, Xiangang Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 MELA-TTS通过联合变压器-扩散模型与表征对齐,实现端到端文本到语音合成,提升连续特征建模效率和跨模态一致性。

Comments accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07363 2026-01-27 cs.IT math.IT 78%

Knowledge Distillation Driven Semantic NOMA for Image Transmission with Diffusion Model

基于扩散模型的语义NOMA知识蒸馏图像传输

Qifei Wang, Zhen Gao, Shuo Sun, Zhijin Qin, Xiaodong Xu, Meixia Tao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出KDD-SemNOMA方法,结合知识蒸馏和扩散模型,提升多用户无线图像传输的鲁棒性和图像恢复质量。

Comments 16 pages, accepted by IEEE Transactions on Wireless Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19738 2026-01-27 math.NA cs.NA 78%

Numerical Identification of a Time-Dependent Coefficient in a Time-Fractional Diffusion Equation with Integral Constraints

时间分数扩散方程中时间依赖系数的数值识别

Arshyn Altybay

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种高效算法用于时间分数扩散方程中时间依赖系数的数值识别,通过积分形式和有限差分方案实现了稳定性与收敛性的分析,并验证了算法在噪声数据下的鲁棒性。

Journal ref Zeitschrift fur Angewandte Mathematik und Physik, 77, 41 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17902 2026-01-27 cs.SD eess.AS 78%

dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition

dLLM-ASR:一种更高效的基于扩散大语言模型的语音识别框架

Wenjie Tian, Bingshen Mu, Guobin Ma, Xuelong Geng, Zhixian Zhao, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 dLLM-ASR通过将扩散大语言模型的解码过程转化为先验引导的去噪流程,实现高效的语音识别,达到与自回归模型相当的准确率并提升4.44倍推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17375 2026-01-27 math.NA cs.NA 78%

Operator splitting based diffusion samplers and improved convergence analysis

基于运算符分裂的扩散采样器及改进的收敛性分析

Peiyi Liu, Zhaoqiang Liu, Yiqi Gu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于运算符分裂的扩散采样器,并改进收敛性分析,建立了更精确的误差界,验证了误差与步长的二次关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17224 2026-01-27 cs.LG 78%

Parameter Inference and Uncertainty Quantification with Diffusion Models: Extending CDI to 2D Spatial Conditioning

基于扩散模型的参数推断与不确定性量化:扩展CDI以支持二维空间条件

Dmitrii Torbunov, Yihui Ren, Lijun Wu, Yimei Zhu

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的CDI方法,扩展至二维空间条件,用于CBED参数推断,提供更准确的不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17166 2026-01-27 math.DG math.AP math.PR 78%

Recovering Riemannian Geometry from Diffusion

从扩散中恢复黎曼几何

Amandip Sangha

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过扩散半群内在重建黎曼几何的方法,揭示几何结构由扩散行为决定,无需预设度量或坐标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21906 2026-01-27 math.AP math-ph math.MP math.PR 78%

Wave propagation for 1-dimensional reaction-diffusion equations with nonzero random drift

具有非零随机漂移的一维反应扩散方程的波传播

Dihang Guan, Hui He, Wenqing Hu, Jiaojiao Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了一维反应扩散方程中非零随机漂移对波传播的影响,揭示了漂移如何改变波前传播方向及系统内在波动结构。

Comments 56 pages, 3 figures, preliminary version. Comments are welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19424 2026-01-27 math.AP 78%

On the Fujita Phenomenon for a Forced Spatio-Temporal Fractional Diffusion Equation

关于带有时间依赖强迫项的时空分数扩散方程的Fujita现象

Rihab Ben Belgacem, Mohamed Majdoub

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了带有时间依赖强迫项的时空分数扩散方程的Fujita现象,建立了亚临界和超临界情况下的解存在性和临界指数,揭示了时间增长强迫对解行为的影响。

Comments The presentation has been improved, and numerical simulations have been added

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03251 2026-01-27 cs.LG cs.AI 78%

Exploring the Frontiers of Softmax: Provable Optimization, Applications in Diffusion Model, and Beyond

探索softmax的前沿:可证明的优化、扩散模型中的应用及更广泛的领域

Yang Cao, Yingyu Liang, Zhenmei Shi, Zhao Song

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究softmax函数的优化与泛化性质,揭示其在扩散模型中学习分数函数的可证明精度,并探讨其在自然语言处理及其他领域中的潜力。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.12615 2026-01-27 cond-mat.stat-mech cond-mat.mes-hall cond-mat.soft 78%

First-passage Fingerprints of Water Diffusion near Glutamine Surfaces

水分子在谷氨酰胺表面扩散的首次通过指纹

Roman Belousov, Muhammad Nawaz Qaisrani, Ali Hassanali, Édgar Roldán

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究水分子在谷氨酰胺表面扩散的动力学,利用分子动力学和首次通过技术提取空间依赖扩散系数,揭示水分子运动与表面化学性质的关系。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17579 2026-01-27 math.AP 71%

Characterisation of homogenisation for nonlocal diffusion by local topologies

非局部扩散的均质化特征分析

Andreas Buchinger, Krešimir Burazin, Ivana Crnjac, Marko Erceg, Maja Jolić, Marcus Waurick

专题命中 扩散模型 :diffusion(title)

AI总结 本文研究了非局部扩散问题的均质化特征,通过H-收敛性和Schur拓扑分析局部系数收敛性,并应用于对称系数和分数热方程的均质化问题。

Comments 39 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09650 2026-01-27 cs.CV cs.AI cs.MM eess.IV 62%

From Darkness to Detail: Frequency-Aware SSMs for Low-Light Vision

从黑暗到细节:面向低光视觉的频率感知SSM

Eashan Adhikarla, Kai Zhang, Gong Chen, John Nicholson, Brian D. Davison

机构 * Lehigh University(莱特大学) Lenovo Research(联想研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 ExpoMamba通过频率感知状态空间模型解决低光图像增强中的混合曝光问题,实现高效高质量的实时增强。

Journal ref Winter Conference on Applications of Computer Vision, WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17022 2026-01-27 cs.MM cs.AI cs.CV cs.CY 62%

AI-based System for Transforming text and sound to Educational Videos

基于AI的将文本和声音转换为教育视频的系统

M. E. ElAlami, S. M. Khater, M. El. R. Rehan

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于GAN的AI系统,通过文本和语音转录、图像生成与视频合成,生成高质量的教育视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18049 2026-01-27 cs.CV 57%

Semi-Supervised Hyperspectral Image Classification with Edge-Aware Superpixel Label Propagation and Adaptive Pseudo-Labeling

半监督超光谱图像分类:基于边缘感知超像素标签传播与自适应伪标签的方法

Yunfei Qiu, Qiqiong Ma, Tianhua Lv, Li Fang, Shudong Zhou, Wei Yao

机构 * Liaoning Technical University(辽宁技术大学) State Key Laboratory of Regional and Urban Ecology, Institute of Urban Environment, Chinese Academy of Sciences(区域与城市生态国家重点实验室,城市环境研究所,中国科学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于边缘感知超像素标签传播与自适应伪标签方法的半监督超光谱图像分类框架,通过整合空间先验信息与动态学习机制,提升分类鲁棒性和伪标签稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17905 2026-01-27 cs.CV cs.AI stat.ML 57%

Feature-Space Generative Models for One-Shot Class-Incremental Learning

特征空间生成模型用于单样本类增量学习

Jack Foster, Kirill Paramonov, Mete Ozay, Umberto Michieli

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Gen1S通过特征空间生成模型提升单样本类增量学习中的新类识别性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17679 2026-01-27 cs.SD cs.CL cs.CV cs.LG eess.AS 57%

BanglaRobustNet: A Hybrid Denoising-Attention Architecture for Robust Bangla Speech Recognition

BanglaRobustNet: 一种混合去噪-注意力架构用于鲁棒的孟加拉语语音识别

Md Sazzadul Islam Ridoy, Mubaswira Ibnat Zidney, Sumi Akter, Md. Aminur Rahman

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Ahsanullah University of Science and Technology(阿沙努拉大学科学与技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 BanglaRobustNet通过融合去噪与注意力机制,提升孟加拉语在嘈杂和说话人多样环境下的语音识别鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏