arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-27 至 2025-11-27 共收录 52 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 52 篇

2511.21215 2025-11-27 cs.CV cs.LG 88%

From Diffusion to One-Step Generation: A Comparative Study of Flow-Based Models with Application to Image Inpainting

从扩散到一步生成:基于流模型的比较研究及其在图像修复中的应用

Umang Agarwal, Rudraksh Sangore, Sumit Laddha

机构 * Department of Electrical Engineering IIT Bombay(电子工程系 印度理工学院 巴米扬)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 本文比较了三种生成模型在图像修复中的应用,展示了CFM和MeanFlow在生成质量和效率上的优势,特别是在单步生成和修复任务中的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10382 2025-11-27 cs.CV 88%

Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion Models

迈向空间一致的图像生成:将内在场景属性纳入扩散模型

Hyundo Lee, Suhyung Choi, Inwoo Hwang, Byoung-Tak Zhang

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于内在场景属性的图像生成方法,通过同时生成图像和其内在属性,提升生成图像的空间一致性和真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21180 2025-11-27 cs.CR cs.AI 82%

CAHS-Attack: CLIP-Aware Heuristic Search Attack Method for Stable Diffusion

CAHS-攻击:针对稳定扩散模型的CLIP感知启发式搜索攻击方法

Shuhan Xia, Jing Dai, Hui Ouyang, Yadong Shang, Dongxiao Zhao, Peipei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Mobile Ltd, Department of Cyber and Information Security Management(中国移动有限公司,网络安全与信息安全管理部) Aspire Information Technology (Beijing) Company Limited(aspire信息技术(北京)有限公司)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 CAHS-攻击通过CLIP感知的启发式搜索方法,针对稳定扩散模型的文本编码器漏洞,实现高效对抗性提示生成,提升生成模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21592 2025-11-27 cs.CV 79%

MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training

通过少量步骤的运动对抗性后训练提升视频扩散中的运动质量

Haotian Xue, Qi Chen, Zhonghao Wang, Xun Huang, Eli Shechtman, Jinrong Xie, Yongxin Chen

机构 * Adobe(Adobe公司) Georgia Tech(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MoGAN通过运动对抗性后训练提升视频扩散模型的运动质量,无需奖励模型或人类偏好数据,在多个基准测试中显著提高了运动真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21122 2025-11-27 cs.CV cs.AI 79%

Which Layer Causes Distribution Deviation? Entropy-Guided Adaptive Pruning for Diffusion and Flow Models

哪一层导致分布偏离?面向扩散和流模型的熵引导自适应剪枝

Changlin Li, Jiawei Zhang, Zeyi Shi, Zongxin Yang, Zhihui Li, Xiaojun Chang

机构 * Stanford University(斯坦福大学) North China Electric Power University(华北电力大学) University of Technology Sydney(悉尼科技大学) Harvard University(哈佛大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出EntPruner,通过熵引导的自适应剪枝方法,有效减少扩散和流模型的参数冗余,提升推理速度并保持生成质量。

Comments Project page: https://github.com/changlin31/EntPruner

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19958 2025-11-27 cs.CV 79%

GFT-GCN: Privacy-Preserving 3D Face Mesh Recognition with Spectral Diffusion

GFT-GCN:基于谱扩散的隐私保护3D人脸网格识别

Hichem Felouat, Hanrui Wang, Isao Echizen

机构 * The Graduate University for Advanced Studies, SOKENDAI(高级研究大学,SOKENDAI) National Institute of Informatics, NII(信息研究所) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GFT-GCN通过结合谱图学习与扩散机制,实现隐私保护的3D人脸识别,兼顾高准确性和防攻击能力。

Comments 13 pages, 8 figures, WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19111 2025-11-27 cs.CV 79%

DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection

DiffSeg30k: 一种用于局部AIGC检测的多轮扩散编辑基准

Hai Ci, Ziheng Peng, Pei Yang, Yingxin Xuan, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) South China University of Technology(华南理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffSeg30k通过引入多轮扩散编辑基准,推动AIGC检测从二元分类到语义分割的转变,提升局部编辑定位和模型识别的可靠性。

Comments 16 pages, 10 figures; typos corrected, references added

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18255 2025-11-27 cs.CV 79%

Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization

基于扩散噪声优化的连续流序列适应视频预测

Sina Mokhtarzadeh Azar, Emad Bahrami, Enrico Pallotta, Gianpiero Francesca, Radu Timofte, Juergen Gall

机构 * University of Bonn(波恩大学) Toyota Motor Europe(丰田欧洲公司) University of Wuerzburg(乌尔姆大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散噪声优化的连续流序列适应视频预测方法,通过在推理过程中细化扩散噪声以提升视频预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12396 2025-11-27 eess.IV cs.CV 79%

DEMIST: Decoupled Multi-stream latent diffusion for Quantitative Myelin Map Synthesis

解耦多流潜在扩散模型用于定量髓鞘图合成

Jiacheng Wang, Hao Li, Xing Yao, Ahmad Toubasi, Taegan Vinarsky, Caroline Gheen, Joy Derwenskus, Chaoyang Jin, Richard Dortch, Junzhong Xu, Francesca Bagnato, Ipek Oguz

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学中心) Barrow Neurological Institute(巴罗神经研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DEMIST通过解耦多流潜在扩散模型,利用标准T1w和FLAIR图像生成高质量的PSR图,提升MS评估的定量准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21890 2025-11-27 cs.CV 79%

Diffusion-Denoised Hyperspectral Gaussian Splatting

扩散去噪超光谱高斯点云

Sunil Kumar Narayanan, Lingjun Zhao, Lu Gan, Yongsheng Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DD-HGS方法,通过引入波长敏感的球谐函数、光谱损失和扩散去噪器,实现超光谱场景的3D显式重建,提升3D高斯点云方法的性能。

Comments Accepted to 3DV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06698 2025-11-27 cs.CV 79%

Gen-3Diffusion: Realistic Image-to-3D Generation via 2D & 3D Diffusion Synergy

Gen-3Diffusion:通过2D与3D扩散协同实现逼真图像到3D生成

Yuxuan Xue, Xianghui Xie, Riccardo Marin, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰州信息校园)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Gen-3Diffusion通过2D与3D扩散模型协同生成逼真3D物体和化身,提升多视图一致性和泛化能力。

Comments Accepted to Transaction on Pattern Analysis and Machine Intelligence (T-PAMI). Project Page: https://yuxuan-xue.com/gen-3diffusion. arXiv admin note: substantial text overlap with arXiv:2406.08475

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18488 2025-11-27 econ.TH 78%

Modelling Asset Price Dynamics with Investor Inertia: Diffusion with Advection and Fourth-Order Extension

用投资者惯性建模资产价格动态:具有对流的扩散及其四阶扩展

Diego da Silva Santos, Luiz Gustavo Bastos Pinho

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种考虑投资者惯性的资产价格动态模型,通过四阶扩展改进传统扩散模型,实证显示其在拟合收益率分布方面表现更优。

Comments 15 pages, 4 figures, in process of submition

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21357 2025-11-27 physics.chem-ph 78%

Diffusion-controlled reaction rate to an active site in a spherical cavity: Extension of Berg's theory

扩散控制反应速率在球形空腔中的活性位点:伯格理论的扩展

Sergey D. Traytak, Georgiy A. Babushkin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文扩展了伯格理论,通过双级数关系法研究球形空腔中扩散控制反应速率,揭示了其与广义分离变量法的联系,并用于测试数值模拟程序。

Comments 53 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21342 2025-11-27 cs.SD cs.AI 78%

Generating Separated Singing Vocals Using a Diffusion Model Conditioned on Music Mixtures

基于音乐混音的扩散模型生成分离的演唱声部

Genís Plaja-Roglans, Yun-Ning Hung, Xavier Serra, Igor Pereira

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的音乐演唱声部分离方法,通过条件生成提升分离效果,并通过消融研究分析采样参数影响。

Comments Accepted for publication at WASPAA 2025

Journal ref 2025 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21320 2025-11-27 cs.LG 78%

Sawtooth Sampling for Time Series Denoising Diffusion Implicit Models

锯齿采样用于时间序列去噪扩散隐式模型

Heiko Oppel, Andreas Spilz, Michael Munz

机构 * AI for Sensor Data Analytics Research Group(传感器数据 analytics 研究组) Ulm University of Applied Sciences(乌尔姆应用科学大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出锯齿采样器,用于加速扩散隐式模型的时间序列去噪过程,提升生成序列质量并提高分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21103 2025-11-27 cs.LG cs.AI 78%

From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models

从比特到轮次:为扩散语言模型的并行解码探索

Hengyu Fu, Baihe Huang, Virginia Adams, Charles Wang, Venkat Srinivasan, Jiantao Jiao

机构 * University of California, Berkeley(加州大学伯克利分校) NVIDIA

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出ETE策略,通过探索高不确定token提升扩散语言模型的解码效率,减少轮次并保持生成质量。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21054 2025-11-27 cs.LG 78%

Efficient Diffusion Planning with Temporal Diffusion

高效的时间扩散规划

Jiaming Guo, Rui Zhang, Zerun Li, Yunkai Gao, Shaohui Peng, Siming Lan, Xing Hu, Zidong Du, Xishan Zhang, Ling Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出时间扩散规划器(TDP),通过在时间维度上分布去噪步骤提高决策效率,实验显示其决策频率提升显著。

Comments Accepted by the AAAI26 Conference Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20704 2025-11-27 cs.LG stat.ML 78%

Pretraining Transformer-Based Models on Diffusion-Generated Synthetic Graphs for Alzheimer's Disease Prediction

基于扩散生成合成图的Transformer模型预训练用于阿尔茨海默病预测

Abolfazl Moslemi, Hossein Peyvandi

机构 * Sharif University of Technology(谢里夫理工学院) Pasargad Institute for Advanced Innovative Solutions(帕萨尔加德先进创新解决方案研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出基于扩散生成合成图的Transformer模型,通过预训练提升阿尔茨海默病预测的准确性和泛化能力。

Comments 14 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18872 2025-11-27 math.AP 78%

H{ö}lder regularity of parabolic equations with Dirichlet boundary conditions and application to reaction-diffusion and reaction-cross-diffusion systems

抛物方程的Hölder正则性及在反应扩散和反应交叉扩散系统中的应用

Hector Bouton, Laurent Desvillettes, Helge Dietert

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了具有狄利克雷边界条件的抛物方程的Hölder正则性,并将其应用于证明反应扩散和反应交叉扩散系统的全局强解存在性及解的估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12689 2025-11-27 eess.IV 78%

Diffusion Algorithm for Metalens Optical Aberration Correction

金属镜面扩散算法用于光学像差校正

Harshana Weligampola, Yuanrui Chen, Weiheng Tang, Qi Guo, Stanley H. Chan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的金属镜面像差校正算法,通过融合结构图像与颜色提示图像,实现高清晰度全色图像重建。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00209 2025-11-27 cs.LG cs.AI q-bio.BM q-bio.QM 78%

Diffusion Models at the Drug Discovery Frontier: A Review on Generating Small Molecules versus Therapeutic Peptides

在药物发现前沿的扩散模型:生成小分子与治疗性肽的综述

Yiquan Wang, Yahui Ma, Yuhan Chang, Jiayao Yan, Jialin Zhang, Minnuo Cai, Kai Wei

机构 * Xinjiang Key Laboratory of Biological Resources and Genetic Engineering(新疆生物资源与基因工程重点实验室) College of Life Science and Technology, Xinjiang University(新疆大学生命科学与技术学院) School of Mathematics and System Sciences, Xinjiang University(新疆大学数学与系统科学学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文综述了扩散模型在生成小分子和治疗性肽中的应用,分析了各自挑战及共同问题,强调通过整合到自动化平台以提升药物发现效率。

Comments Published in Biology

Journal ref Biology 2025, 14(12), 1665

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12398 2025-11-27 cs.CR cs.AI cs.CL 78%

Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

对齐何处开始?扩散大语言模型可能需要不同的位置

Zhixin Xie, Xurui Song, Jun Luo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出MOSA方法,通过强化学习对齐dLLM中间生成与安全拒绝,提升安全性。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00299 2025-11-27 cs.LG 78%

Inference-Time Alignment of Diffusion Models via Evolutionary Algorithms

通过进化算法实现扩散模型的推理时间对齐

Purvish Jajal, Nick John Eliopoulos, Benjamin Shiue-Hal Chou, George K. Thiruvathukal, James C. Davis, Yung-Hsiang Lu

机构 * Purdue University West Lafayette, IN, USA(普渡大学西拉法叶分校) Loyola University Chicago(洛约拉大学芝加哥分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于进化算法的扩散模型推理时间对齐方法,通过优化潜在空间提升对齐效果,相比传统方法在效率和性能上均有显著提升。

Comments P. Jajal and N. J. Eliopoulos contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21426 2025-11-27 cs.AI cs.LG cs.MA econ.EM physics.soc-ph 78%

Learning Individual Behavior in Agent-Based Models with Graph Diffusion Networks

基于图扩散网络的学习个体行为在基于代理的模型中

Francesco Cozzi, Marco Pangallo, Alan Perotti, André Panisson, Corrado Monti

机构 * Sapienza University(萨皮恩扎大学) CENTAI

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于图扩散网络的方法,通过学习个体行为来提升基于代理模型的模拟能力,展示了其在预测复杂系统动态方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14739 2025-11-27 cs.LG cs.AI 78%

Time Series Similarity Score Functions to Monitor and Interact with the Training and Denoising Process of a Time Series Diffusion Model applied to a Human Activity Recognition Dataset based on IMUs

时间序列相似度评分函数用于监控和与时间序列扩散模型的训练和去噪过程互动,应用于基于IMUs的人体活动识别数据集

Heiko Oppel, Andreas Spilz, Michael Munz

机构 * AI for Sensor Data Analytics Research Group, Ulm University of Applied Sciences(人工智能传感器数据解析研究组,乌尔姆应用科学大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出利用时间序列相似度评分函数优化扩散模型的训练过程,以提升生成数据的质量并减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02954 2025-11-27 cs.LG 78%

IMUDiffusion: A Diffusion Model for Multivariate Time Series Synthetisation for Inertial Motion Capturing Systems

IMUDiffusion:一种用于惯性运动捕捉系统多变量时间序列合成的扩散模型

Heiko Oppel, Michael Munz

机构 * Research Group Biomechatronics Ulm University of Applied Sciences(生物机械学研究组 奥尔姆应用科学大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 IMUDiffusion是一种专为惯性运动捕捉系统设计的扩散模型,通过生成合成数据提升人类活动分类器性能,显著提高宏F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21390 2025-11-27 math.AP 71%

Stationary equation of the relativistic heat diffusion in transparent media having $L^1$--data

相对热扩散的 stationary 方程在具有 $L^1$--数据的透明介质中

Francesco Balducci, Sergio Segura de León

专题命中 扩散模型 :diffusion(title)

AI总结 本文研究了在具有 $L^1$--数据的透明介质中相对热扩散的 stationary 方程的存在性与正则性,提出了解的定义方法并验证了结果与已有研究的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21415 2025-11-27 cs.CV 70%

DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models

DiverseVAR: 在不重新训练或微调的情况下提升下一尺度视觉自回归模型的多样性和质量

Mingue Park, Prin Phunyaphibarn, Phillip Y. Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 DiverseVAR通过在测试时注入文本嵌入噪声和scale-travel技术,提升视觉自回归模型的多样性与图像质量的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20462 2025-11-27 cs.CV cs.LG 70%

STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows

STARFlow-V:基于归一化流的端到端视频生成模型

Jiatao Gu, Ying Shen, Tianrong Chen, Laurent Dinh, Yuyang Wang, Miguel Angel Bautista, David Berthelot, Josh Susskind, Shuangfei Zhai

机构 * Apple(苹果公司)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 STARFlow-V基于归一化流提出端到端视频生成模型,具备端到端学习、鲁棒因果预测和原生似然估计等优势,实现了高质量自回归视频生成。

Comments 21 pages, 9 figures. Code and samples are available at https://github.com/apple/ml-starflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21635 2025-11-27 cs.LG cs.AI cs.CV 57%

Mechanisms of Non-Monotonic Scaling in Vision Transformers

视觉变换器中非单调缩放机制

Anantha Padmanaban Krishna Kumar

机构 * Department of Computer Science, Boston University(计算机科学系,波士顿大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究揭示了视觉变换器中深度增加导致性能非单调变化的机制,通过信息混乱指数发现信息扩散与任务性能的权衡关系。

Comments 16 pages total (11 pages main text, 1 pages references, 4 pages appendix), 5 figures, 11 tables. Code available at https://github.com/AnanthaPadmanaban-KrishnaKumar/Cliff-Plateau-Climb

详情

展开后加载摘要…

URL PDF HTML 收藏