arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-20 至 2026-08-20 共收录 46 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 46 篇

2608.19119 2026-08-20 cs.LG cs.AI 新提交 82%

Discretizing Continuous Time Series for Imputation with Masked Diffusion Training

用于掩码扩散训练插补的连续时间序列离散化

Dongbin Kim, Seungyun Lee, Geonwoo Shin, Jaewook Lee

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对时间序列插补的现有方法存在的局限性,提出MDTIM模型,引入随机离散化技术,在多种基准上的实验显示其鲁棒性和可扩展性优于现有基线方法。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19000 2026-08-20 cs.CV 新提交 79%

Mise-en-Scène: Implicit Layout Emergence in Diffusion Transformers for Human-AI Design Co-Creation

场景布置(Mise-en-Scène):用于人机协同设计共创的扩散Transformer中隐式布局的涌现

Zipeng Xu, Ryan Murdock, Umberto Michieli

机构 * Canva Research(Canva研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Mise-en-Scène框架,通过微调扩散Transformer实现隐式布局涌现,结合匹配放置步骤保证素材保真度,在PrismLayersPlus基准上生成的设计感知质量显著优于现有方法。

Comments Best Paper Award at ECCV Human-AI Co-Creation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11748 2026-08-20 cs.CV 版本更新 79%

Dual Modality Prompted Diffusion Priors for Zero Shot Hyperspectral Pansharpening

用于零样本高光谱 pansharpening 的双模态提示扩散先验

Pengwei Xie, Fei Zhu, Jiajun Li, Xiangyuan Liu, Xiangyuan Liu, Kangqing Shen, Gemine Vivone

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Peking University(北京大学) National Center for Applied Mathematics Shenzhen (NCAMS), Southern University of Science and Technology(南方科技大学深圳应用数学国家中心) Department of Automation, Tsinghua University(清华大学自动化系) National Research Council of Italy, Institute of Integrated Methodologies for Earth Observation (CNR-IMIOT)(意大利国家研究委员会综合地球观测方法研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对零样本高光谱 pansharpening 问题,提出双模态提示扩散模型 DIDM,通过双模态提示注入与全色引导正则化实现空间细节与光谱保真的平衡,在多数据集实验中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08289 2026-08-20 cs.CV cs.AI cs.LG 79%

Large Intestine 3D Shape Refinement Using Point Diffusion Models for Digital Phantom Generation

Kaouther Mouheb, Mobina Ghojogh Nejad, Lavsen Dahal, Ehsan Samei, Kyle J. Lafata, W. Paul Segars, Joseph Y. Lo

机构 * Center for Virtual Imaging Trials, Department of Radiology, Duke University School of Medicine, Durham, NC, USA Biomedical Imaging Group Rotterdam, Department of Radiology \& Nuclear Medicine, Erasmus MC, Rotterdam, the Netherlands Electrical Computer Engineering, Pratt School of Engineering, Duke University, Durham, NC, USA

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Journal ref Shape in Medical Imaging (ShapeMI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21307 2026-08-20 cs.CV 版本更新 79%

The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models

可解释令牌的线性几何:未学习扩散模型的越狱攻击与防御

Siyi Chen, Yimeng Zhang, Sijia Liu, Qing Qu

机构 * Department of Electrical Engineering & Computer Science, University of Michigan(电气工程与计算机科学系,密歇根大学) Department of Computer Science, Michigan State University(计算机科学系,密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究揭示未学习扩散模型中擦除的有害概念以线性子空间存在,提出SubAttack越狱攻击与SubDefense防御,实验表明其提升了对扩散未学习漏洞的理解与缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19067 2026-08-20 stat.ML cs.LG math.ST stat.TH 新提交 78%

Diffusion Models for High-Dimensional Clustered Data: Intrinsic-Dimension Adaptivity via Bayesian Classification

用于高维聚类数据的扩散模型:通过贝叶斯分类实现本征维度适应性

Yuga Iguchi, Paul Fearnhead

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究将扩散模型理论与多模态高维聚类数据几何结合,通过K混合高斯框架证明其去噪可作为动态贝叶斯分类器,KL误差界线性依赖聚类最大本征维度,实现了本征维度适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18237 2026-08-20 stat.ML cs.LG math.OC 新提交 78%

Sobolev Regularized Score Difference Estimation in Diffusion Models

扩散模型中的Sobolev正则化得分差估计

Chenghan Xie, Jose Blanchet, Renyuan Xu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对扩散模型得分差估计存在的统计一致性或可扩展性问题,提出Sobolev正则化的一致可扩展估计器,在小样本场景稳定性提升,真实任务性能优于非正则化方法。

Comments Accpeted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18526 2026-08-20 cond-mat.soft 新提交 78%

Particle-Wall Alignment Interaction and Active Brownian Diffusion Through Narrow Channels

粒子-壁面的取向相互作用与活性布朗粒子通过窄通道的扩散

Poulami Bag, Shubhadip Nayak, Pulak Kumar Ghosh

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究通过数值模拟探究粒子-壁面取向相互作用对活性粒子通过窄通道扩散的影响,明确不同稳定取向构型下扩散系数的变化规律,为理解微/纳米物体在窄通道中的扩散提供理论支撑。

Journal ref Soft Matter 20 (2024) 8267-8277

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17837 2026-08-20 nucl-th 版本更新 78%

Dissipative properties of a Fermi system within the diffusion approximation of kinetic theory

动力学理论扩散近似下费米系统的耗散性质

Sergiy V. Lukyanov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究球形原子核模型费米系统在动力学理论扩散近似下的耗散性质,通过非线性扩散方程解析解表明分布函数趋近平衡费米分布,得出不同弛豫时间,解释了弛豫时间差异。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10523 2026-08-20 quant-ph 78%

Quantum Mechanics as a Reversible Diffusion Theory

量子力学作为可逆扩散理论

Charalampos Antonakos

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过时间对称随机动力学和非经典概率论,将波函数及其复共轭解释为复扩散方程中的复概率分布,提出量子力学的一种新诠释,并基于纯概率论推导叠加原理,解释经典与量子行为的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08055 2026-08-20 cond-mat.mtrl-sci 版本更新 78%

Anisotropic Defect Diffusion in Layered CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$ Perovskites

层状CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$钙钛矿中各向异性缺陷扩散

Konrad Wilke, Mike Pols, Titus S. van Erp, Geert Brocks, Shuxia Tao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过分子动力学模拟探讨层状CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$钙钛矿中缺陷扩散的各向异性,揭示层状卤素排列对材料稳定性及缺陷迁移的调控作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09560 2026-08-20 cs.LG 版本更新 78%

The Diffusion-Attention Connection

扩散与注意的联系

Julio Candanedo

机构 * SparseTrace.ai, Appleton, Wisconsin, USA(SparseTrace.ai,美国威斯康星州阿普尔顿)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文揭示Transformer、扩散图和磁拉普拉斯为单一马尔可夫几何的不同模式,通过定义QK双向发散实现注意力、扩散图和磁扩散的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05092 2026-08-20 stat.ML cs.LG 版本更新 78%

Foundations of Diffusion Models in General State Spaces: A Self-Contained Introduction

扩散模型在一般状态空间中的基础:一个自包含的介绍

Vincent Pauline, Tobias Höppe, Kirill Neklyudov, Alexander Tong, Stefan Bauer, Andrea Dittadi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提供了一个自包含的扩散模型入门教程,统一了连续和离散状态空间的理论框架,阐述了反向动力学和ELBO的形成机制,适用于不同背景的读者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18433 2026-08-20 cs.LG 78%

Diffusion Policies with Offline and Inverse Reinforcement Learning for Promoting Physical Activity in Older Adults Using Wearable Sensors

Chang Liu, Ladda Thiamwong, Yanjie Fu, Rui Xie

机构 * Department of Statistics and Data Science, University of Central Florida(统计与数据科学系,中央佛罗里达大学) College of Nursing, University of Central Florida(护理学院,中央佛罗里达大学) School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

Comments Accepted at ICMLA 2025. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08484 2026-08-20 cs.CV 版本更新 77%

Generalizable AI-Generated Image Detection Based on Fractal Self-Similarity in the Spectrum

基于频谱分形自相似性的可泛化AI生成图像检测

Shengpeng Xiao, Yuanfang Guo, Heqi Peng, Hui Miao, Zeming Liu, Liang Yang, Jiantao Zhou, Yunhong Wang

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对AI生成图像检测中现有方法泛化能力不足的问题,提出Fractal-CNN模型,通过捕捉频谱分形自相似性实现与生成器无关的检测,在16个测试生成器上平均准确率达93.93%,具备强跨生成器泛化能力。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18908 2026-08-20 cs.CE 新提交 71%

Image Generation Techniques for Urban Planning

面向城市规划的图像生成技术

Katharina Roth, Eva Hagen, Alexander Bartscher, Inga Scheler, Nicolas R. Gauger

专题命中 扩散模型 :image generation(title)

AI总结 本研究开发了基于掩码的加权条件流匹配(MWCFM)模型,用于自动生成城市场景中的建筑演示图像,并通过应用相关指标评估其性能,为城市规划图像生成提供优化方案。

Comments 9 pages (incl. references), 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18416 2026-08-20 math.AP 新提交 71%

Global existence of weak solutions to chemotaxis models with porous medium diffusion, linear production, and logistic source on $\mathbb{R}^N$

Zulaihat Hassan

专题命中 扩散模型 :diffusion(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08319 2026-08-20 cs.CV cs.LG 版本更新 70%

A continually expandable foundation model for brain MRI

可持续扩展的脑MRI基础模型

Michail Mamalakis, Carmen Jimenez-Mesa, Yonghao Li, Hao Chen, Chao Li, Antonios Mamalakis, John Suckling, Richard Bethlehem, Stephen J. Price, Richard J. Gilbertson, Pietro Lio

机构 * University of Cambridge(剑桥大学) University of Málaga(马拉加大学)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出可扩展的Alcmaeon脑MRI基础模型,结合体积编码、潜在扩散生成与Graph-Blueprint Pruning,在跨临床领域扩展时遗忘程度更低,可支持多种任务,为持续发展的脑MRI基础模型提供了可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16445 2026-08-20 cs.LG cs.AI cs.CV stat.ML 版本更新 70%

Iterative Flow Matching: Path Correction and Gradual Refinement for Enhanced Generative Modeling

迭代流匹配:用于增强生成建模的路径校正与渐进式优化

Eldad Haber, Shadab Ahamed, Md. Shahriar Rahim Siddiqui, Niloufar Zakariaei, Moshe Eliasof

专题命中 扩散模型 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本研究针对图像生成模型易产生幻觉的问题,提出可集成于各类生成建模技术的迭代流匹配方法,通过路径校正与渐进式优化提升图像合成的性能与鲁棒性。

Comments 19 pages, 8 figures

Journal ref SIAM Journal on Scientific Computing, 48(4), C814-C831 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19055 2026-08-20 cs.CV cs.GR cs.SD 新提交 62%

Generalized Audio-Driven Synthesis of Precise Drummer Motion

音频驱动的精确鼓手动作的广义合成

Álvaro G. Iñesta, Mattia Ryffel, Amit H. Bermano, Robert W. Sumner, Martin Guay

机构 * DisneyResearch|Studios(迪士尼研究工作室) The Blavatnik School of Computer Science and AI, Tel-Aviv University(特拉维夫大学布拉瓦尼克计算机科学与人工智能学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出带双目标损失函数的生成式扩散框架,结合自有数据集与新指标,实现从音频生成厘米级精度的逼真打鼓动作,泛化能力优于现有方法。

Comments Best Paper Award at the 25th ACM SIGGRAPH / Eurographics Symposium on Computer Animation (SCA 2026). For Supplementary Video, see https://studios.disneyresearch.com/2026/08/18/generalized-audio-driven-synthesis-of-precise-drummer-motion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01590 2026-08-20 cs.CV cs.GR 版本更新 62%

Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis

面向街景新视角合成的有效多传感器条件控制

Zhengfei Kuang, Adam Sun, Liyuan Zhu, Tong Wu, Shengqu Cai, Jonathan Tremblay, Iro Armeni, Ehsan Adeli, Lior Yariv, Gordon Wetzstein

机构 * Stanford Univerity(斯坦福大学) NVIDIA

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出StreetNVS视频扩散框架,通过参考增强相机注意力模块和相对射线级位置编码联合利用LiDAR、环视图像和相机位姿,实现稀疏LiDAR条件下的高质量街景新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19036 2026-08-20 cs.CV 新提交 57%

USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes

USR-Drive:通过3D高斯与边界框联合去噪实现统一驾驶场景表示

Li-Heng Chen, Haokai Pang, Chengye Su, Jiarun Liu, Qifeng Chen, Ziqian Ni, Jianxin Huang, Shi-Sheng Huang, Hongbo Fu, Sheng Yang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出USR-Drive框架,将3D高斯与边界框作为对齐的潜在令牌流,通过统一多模态扩散Transformer联合去噪,在nuScenes和VKitti数据集上实现动态重建与3D检测的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18907 2026-08-20 cs.CV cs.AI 新提交 57%

Learning-State-Aware Dynamic Generative Data Augmentation on Small-Scale Datasets

面向小规模数据集的学习状态感知动态生成式数据增强

Ting Xiang, Chenxi Deng, Jinhui Zhao, Bingting Jiang, Ke Zhang, Changjian Chen, Zhuo Tang

机构 * Hunan University(湖南大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对小规模图像分类数据稀缺问题,提出LSADA方法,通过构建样本学习状态映射增强强度,采用解耦增强与扩散融合策略,在9个数据集上较SOTA动态GDA方法取得平均2.5%-4.5%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18523 2026-08-20 cs.CV cs.AI 新提交 57%

Prior-Conditioned Gaussian Discriminants for Generalizable AI-generated Image Detection

用于通用AI生成图像检测的先验条件高斯判别模型

Shashank Kotyan, Makoto Shing, Yuki Imajuku, Rujikorn Charakorn, Tarin Clanuwat

机构 * Sakana AI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对AI生成图像检测在多因素变化下失效的问题,提出先验条件高斯判别梯方法,在Percept-Lens数据集上验证其性能,推动相关报告与基线的优化。

Comments Accepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18516 2026-08-20 cs.CV cs.AI 新提交 57%

OptiModNet: A UNet-Transformer Hybrid with Grouped-Query and Channel Attention for Optic Disc and Cup Segmentation

OptiModNet:用于视盘和视杯分割的结合分组查询与通道注意力的UNet-Transformer混合模型

Soumili Ghosh, Debapriya Roy, Aryan Das, Bikash Santra

机构 * IEM Saltlake(IEM盐湖校区) Techno Main Salt Lake(Techno主盐湖校区) VIT Bhopal University(博帕尔维洛尔理工大学) IIT Jodhpur(焦特布尔印度理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出OptiModNet,一款用于视盘和视杯分割的轻量混合架构,结合分组查询与通道注意力及聚合金字塔损失,在REFUGE2数据集上实现超现有方法2.5%的最优性能,且仅需3.73 GFLOPs和1.93M参数,兼顾高性能与低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11108 2026-08-20 q-bio.NC cs.CV 57%

Simple Models, Rich Representations: Visual Decoding from Primate Intracortical Neural Signals

简单模型,丰富表征:从灵长类皮层神经信号进行视觉解码

Matteo Ciferri, Matteo Ferrante, Nicola Toschi

机构 * University of Rome, Tor Vergata Department of Biomedicine and Prevention(罗马大学Tor Vergata医学院与预防学院) A.A. Martinos Center for Biomedical Imaging(A.A. Martinos生物医学成像中心) Harvard Medical School/MGH, Boston (US)(哈佛医学院/麻省总医院,波士顿(美国))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种简单模型,通过结合时间注意力和浅层MLP,实现70%的图像检索准确率,优于传统方法,为脑机接口和语义解码提供新框架。

Comments Presented at "Foundation Models for the Brain and Body" - NeurIPS 2025 Workshop

Journal ref Imaging Neuroscience (2026) 4: IMAG.a.1299

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02473 2026-08-20 cs.CV cs.LG 版本更新 57%

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack:用于长上下文视频世界建模的动态帧压缩

Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。

Comments Published in TMLR (09/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19144 2026-08-20 cs.LG 新提交 50%

Bridge Graphical Models: Coupling, Projection, and Current-Preserving Dynamics for Generative Modeling

桥接图模型:用于生成建模的耦合、投影与保电流动力学

Tiantian Zhang

机构 * Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出桥接图模型(BGMs),定义马尔可化间隙作为生成模型桥到解码器压缩的不可约损失,通过实验验证其可作为桥和耦合设计的训练前诊断工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18227 2026-08-20 cs.RO 新提交 50%

Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics

用智能体机器人技术重新审视“Push-T”机器人操作任务

Shuangyu Xie, Kaiyuan Chen, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18783 2026-08-20 q-fin.PR math.PR q-fin.MF 新提交 50%

When to Sell an Asset? - A Distribution Builder Approach

何时出售资产?——一种分布构建器方法

Peter Carr, Stephan Sturm

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究基于分布构建器方法,将最优资产出售问题与Skorokhod嵌入问题关联,在资产服从几何布朗运动且目标分布特定时,可观察到风险-收益权衡。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏