arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-28 至 2026-07-28 共收录 93 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2607.24353 2026-07-28 cs.CV 新提交 88%

PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

PRISM:通过基于图像的自我奖励机制进行文本到图像生成的提示优化

Guo Tang, HongJie Luo, Tianxu Wang, Ying Zhang, Hao Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Guangdong University of Technology(广东工业大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 针对文本到图像生成模型对提示制定敏感的问题,提出PRISM框架,通过基于图像的自我奖励机制,利用结构化视觉诊断和多任务监督微调等方法,提高图像质量和语义对齐,并提供可解释反馈。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24215 2026-07-28 cs.CV 新提交 79%

TreeAdapter: Hierarchical Taxonomy-Guided Adapter Composition for Fine-Grained Species Image Generation

TreeAdapter:用于细粒度物种图像生成的分层分类法引导适配器组合

Yuze Sun, Zhongjie Duan, Yingda Chen

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 针对通用文本到图像模型在生成稀有生物物种图像时性能下降的问题,提出TreeAdapter框架,利用分层分类数据,通过在分类树节点附加轻量级适配器及两阶段训练范式,实现准确的细粒度图像生成,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23271 2026-07-28 cs.CV cs.AI 新提交 70%

What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features

CLIP 所知道但无法表达的:从冻结的中间特征中恢复否定信息

Chen-Yi Lu, Yueh-Shao Chen, Somali Chaterji

机构 * Purdue University(普渡大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 对比视觉语言模型如CLIP对否定不敏感,研究发现是表征坍缩所致。提出轻量级事后校正系统PeakPatch,在不改变预训练权重下恢复否定信号,通过特定网络提取信号、预测偏差向量等,经实验验证其有效性及泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24729 2026-07-28 cs.CV 新提交 57%

MicroZoom: Structure-Preserving Detail Synthesis at Extreme Scale

MicroZoom:极端尺度下的结构保留细节合成

Huy Huynh, Jingwei Ma, Brian Curless, Ira Kemelmacher-Shlizerman, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 MicroZoom旨在解决微观尺度下基于参考的极端尺度超分辨率问题,通过两阶段级联设计,第一阶段恢复全局图案连贯性,第二阶段细化局部纹理细节,辅以分割掩码指导合成,实现了全局连贯、基于物质的千兆像素图像合成。

Comments Project page: https://microzoom-sr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22994 2026-07-28 cs.CV cs.LG 新提交 57%

Breaking the Synthetic-Real Domain Shortcut for Training-Free Generative Replay-based Class Incremental Learning

打破合成-真实域捷径用于无训练生成重放的类增量学习

Tao Zhang, Qixuan Fan, Yiyuan Liang, Yanjie Wang, Song Yan, Tian Tian, Jiahuan Zhou, Luxin Yan, Sheng Zhong, Xu Zou

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究类增量学习中合成旧数据与真实新数据混合导致性能下降的问题,提出DREAM模型,利用无训练生成器合成旧数据,通过子空间校正、正交投影及真实锚定原型正则化消除域捷径并加强语义对齐,取得最优性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2607.23920 2026-07-28 cs.CV 新提交 57%

What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape

我能编辑什么?开放式策略发现与情感可编辑性景观

Qing Li, Zeyu Dong, Yin Cui, Chuan Yan, Xiaojiang Peng

机构 * School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院) School of Innovation Design, Shenzhen Technology University(深圳技术大学创新设计学院) Stanford University(斯坦福大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究情感图像编辑,EmoScope多智能体框架将任务转变为‘能编辑什么’,先发现可编辑空间,再平衡内容与情感,通过情感条件作用的可供性推理选择策略,在大规模评估中受青睐,还指出相关指标盲点及优势变化情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 57%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24538 2026-07-28 cs.RO 新提交 50%

NEO: NeRF It Once, Edit It Many Times for Continuous Object Manipulation

NEO:一次性NeRF,多次编辑以进行连续物体操纵

Mikołaj Zieliński, David Hall, Dominik Belter, Peyman Moghadam

机构 * Institute of Robotics and Machine Intelligence, Poznan University of Technology(波兹南理工大学机器人与机器智能研究所) CSIRO Robotics, CSIRO(联邦科学与工业研究组织机器人部)

专题命中 图像编辑 :inpainting(abstract)

AI总结 本文提出NEO框架,用于机器人操纵的语言引导NeRF编辑。结合神经场重采样与多视图修复实现物体移除,利用知识蒸馏进行NeRF权重编辑,还创建了评估基准NEO-Dataset。该方法在场景编辑任务中表现出色,优于现有基线。

Comments Accepted to IEEE ROBOTICS AND AUTOMATION LETTERS (RA-L) JULY, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 68 篇

2607.22963 2026-07-28 eess.IV cs.CV 新提交 89%

PriSAR: 3D Geometric-Prior-Guided Diffusion for Parameter-Controlled SAR Image Generation

PriSAR:用于参数控制SAR图像生成的3D几何先验引导扩散

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 研究SAR图像在稀疏观测角度下的可控生成问题,提出用3D模型导出的几何先验引导扩散模型的方法,即GeoDiff-SAR,经实验在飞机和车辆数据集上取得较好结果,证明该轻量级3D几何先验可改善视点一致性,用作生成指导。

Comments 17 pages,15 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23488 2026-07-28 cs.LG cs.CV 新提交 85%

Learning Sampling Parameters for Diffusion Models

学习扩散模型的采样参数

Arisrei Lim, Yossi Gandelsman

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究针对扩散模型推理时采样参数固定的问题,提出LeSAMP框架,将参数选择转化为强化学习问题,通过人类偏好模型和VLM评判优化,实验表明该方法相比基线有更高胜率,为改进扩散模型输出提供补充途径。

Comments Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24249 2026-07-28 cs.CV cs.RO 新提交 83%

SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation

SILICA:将扩散先验用于联合玻璃分割和深度估计

Tarun R, Anuj Verma, Laksh Nanwani, Sourav Garg, K. Madhava Krishna

机构 * Robotics Research Center (RRC), IIIT Hyderabad(海得拉巴国际信息技术研究所机器人研究中心)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究透明表面深度估计难题,提出SILICA统一管道,利用文本到图像扩散模型先验联合预测玻璃分割和深度,无需真实世界玻璃深度注释,经实验验证其在不同环境中零样本转移性能出色,优于现有模型。

Comments IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23937 2026-07-28 cs.CV 新提交 83%

Manifold-Constrained Noise Optimization for Diverse Diffusion Sampling

用于多样化扩散采样的流形约束噪声优化

Qitan Shi, Cheng Jin, Ziyuan Liu, Yuantao Gu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究如何在推理时优化初始噪声以恢复几步蒸馏扩散模型的提示多样性。提出MoNO方法,在低维噪声流形上进行流形约束噪声优化,能大步长更新且无需辅助目标,实验表明该方法可保持图像质量并提升提示多样性。

Comments 19 pages, 14 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24110 2026-07-28 cs.CV cs.LG physics.optics 新提交 83%

BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion

超越融合:用于无校准红外超分辨率和红外-可见光融合的自对齐潜在扩散

Minchong Chen, Xiaoyun Yuan, Minyu Cao, Jianing Zhang, Jun Zhang, Shuyang Liu, Xiaokang Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对移动红外-可见光成像中跨传感器未对准问题,提出超越融合框架,通过引入跨模态自对齐模块及未对准增强模块,实现无校准条件下的红外超分辨率和红外-可见光融合,经实验验证了其有效性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24665 2026-07-28 cs.CV cs.GR cs.LG 新提交 81%

MMOE: Modernizing Diffusion Transformers with Efficient Expert Design

MMOE:通过高效专家设计使扩散变压器现代化

Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong Li

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 研究AIGC基础模型中扩散变压器未平衡质量与成本问题,提出MMOE对其现代化改造,将多种专家设计应用于AIGC生成,实验表明MMOE能达更好质量成本平衡,使AIGC基础模型可循大语言模型平衡扩展路径。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24124 2026-07-28 cs.CV 新提交 79%

ViDS: Video Diffusion Shader using 3D Face Tracking

ViDS:使用3D面部跟踪的视频扩散着色器

Wenbo Ji, Davide Davoli, Zhe Chen, Liam Schoneveld, Matthias Nießner, Jiapeng Tang

机构 * Technical University of Munich(慕尼黑工业大学) Toyota Motor Europe NV/SA(丰田汽车欧洲股份公司) Woven by Toyota(丰田编织)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究利用3D面部跟踪实现肖像动画,先重建3DMM网格,再用驱动视频参数动画处理,借助视频扩散模型合成动画,引入自回归扩散采样过程,相比之前方法能更精细控制表情姿势,且保留身份外观,消融研究验证了有效性。

Comments 12 pages, 6 figures, and 8 tables. Project page: https://fusheng-ji.github.io/ViDS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23844 2026-07-28 cs.CV 新提交 79%

OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models

OmniCache:用于扩散模型的多维分层特征缓存

Zhaoyuan He, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对高分辨率图像和视频扩散模型推理成本高的问题,提出OmniCache框架,利用中间扩散特征冗余,通过多种缓存实现多维特征重用,减少推理延迟,在多模型上取得良好效果,且无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23680 2026-07-28 cs.CV 新提交 79%

Perturbation-Aware Diffusion-Guided Hybrid Segmentation for Robust and Annotation-Efficient Plant Stress Phenotyping

用于稳健且标注高效的植物胁迫表型分析的扰动感知扩散引导混合分割

Gurbhit Chaurakoti, Soumyashree Kar

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对农业图像语义分割实际部署问题,提出扩散引导混合分割框架,通过多种实验评估,结果显示最佳模型标注效率高,适应后模型可转移,表明合理配对主干和细化器并结合扰动感知再训练可提升分割效果和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22719 2026-07-28 cs.CV 新提交 79%

$γ$-Bridge: A Look-Parametric Diffusion Bridge

γ-桥:一种外观参数化扩散桥

Xuran Hu, Yujie Zhu, Tengxi Wang, Jilong Li, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Macquarie University(麦考瑞大学) Ningxia University(宁夏大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对乘法伽马噪声在相干成像中的问题,提出γ-桥这一外观参数化扩散桥,通过特定调度连接噪声观测与干净极限,结合均匀补丁外观估计器,能处理多传感器数据,实现零样本恢复且结果领先,还提供可物理解释的控制。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22696 2026-07-28 cs.CV cs.AI 新提交 79%

MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion

MegaSlide-DiT:用于高效视频扩散的以内存为中心的自适应和可变形局部注意力

Jiacheng Liu, Jason Liu

机构 * Trendinsight Lab / UC San Diego(趋势洞察实验室/加州大学圣地亚哥分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对高分辨率视频扩散模型内存消耗大问题,提出MegaSlide-DiT,通过让GPU不持有模型状态及用3D-DSA取代全局注意力,降低内存和计算复杂度,实现105B DiT在单H200 GPU上的适配,为大规模视频扩散模型全参数适配提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22544 2026-07-28 cs.AI cs.CV 新提交 79%

Concept-based Visual Counterfactual Explanations with Diffusion Models

基于扩散模型的基于概念的视觉反事实解释

Yassine Oueslati, Daniil Kirilenko, Martin Gjoreski, Marc Langheinrich

机构 * Università della Svizzera italiana(瑞士意大利语区大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究视觉反事实解释问题,提出C-VCE框架,通过概念瓶颈层将分类器融入生成模型,由概念引导反事实解释,在采样时可切换概念,添加正则化器和掩码控制编辑,在基准测试中表现良好,是实用工具且为模型理解和使用提供新思路。

Comments Accepted at the 4th World Conference on eXplainable Artificial Intelligence (XAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24507 2026-07-28 cs.LG cs.AI 新提交 78%

UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective

统一融合:在统一反向速率目标下将自回归语言模型适配到离散扩散

Xiaoyi Jiang, Jingyuan Li, Yixuan Jiang, Wei Liu, Yi Zhu, Zuoqiang Shi, Pipi Hu

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院) Wuhan University(武汉大学) MathonAI(未知(暂未找到合适中文翻译))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究旨在将预训练的自回归语言模型适配到均匀噪声扩散。通过建立不同模型间联系并推导转换,提出UNIFUSION方法。经实验评估,该方法能改善生成困惑度与单字熵权衡,在相同规模模型中多项指标表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24306 2026-07-28 cs.CL 新提交 78%

Rethinking the Generation Order of Block Diffusion Language Models

重新思考块扩散语言模型的生成顺序

Kai Syun Hou, James Kwok

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究块扩散语言模型的采样,基于其更适合从左到右解码的特点,提出并行自回归解码方法PARD,该方法无需训练,能保留结构并允许并行令牌承诺,实验证明其在生成质量和速度上优于现有方法。

Comments 20 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24296 2026-07-28 cs.RO 新提交 78%

PAC-DP: PAC-Bayesian Diffusion Policy Learning

PAC-DP:PAC贝叶斯扩散策略学习

Mohammad Hasan Yeganegi, Dian Yu, Andrea Del Prete, Majid Khadiv, Matteo Saveriano

机构 * University of Trento(特伦托大学) Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散策略在有限数据下泛化控制有限的问题,提出PAC-DP,将DP建模为贝叶斯神经网络并定义泛化界导出新训练目标。该方法理论上规范DP训练,实验显示在多基准测试中性能提升,尤其在低数据和复杂任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23134 2026-07-28 cs.LG cs.SY eess.SY 新提交 78%

Diffusion-Guided Search via Exponential Tilting (DiffTilt): An Application to Falsification of Safety-Critical Systems

通过指数倾斜的扩散引导搜索(DiffTilt):在安全关键系统证伪中的应用

Tanmay Khandait, Preetom Biswas, Hideki Okamoto, Bardh Hoxha, Georgios Fainekos, Giulia Pedrielli

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) Toyota Motor North America, Research & Development(丰田汽车北美研发公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对自主和网络物理系统安全关键故障发现难题,提出DiffTilt框架,通过指数倾斜扩散模型诱导分布进行引导搜索,放大故障概率,优于条件采样,在基准测试中表现良好,提升了证伪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22661 2026-07-28 cs.AI 新提交 78%

TRE: Training-Free Hallucination Detection for Diffusion Language Models

TRE:用于扩散语言模型的无训练幻觉检测

Pengcheng Weng, Yanyu Qian, Yue Tan, Yixin Liu

机构 * University of Bern(伯尔尼大学) Nanyang Technological University(南洋理工大学) Griffith University(格里菲斯大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散语言模型的幻觉问题,现有方法有局限。本文提出无训练的TRE指标,通过在模型解码过程中沿时空维度提取熵信号来估计幻觉风险,经实验验证其性能有竞争力,具有泛化性、效率和鲁棒性等优点。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22634 2026-07-28 cs.AI 新提交 78%

PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding

PRESTO:用于扩散推测解码的前缀对齐树草稿生成

Zheng Wang, Zhifan Ye, Qi Cheng, Yonggan Fu, Ziyan Wang, Feng Zhu, Haozhe Zhao, Jan Kautz, Pavlo Molchanov, Humphrey Shi, Minjia Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散大语言模型用于推测解码时现有方法的局限,提出PRESTO框架,通过前缀对齐评分和基于优先级的树搜索,解决扩散草稿与前缀验证不匹配问题,在多种基准测试中显著提升了端到端吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22599 2026-07-28 cs.AI 新提交 78%

Differencing the Diffusion Trajectory toward Uncertain Components for Time Series Forecasting

针对时间序列预测,向不确定成分差分扩散轨迹

Chen Su, Yuanhe Tian, Yan Song

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对时间序列预测中未来与历史的不对称问题,提出DiffDiff扩散框架,将可预测性不对称嵌入扩散轨迹,使前向算子依赖步骤,在多基准测试中优于基线,能集中精力于目标最不确定成分,减轻重建历史锚定内容负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24324 2026-07-28 stat.ME math.ST stat.TH 新提交 78%

Diffusion Bootstrap for High-Dimensional Linear Models

高维线性模型的扩散自举法

Ce Liang, Wei Ma

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究高维线性模型中经典自举法的不足,提出基于扩散的配对自举法,通过学习生成律取代经验联合分布,经理论论证和实验验证,该方法能改善方差校准及I型错误校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23947 2026-07-28 eess.SY cs.SY math.OC 新提交 78%

Reverse-Time Diffusion Processes for Discrete Time Linear and Nonlinear Systems with non-Gaussian Noise

具有非高斯噪声的离散时间线性和非线性系统的反向时间扩散过程

Soura Dasgupta, Brian D. O. Anderson, Raghuraman Mudumbai

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对具有非高斯噪声的离散时间线性和非线性系统,建立了直接找到反向扩散的理论,给出正向线性且噪声高斯时反向模型为输入仿射的条件,揭示多种状态密度下不存在输入仿射反向扩散及与连续时间对应方程反转的差异。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23226 2026-07-28 cs.LG math.ST stat.TH 新提交 78%

From Score Learning to Discretized Sampling: An End-to-End Generalization Analysis of Diffusion Models

从得分学习到离散采样:扩散模型的端到端泛化分析

Jinshu Huang, Yiming Jiang, Chunlin Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究基于实际残差网络架构的得分扩散模型,建立统一收敛和泛化框架,分析从得分函数学习到采样过程的特性,将生成误差分解为四个分量,定量刻画训练样本大小等因素对扩散模型样本保真度的控制。

详情

展开后加载摘要…

URL PDF HTML 收藏