arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2605.13910 2026-05-15 stat.ML cs.CV cs.LG 79%

Covariance-aware sampling for Diffusion Models

考虑协方差的扩散模型采样

Andrea Schioppa, Tim Salimans

机构 * GDM - Amsterdam(阿姆斯特丹GDM)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种考虑协方差的采样器,改进了扩散模型在少步 regime 中的像素空间采样质量。通过显式建模反向过程的协方差,结合 Tweedie 公式和结构化傅里叶空间分解,实现高效采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17353 2026-05-15 cs.CV cs.AI cs.LG eess.IV 79%

Dual Ascent Diffusion for Inverse Problems

双上升扩散用于逆问题

Minseo Kim, Axel Levy, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出双上升优化框架解决逆问题,提升图像质量与鲁棒性,改进扩散模型先验的MAP求解方法。

Comments Project page: https://soniaminseokim.github.io/ddiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13815 2026-05-14 cs.CV cs.RO 79%

OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation

OmniLiDAR:一个多领域3D激光雷达生成的统一扩散框架

Youquan Liu, Weidong Yang, Ao Liang, Xiang Xu, Lingdong Kong, Yang Wu, Dekai Zhu, Xin Li, Runnan Chen, Ben Fei, Tongliang Liu, Wanli Ouyang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computing, Department of Computer Science, National University of Singapore(新加坡国立大学计算机学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Technical University of Munich(慕尼黑技术大学) Nanjing University of Science and Technology(南京理工大学) Shanghai AI Laboratory(上海人工智能实验室) University of Sydney(悉尼大学) The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OmniLiDAR提出一种统一的文本条件扩散框架,生成跨八个领域的3D激光雷达扫描,通过跨域训练策略和特征建模提升多域生成能力,实验显示在数据增强和鲁棒性评估中表现优异。

Comments Preprint; 12 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13778 2026-05-14 cs.RO cs.CV 79%

Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs

实时-VLA FLASH:基于扩散模型的视觉-语言-动作模型的推测推理框架

Jiahui Niu, Kefan Gu, Yucheng Zhao, Shengwen Liang, Tiancai Wang, Xing Hu, Ying Wang, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学) Dexmal

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出实时-VLA FLASH框架,通过轻量级草案模型和主模型的Action Expert并行验证,实现低延迟高频率重规划,实验显示在LIBERO上任务性能保持良好,推理延迟降低至19.1ms。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13713 2026-05-14 cs.CV eess.IV 79%

Learning to Optimize Radiotherapy Plans via Fluence Maps Diffusion Model Generation and LSTM-based Optimization

通过束流图扩散模型生成和基于LSTM的优化学习优化放射治疗计划

Isabella Poles, Simon Arberet, Riqiang Gao, Martin Kraus, Marco D. Santambrogio, Florin C. Ghesu, Ali Kamen, Dorin Comaniciu

机构 * Politecnico di Milano(米兰理工学院) Digital Technology and Innovation, Siemens Healthineers(西门子医疗数字化技术与创新)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种扩散驱动的学习优化方法,用于端到端的VMAT计划,通过生成可行的束流图并利用LSTM优化模块提高计划效率和机器可交付性。

Comments Early Accept at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13316 2026-05-14 cs.CV 79%

Test-time Sparsity for Extreme Fast Action Diffusion

测试时稀疏性用于极端快速动作扩散

Kangye Ji, Yuan Meng, Jianbo Zhou, Ye Li, Chen Tang, Zhi Wang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出测试时稀疏性方法,通过动态预测可剪枝的残差计算来加速动作扩散,解决开放环境中的动态策略问题,实验表明在减少92% FLOPs的同时提升5倍生成速度,保持无损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13182 2026-05-14 cs.CV 79%

DiffST: Spatiotemporal-Aware Diffusion for Real-World Space-Time Video Super-Resolution

DiffST: 用于现实世界时空视频超分辨率的时空感知扩散模型

Zheng Chen, Ruofan Yang, Jin Han, Dehua Song, Zichen Zou, Chunming He, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Duke University(杜克大学) Huawei Consumer Business Group(华为消费者业务集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffST提出一种高效时空感知视频扩散框架,通过跨帧上下文聚合和视频表示引导提升时空信息利用,实现高效实时世界时空视频超分辨率。

Comments Code is available at: https://github.com/zhengchen1999/DiffST

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13041 2026-05-14 cs.CV 79%

EgoForce: Robust Online Egocentric Motion Reconstruction via Diffusion Forcing

EgoForce:通过扩散强迫实现鲁棒的在线自体视角运动重建

Inwoo Hwang, Donggeun Lim, Hojun Jang, Young Min Kim

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出EgoForce框架,通过扩散强迫方法实现从噪声自体视角输入中鲁棒的长时间全身体运动重建,优于现有在线和离线方法。

Comments Project page: https://inwoohwang.me/EgoForce

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13027 2026-05-14 cs.CV 79%

PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution

PRISM:基于先验校正和不确定性感知结构建模的扩散文本图像超分辨率

Zihang Xu, Xiaoyang Liu, Zheng Chen, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PRISM通过Flow-Matching Prior Rectification和Structure-guided Uncertainty-aware Residual Encoder解决文本超分辨率中的先验校正和局部结构细化问题,实现高精度文本生成。

Comments Code is available at https://github.com/faithxuz/PRISM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12957 2026-05-14 cs.CV 79%

GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion

GTA: 通过几何然后外观视频扩散推进图像到3D世界生成

Hanxin Zhu, Cong Wang, Peiyan Tu, Jiayi Luo, Tianyu He, Xin Jin, Zhibo Chen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GTA方法,通过几何先于外观的两阶段框架提升3D场景生成的结构精度和视觉质量,同时引入随机潜在shuffle策略和测试时缩放方案,实验表明其在保真度、视觉质量和几何准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29917 2026-05-14 cs.CV 79%

Diffusion-Based Feature Denoising with NNMF for Robust handwritten digit multi-class classification

基于NNMF的扩散特征去噪在鲁棒手写数字多类分类中的应用

Hiba Adil Al-kharsan, Róbert Rajkó

机构 * Doctoral School of Computer Science, University of Szeged(塞格德大学计算机科学博士学院) University Research and Innovation Center (EKIK), Óbuda University(奥布达大学研究与创新中心(EKIK))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结合扩散驱动特征去噪与混合特征表示的鲁棒多类分类框架,通过NNMF提取紧致可解释特征并结合CNN深度特征,提升噪声和对抗攻击下的分类鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01242 2026-05-14 cs.CV cs.AI cs.CL 79%

When Diffusion Breaks Constraints: Sequential Autoregressive Generation with RL and MCTS

当扩散模型失效约束:通过强化学习和MCTS的序列自回归生成

Zirui Zhao, Boye Niu, Harold Soh, David Hsu, Wee Sun Lee

机构 * Salesforce AI Research(Salesforce人工智能研究) University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散模型在约束生成任务中的失效模式,通过拼图生成和简化矩形组合任务,发现扩散模型难以满足约束,提出基于自回归序列生成的约束意识生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12587 2026-05-14 cs.CV 79%

TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking

TrackCraft3R:将视频扩散变换器重新用于密集3D跟踪

Jisu Nam, Jahyeok Koo, Soowon Son, Jaewoo Jung, Honggyu An, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TrackCraft3R,通过重新利用预训练的视频扩散变换器,实现了基于单目视频的密集3D跟踪,采用双潜表示和时间RoPE对齐设计,提升了跟踪性能和效率。

Comments Project page and code are available at https://cvlab-kaist.github.io/TrackCraft3r/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12480 2026-05-13 cs.CV cs.AI 79%

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

OmniNFT: 多模态联合音频视频生成的模态感知强化学习

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OmniNFT,通过模态感知强化学习框架解决多模态联合生成中的模态一致性、梯度不平衡和信用分配问题,提升音频视频感知质量与同步性能。

Comments Project page: https://zghhui.github.io/OmniNFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12431 2026-05-13 cs.CV 79%

GaitProtector: Impersonation-Driven Gait De-Identification via Training-Free Diffusion Latent Optimization

GaitProtector: 通过无训练扩散潜在优化实现基于伪装的步态去标识

Huiran Duan, Qian Zhou, Zhongliang Guo, Junhao Dong, Yuqi Li, Guoying Zhao, Yingli Tian

机构 * City University of New York(纽约城市大学) Wuhan University(武汉大学) University of Aberdeen(阿伯丁大学) Nanyang Technological University(南洋理工大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Oulu(奥卢大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GaitProtector框架,通过无训练扩散潜在优化实现基于伪装的步态去标识,通过伪装和伪装两个紧密耦合组件,在保持主导身体形状和运动动态的同时减少识别准确率。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12399 2026-05-13 cs.CV 79%

GeoQuery: Geometry-Query Diffusion for Sparse-View Reconstruction

GeoQuery: 用于稀疏视角重建的几何-查询扩散

Xiao Cao, Yuze Li, Youmin Zhang, Jiayu Song, Cheng Yan, Wen Li, Lixin Duan

机构 * University of Electronic Science Tianjin University Tianjin China Tianjin University

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GeoQuery,通过几何引导的扩散框架,在稀疏视角重建中有效减少渲染伪影。

Comments Accept to SIGGRAPH 2026 Conference Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12169 2026-05-13 cs.CV 79%

UniFixer: A Universal Reference-Guided Fixer for Diffusion-Based View Synthesis

UniFixer:一种通用参考引导的扩散基视图合成修复器

Sihan Chen, Xiang Zhang, Yang Zhang, Tunc Aydin, Christopher Schroers

机构 * ETH Zürich(苏黎世联邦理工学院) DisneyResearch|Studios(迪士尼研究实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UniFixer,通过粗到细策略修复扩散基视图合成中的多种退化问题,包括空间、时间及模型相关的退化,通过参考预对齐、全局结构锚定和局部细节注入模块实现高质量视图合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11898 2026-05-13 cs.CV 79%

Few-Shot Synthetic Data Generation with Diffusion Models for Downstream Vision Tasks

少样本合成数据生成与扩散模型用于下游视觉任务

Daniil Dushenev, Nazariy Karpov, Daniil Zinovjev, Alexander Gorin, Konstantin Kulikov

机构 * National University of Science and Technology MISIS(俄罗斯莫斯科国立研究型技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种轻量级合成数据增强方法,通过微调LoRA适配器和预训练扩散模型生成合成样本,提升罕见类别的召回率和F1分数,适用于不同视觉领域。

Comments 5 pages, 3 figures, 1 table. Accepted at SynData4CV Workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10916 2026-05-13 cs.CV cs.AI 79%

Confidence-Guided Diffusion Augmentation for Enhanced Bangla Compound Character Recognition

基于置信度引导的扩散增强法提升孟加拉语复合字符识别

Md. Sultan Al Rayhan

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种置信度引导的扩散增强框架,通过结合分类引导和改进的U-Net结构,提升低分辨率孟加拉语复合字符识别性能,实验表明在AIBangla数据集上多个模型的分类准确率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18152 2026-05-13 cs.CV cs.AI 79%

UnfoldLDM: Degradation-Aware Unfolding with Iterative Latent Diffusion Priors for Blind Image Restoration

UnfoldLDM: 基于迭代潜在扩散先验的退化感知展开网络用于盲图像恢复

Chunming He, Rihan Zhang, Zheng Chen, Bowen Yang, Chengyu Fang, Yunlong Lin, Yulun Zhang, Fengyang Xiao, Sina Farsiu

机构 * Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tsinghua University(清华大学) Xiamen University(厦门大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UnfoldLDM,结合深度展开网络与潜在扩散模型,解决盲图像恢复中的退化依赖和过平滑偏差问题,通过多粒度退化感知模块和退化抗性LDM提取先验,提升恢复质量与视觉效果。

Comments 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11758 2026-05-13 eess.IV cs.CV 79%

DiffSegLung: Diffusion Radiomic Distillation for Unsupervised Lung Pathology Segmentation

DiffSegLung: 基于扩散的放射组学蒸馏用于无监督肺部病理分割

Rezkellah Noureddine Khiati, Pierre-Yves Brillet, Catalin Fetita

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffSegLung,通过引入扩散放射组学蒸馏方法,利用手工制作的放射组学描述符作为物理基础的教师,引导3D扩散U-Net的瓶颈层,提升无监督肺部病理分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11628 2026-05-13 cs.CV 79%

Single-Shot HDR Recovery via a Video Diffusion Prior

单次曝光HDR恢复通过视频扩散先验

Chinmay Talegaonkar, Jinshi He, Christopher McKenna, Nicholas Antipa

机构 * University of California San Diego(加州大学圣地亚哥分校) Creare LLC(Creare公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过视频扩散模型生成曝光序列并融合生成HDR图像,提升单次曝光HDR重建的保真度和可解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11435 2026-05-13 cs.CV 79%

ZeroIDIR: Zero-Reference Illumination Degradation Image Restoration with Perturbed Consistency Diffusion Models

ZeroIDIR:基于扰动一致扩散模型的零参考照明退化图像恢复

Hai Jiang, Zhen Liu, Yinjie Lei, Songchen Han, Bing Zeng, Shuaicheng Liu

机构 * School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) University of Electronic Science and Technology of China(电子科技大学) College of Electronics and Information Engineering, Sichuan University(四川大学电子信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ZeroIDIR框架,通过自适应伽马校正模块和扰动一致性扩散模型,实现零参考照明退化图像恢复,提升恢复精度与稳定性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11424 2026-05-13 cs.CV 79%

VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors

VidSplat:基于几何引导视频扩散先验的高斯点云重建

Jimin Tang, Wenyuan Zhang, Junsheng Zhou, Zian Huang, Kanle Shi, Shenkun Xu, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University(清华大学软件学院) Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VidSplat通过几何引导的视频扩散先验,解决稀疏视图下3D场景重建问题,提出免训练生成框架,迭代合成新视角以恢复完整3D场景。

Comments Accepted by SIGGRAPH Conference 2026. Project Page: https://tangjm24.github.io/VidSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02043 2026-05-13 cs.CV cs.HC cs.LG 79%

Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers

基于扩散模型的零样本人体姿态估计

Sahil Bhandary Karnoor, Romit Roy Choudhury

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出InPose方法,通过预训练扩散模型和旋转测量条件,解决人体姿态估计中用户体型差异导致的泛化问题。

Comments Published as a Conference Paper at The Fourteenth International Conference on Learning Representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10717 2026-05-12 cs.LG cs.CV 79%

Heteroscedastic Diffusion for Multi-Agent Trajectory Modeling

异方差扩散用于多智能体轨迹建模

Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息学院,CSIC-UPC)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出U2Diffine模型,通过异方差不确定性估计提升多智能体轨迹补全与预测性能,结合Taylor近似和RankNN实现高效推理与误差概率评估,优于现有方法。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Extended version of arXiv:2503.18589 (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07429 2026-05-12 cs.CV 79%

Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework

通过扩散框架实现逼真且高效的bokeh渲染

Linxiao Shi, Siming Zheng, Zerong Wang, Hao Zhang, Jinwei Chen, Bo Li, Shifeng Chen, Peng-Tao Jiang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo BlueImage实验室,vivo移动通信有限公司) Shenzhen University of Advanced Technology(深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MagicBokeh框架,通过替代训练策略和聚焦感知的掩码注意力机制,联合优化bokeh渲染与超分辨率,提升可控性和视觉保真度,并引入降质感知深度模块以提高低质量输入的深度估计准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03639 2026-05-12 cs.CV 79%

Diffusion Masked Pretraining for Dynamic Point Cloud

动态点云的扩散掩码预训练

Zhuoyue Zhang, Jihua Zhu, Chaowei Fang, Jian Liu, Ajmal Saeed Mian

机构 * Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) University of Western Australia(西澳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiMP框架,通过引入扩散建模解决动态点云预训练中位置泄露和运动监督问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03239 2026-05-12 cs.CV 79%

COP-GEN: Latent Diffusion Transformer for Copernicus Earth Observation Data

COP-GEN:用于Copernicus地球观测数据的潜在扩散变换器

Miguel Espinosa, Eva Gmelich Meijling, Valerio Marsocci, Elliot J. Crowley, Mikolaj Czerkawski

机构 * School of Engineering University of Edinburgh(工程学院爱丁堡大学) European Space Agency (ESA)(欧洲航天局) Asterisk Labs(Asterisk实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 COP-GEN通过建模异质地球观测模态的联合分布,实现了多模态潜在扩散变换器,支持灵活的任意到任意条件生成,包括无需重新训练的零样本模态翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07756 2026-05-12 cs.CV 79%

Determinism of Randomness: Prompt-Residual Seed Shaping for Diffusion Generation

随机性的确定性:提示残差种子塑形用于扩散生成

Song Yan, Wei Zhai, Chenfeng Wang, Xinliang Bi, Jian Yang, Yancheng Cai, Yusen Zhang, Yunwei Lan, Tao Zhang, GuanYe Xiong, Min Li, Zheng-Jun Zha

机构 * USTC(中国科学技术大学) Li Auto Inc.(利亚自动化公司) Xi’an High-tech Research Institute(西安高新技术研究院) Wechat Vision(微信视觉) Cambridge University(剑桥大学) HUST(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散生成中种子敏感性,提出无需训练的提示残差种子塑形方法,通过单个高噪声冷启动提示残差提升生成对齐和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏