arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2601.20499 2026-01-29 cs.CV 79%

Efficient Autoregressive Video Diffusion with Dummy Head

高效的自回归视频扩散模型与Dummy头

Hang Guo, Zhaoyang Jia, Jiahao Li, Bin Li, Yuanhao Cai, Jiangshan Wang, Yawei Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Johns Hopkins University(约翰霍普金斯大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Dummy Forcing方法,通过优化多头自注意力机制的内存分配和上下文管理,提升视频扩散模型的生成速度,同时保持高质量输出。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20310 2026-01-29 cs.CR cs.CV cs.LG 79%

SemBind: Binding Diffusion Watermarks to Semantics Against Black-Box Forgery Attacks

SemBind: 通过学习语义遮罩将潜在信号绑定到图像语义以对抗黑盒伪造攻击

Xin Zhang, Zijin Yang, Kejiang Chen, Linfeng Ma, Weiming Zhang, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China, Anhui, China(中国科学技术大学网络安全学院) Anhui Province Key Laboratory of Digital Security, Anhui, China(安徽省数字安全重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SemBind通过学习语义遮罩将潜在信号绑定到图像语义,以对抗黑盒伪造攻击,提高水印的抗伪造能力和鲁棒性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20304 2026-01-29 cs.CV cs.AI 79%

Structure-constrained Language-informed Diffusion Model for Unpaired Low-dose Computed Tomography Angiography Reconstruction

结构约束的语言引导扩散模型用于无配对低剂量计算机断层扫描血管造影重建

Genyuan Zhang, Zihao Wang, Zhifan Gao, Lei Xu, Zhen Zhou, Haijun Yu, Jianjia Zhang, Xiujian Liu, Weiwei Zhang, Shaoyu Wang, Huazhu Fu, Fenglin Liu, Weiwen Wu

机构 * Key Lab of Optoelectronic Technology and Systems and Engineering Research Center of Industrial Computed Tomography Nondestructive Testing, Ministry of Education, Chongqing University(光电技术与系统国家重点实验室和工业计算机断层非破坏检测工程研究中心,教育部,重庆大学) School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) Department of Radiology, Beijing Anzhen Hospital, Capital Medical University(北京安贞医院放射科,首都医科大学) School of Information Engineering, Nanchang, Jiangxi(信息工程学院,南昌,江西) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(高性能计算研究所(IHPC),科技研究局(A*STAR))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结构约束的语言引导扩散模型,通过整合结构协同和空间智能,提升低剂量CT血管造影重建的准确性与对比度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19785 2026-01-29 cs.CV 79%

GeoDiff3D: Self-Supervised 3D Scene Generation with Geometry-Constrained 2D Diffusion Guidance

GeoDiff3D: 基于几何约束的2D扩散引导的自监督3D场景生成

Haozhi Zhu, Miaomiao Zhao, Dingyao Liu, Runze Tian, Yan Zhang, Jie Guo, Fenggen Yu

机构 * Nanjing University(南京大学) Simon Fraser university(西蒙弗雷泽大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GeoDiff3D通过几何约束的2D扩散模型和自监督机制,实现高效且高质量的3D场景生成,减少对标注数据的依赖,提升复杂场景的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19073 2026-01-29 cs.CV eess.IV eess.SP 79%

WaveletGaussian: Wavelet-domain Diffusion for Sparse-view 3D Gaussian Object Reconstruction

WaveletGaussian: 基于小波域的稀疏视角3D高斯物体重建

Hung Nguyen, Runfa Li, An Le, Truong Nguyen

机构 * Video Processing Lab, UC San Diego(UC San Diego视频处理实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WaveletGaussian通过将扩散模型应用于小波域的低分辨率子带,结合高效在线随机掩码策略,实现了更高效的稀疏视角3D高斯物体重建。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10601 2026-01-29 q-bio.QM cs.CV cs.LG eess.IV stat.ME 79%

AGFS-Tractometry: A Novel Atlas-Guided Fine-Scale Tractometry Approach for Enhanced Along-Tract Group Statistical Comparison Using Diffusion MRI Tractography

AGFS-束测:一种基于图谱的精细束测方法,用于利用弥散MRI束图进行增强的沿束群体统计比较

Ruixi Zheng, Wei Zhang, Yijie Li, Xi Zhu, Zhou Lan, Jarrett Rushmore, Yogesh Rathi, Nikos Makris, Lauren J. O'Donnell, Fan Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里奇曼妇女医院) Boston University(波士顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 AGFS-束测提出了一种基于图谱的精细束测方法,通过利用弥散MRI束图信息和排列检验,提高沿束群体统计比较的敏感性和特异性,有效识别白质群体差异。

Comments 31 pages and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16512 2026-01-29 cs.CV cs.AI 79%

Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection

超越人脸交换:一种基于扩散模型的多模态深度伪造检测基准

Jiaxin Liu, Jia Wang, Saihui Hou, Min Ren, Huijia Wu, Long Ma, Renwang Pei, Zhaofeng He

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DigiFakeAV数据集和DigiShield检测模型,用于多模态深度伪造检测,通过融合时空和跨模态特征提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22349 2026-01-29 cs.CV 79%

GCRayDiffusion: Pose-Free Surface Reconstruction via Geometric Consistent Ray Diffusion

GCRayDiffusion:基于几何一致射线扩散的无姿态表面重建

Li-Heng Chen, Zi-Xin Zou, Chang Liu, Tianjiao Jing, Yan-Pei Cao, Shi-Sheng Huang, Hongbo Fu, Hua Huang

机构 * Beijing Normal University(北京师范大学) VAST(中国科学院软件研究所) Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GCRayDiffusion通过几何一致射线扩散实现无姿态表面重建,提升稀疏视角下的3D一致性与精度。

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (ICCV), 2025, pp. 25335-25345

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01262 2026-01-29 cs.CV cs.LG 79%

Improving Fine-Grained Control via Aggregation of Multiple Diffusion Models

通过聚合多个扩散模型实现更精细的控制

Conghan Yue, Zhengwei Peng, Shiyan Du, Zhi Ji, Chuangjian Cai, Le Wan, Dongyu Zhang

机构 * Sun Yat-Sen University(中山大学) Game AI Center, Tencent(腾讯游戏AI中心) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AMDM算法,通过聚合多个扩散模型实现无需训练的细粒度生成控制,提升生成质量和一致性,减少复杂数据集和模型架构设计的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02625 2026-01-29 cs.CV 79%

Diffusion Noise Feature: Accurate and Fast Generated Image Detection

扩散噪声特征:准确且快速的生成图像检测

Yichi Zhang, Xiaogang Xu

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出扩散噪声特征(DNF)以提高生成图像检测的准确性和泛化能力,通过训练ResNet-50实现高鲁棒性的检测。

Comments Accepted by ECAI 2025

Journal ref ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03252 2026-01-28 cs.LG cs.AI cs.CV 79%

Universal Multi-Domain Translation via Diffusion Routers

通用多领域翻译 via 扩散路由器

Duc Kieu, Kien Do, Tuan Hoang, Thao Minh Le, Tung Kieu, Dang Nguyen, Thin Nguyen

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德肯大学应用人工智能计划,澳大利亚) Pennsylvania State University, USA(宾夕法尼亚州立大学,美国) Aalborg University, Denmark(奥胡斯大学,丹麦)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出扩散路由器(DR)框架,通过中心域路由实现多领域翻译,实现通用多领域翻译任务,提升翻译效率与任务多样性。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15809 2026-01-28 cs.CV cs.LG physics.geo-ph stat.AP 79%

Diffusion models for multivariate subsurface generation and efficient probabilistic inversion

扩散模型用于多变量地下生成及高效的概率反演

Roberto Miele, Niklas Linde

机构 * Institute of Earth Sciences University of Lausanne(地球科学研究所 雅各布大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的多变量地下生成与高效概率反演方法,通过改进的后验采样方法提升了统计鲁棒性和计算效率。

Comments 35 p., 16 figs. This updated version corrects an error with the analysis of the denoising scores' magnitudes in the results section. The discussion and conclusions of our study remain unchanged. The scores' trends were erroneously reported with inverted time-step order, now fixed in Figure 5a and b (now with the correct increasing trends) and in the corresponding analysis in the Results section

Journal ref Comput. Geosci. 207 (2026) 106076

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01573 2026-01-28 cs.CV 79%

A Gift from the Integration of Discriminative and Diffusion-based Generative Learning: Boundary Refinement Remote Sensing Semantic Segmentation

整合判别与基于扩散的生成学习:边界细化遥感语义分割

Hao Wang, Keyan Hu, Xin Guo, Haifeng Li, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) College of Computer Science, Inner Mongolia University(计算机学院,内蒙古大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出IDGBR框架,整合判别与生成学习,通过粗分割图与原始图像的联合学习,利用迭代去噪扩散过程实现遥感图像边界精细化分割。

Comments Accepted for publication in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03623 2026-01-28 cs.CV 79%

Bounding Box-Guided Diffusion for Synthesizing Industrial Images and Segmentation Map

边界框引导的扩散模型用于合成工业图像和分割图

Emanuele Caruso, Alessandro Simoni, Francesco Pelosin

机构 * Covision Lab(科维森实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的边界框引导方法,用于生成高保真的工业图像和分割图,提升缺陷一致性和空间准确性,通过定量指标评估方法有效性,推动更可靠的分割模型发展。

Comments Accepted at Synthetic Data for Computer Vision Workshop - CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11946 2026-01-28 cs.CV 79%

R-Meshfusion: Reinforcement Learning Powered Sparse-View Mesh Reconstruction with Diffusion Priors

R-Meshfusion:基于强化学习的扩散先验的稀疏视图网格重建

Haoyang Wang, Liming Liu, Peiheng Wang, Junlin Hao, Jiangkai Wu, Xinggong Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 R-Meshfusion通过扩散模型与强化学习结合,提升稀疏视图下网格重建的几何与渲染质量。

Comments needs to be revised and updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09665 2026-01-28 cs.CV 79%

Revealing Subtle Phenotypes in Small Microscopy Datasets Using Latent Diffusion Models

利用潜在扩散模型揭示小样本显微图像中的细微表型

Anis Bourou, Biel Castaño Segade, Thomas Boyer, Valérie Mezger, Auguste Genovesio

机构 * Ecole Normale Supérieure(法国国家科学研究院) Université Paris Cité(巴黎cité大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用预训练的潜在扩散模型,在小样本显微图像中有效检测细微表型变化。

Comments Published to CVPR CVDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23530 2026-01-28 cs.CV cs.AI 79%

There and Back Again: On the relation between Noise and Image Inversions in Diffusion Models

往返之间:关于扩散模型中噪声与图像逆向之间的关系

Łukasz Staniszewski, Łukasz Kuciński, Kamil Deja

机构 * Warsaw University of Technology(华沙技术大学) IDEAS Research Institute(IDEAS研究机构) University of Warsaw(华沙大学) Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所) IDEAS NCBR

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散模型中噪声与图像逆向之间的关系,通过替换DDIM逆向步骤为正向扩散过程,解相关潜在编码并提升编辑与插值质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04560 2026-01-28 cs.CV 79%

Joint Diffusion for Universal Hand-Object Grasp Generation

联合扩散用于通用手-物体抓取生成

Jinkun Cao, Jingyuan Liu, Kris Kitani, Yi Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe(Adobe公司) Roblox(Roblox公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出联合手-物体扩散模型,通过统一潜在表示生成手和物体的抓取,利用大规模物体数据提升通用性,实现无条件和条件抓取生成。

Comments accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18556 2026-01-27 cs.CV cs.LG 79%

Generative Diffusion Augmentation with Quantum-Enhanced Discrimination for Medical Image Diagnosis

生成扩散增强与量子增强判别用于医学图像诊断

Jingsong Xia, Siqi Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SDA-QEC通过生成扩散增强与量子增强判别技术,提升医学图像分类的诊断准确性与平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18168 2026-01-27 cs.CV 79%

TempDiffReg: Temporal Diffusion Model for Non-Rigid 2D-3D Vascular Registration

TempDiffReg:用于非刚性2D-3D血管配准的时序扩散模型

Zehua Liu, Shihao Zou, Jincai Huang, Yanfang Zhang, Chao Tong, Weixin Si

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(北京航空航天大学虚拟现实技术与系统国家重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(中国科学院深圳先进技术研究所) School of Computer Science and Control Engineering, Shenzhen University of Advanced Technology, Shenzhen, China(深圳先进技术大学计算机科学与控制工程学院) Department of Interventional Radiology, Shenzhen People’s Hospital, Shenzhen, China(深圳人民医院介入放射科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TempDiffReg通过时序扩散模型和结构感知视角n点模块,实现高精度的2D-3D血管配准,提升TACE手术的准确性和安全性。

Comments Accepted by IEEE BIBM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18832 2026-01-27 cs.CV 79%

Localizing Knowledge in Diffusion Transformers

在扩散变换器中定位知识

Arman Zarei, Samyadeep Basu, Keivan Rezaei, Zihao Lin, Sayan Nag, Soheil Feizi

机构 * University of Maryland(马里兰大学) University of California, Davis(加州大学戴维斯分校) Adobe(Adobe公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种方法,用于在扩散变换器中定位特定类型的知识,通过评估不同模型和知识类别,实现了高效且有针对性的模型更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17228 2026-01-27 cs.CV q-bio.QM 79%

Semi-Supervised Domain Adaptation with Latent Diffusion for Pathology Image Classification

半监督域适应与潜在扩散用于病理图像分类

Tengyue Zhang, Ruiwen Ding, Luoting Zhuang, Yuxiao Wu, Erika F. Rodriguez, William Hsu

机构 * Medical & Imaging Informatics, Department of Radiological Sciences, David Geffen School of Medicine, University of California, Los Angeles(医学与影像信息学系,放射科学系,大卫·盖弗医学院,加州大学洛杉矶分校) Bioengineering Department, Henry Samueli School of Engineering, UCLA(生物工程系,亨利·萨缪尔西工程学院,UCLA) Department of Pathology & Laboratory Sciences, David Geffen School of Medicine, UCLA(病理学与实验室科学系,大卫·盖弗医学院,UCLA)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出利用潜在扩散模型生成目标领域意识的合成数据,提升计算病理学中的域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10917 2026-01-27 cs.CV cs.AI cs.LG 79%

Self-learned representation-guided latent diffusion model for breast cancer classification in deep ultraviolet whole surface images

自学习表征引导的潜在扩散模型用于深紫外全表面图像中的乳腺癌分类

Pouya Afshin, David Helminiak, Tianling Niu, Julie M. Jorns, Tina Yen, Bing Yu, Dong Hye Ye

机构 * Department of Computer Science, Georgia State University(计算机科学系,佐治亚州立大学) Department of Electrical and Computer Engineering, Marquette University(电气与计算机工程系,马基特大学) Joint Dept. of Biomedical Eng., Marquette Univ. and Med. Coll. of Wisconsin(马基特大学与威斯康星医学院联合生物医学工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出自监督学习引导的潜在扩散模型,通过生成高质量合成数据提升深紫外全表面图像中乳腺癌分类的准确率和FID分数。

Comments This paper has been accepted for the IEEE International Symposium on Biomedical Imaging (ISBI) 2026, London, UK, and will be presented in the corresponding session

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03502 2026-01-27 eess.IV cs.AI cs.GR 79%

DC-VSR: Spatially and Temporally Consistent Video Super-Resolution with Video Diffusion Prior

DC-VSR: 基于视频扩散先验的时空一致视频超分辨率

Janghyeok Han, Gyujin Sim, Geonung Kim, Hyun-seung Lee, Kyuha Choi, Youngseok Han, Sunghyun Cho

机构 * POSTECH Visual Display Business, Samsung Electronics(视觉显示业务,三星电子)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 DC-VSR通过引入空间和时间注意力传播机制及细节抑制自注意力引导,实现了视频超分辨率的时空一致性与高质量纹理恢复。

Comments Equal contributions from first two authors

Journal ref In Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers (SIGGRAPH Conference Papers 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12948 2026-01-26 cs.CV 79%

GazeD: Context-Aware Diffusion for Accurate 3D Gaze Estimation

GazeD: 基于上下文的扩散模型用于精确的3D凝视估计

Riccardo Catalini, Davide Di Nucci, Guido Borghi, Davide Davoli, Lorenzo Garattoni, Gianpiero Francesca, Yuki Kawana, Roberto Vezzani

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) Toyota Motor Europe(丰田欧洲公司) Woven by Toyota(丰田编织)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GazeD通过结合扩散模型和上下文信息,实现了精确的3D凝视估计,超越了依赖时间信息的方法。

Comments Accepted at 3DV 2026. Project page: https://aimagelab.ing.unimore.it/go/gazed

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10940 2026-01-26 cs.CV cs.AI 79%

OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis

OmniView: 一种用于3D和4D视图合成的全视角扩散模型

Xiang Fan, Sharath Girish, Vivek Ramanujan, Chaoyang Wang, Ashkan Mirzaei, Petr Sushko, Aliaksandr Siarohin, Sergey Tulyakov, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Snap Inc.(Snap公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OmniView是一种统一的扩散模型,能够泛化多种4D一致性任务,通过空间、时间和视图条件的灵活组合提升视频生成质量与相机控制精度。

Comments Project page: https://snap-research.github.io/OmniView/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05964 2026-01-26 cs.CV 79%

T-LoRA: Single Image Diffusion Model Customization Without Overfitting

T-LoRA: 单张图像扩散模型定制化无需过拟合

Vera Soboleva, Aibek Alanov, Andrey Kuznetsov, Konstantin Sobolev

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 T-LoRA通过时间步依赖的低秩适应框架实现单张图像扩散模型定制化,有效避免过拟合,提升概念保真度与文本对齐的平衡。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15441 2026-01-23 cs.LG cs.CV 79%

CASL: Concept-Aligned Sparse Latents for Interpreting Diffusion Models

CASL: 用于解释扩散模型的概念对齐稀疏潜在表示

Zhenghao He, Guangzhi Xiong, Boyang Wang, Sanchit Sinha, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CASL通过监督框架将扩散模型的稀疏潜在维度与语义概念对齐,提升生成图像的解释性和编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15250 2026-01-22 cs.CV cs.RO 79%

FlowSSC: Universal Generative Monocular Semantic Scene Completion via One-Step Latent Diffusion

FlowSSC: 通过一步潜在扩散实现通用生成单目语义场景补全

Zichen Xi, Hao-Xiang Chen, Nan Xue, Hongyu Yan, Qi-Yuan Feng, Levent Burak Kara, Joaquim Jorge, Qun-Ce Xu

机构 * Ant Group(蚂蚁集团) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Instituto Superior Técnico(里斯本大学理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FlowSSC通过一步潜在扩散模型实现高效单目语义场景补全,显著提升性能并适用于自动驾驶系统。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15221 2026-01-22 cs.CV 79%

ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation

ScenDi: 3D到2D场景扩散级联用于城市生成

Hanlei Guo, Jiahao Shao, Xinya Chen, Xiyang Tan, Sheng Miao, Yujun Shen, Yiyi Liao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ScenDi通过整合3D和2D扩散模型,解决3D城市生成中外观细节与相机可控性的平衡问题,实现高质量场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏