arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70082 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2409.10141 2026-07-01 cs.CV 版本更新 79%

PSHuman: Photorealistic Single-image 3D Human Reconstruction using Cross-Scale Multiview Diffusion and Explicit Remeshing

PSHuman: 使用跨尺度多视图扩散和显式重网格化的逼真单图像三维人体重建

Peng Li, Wangguandong Zheng, Yuan Liu, Tao Yu, Yangguang Li, Xingqun Qi, Xiaowei Chi, Siyu Xia, Yan-Pei Cao, Wei Xue, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Southeast University(东南大学) Tsinghua University(清华大学) VAST

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PSHuman框架,通过跨尺度多视图扩散和SMPL-X条件生成,解决单视图人体重建中的几何失真和自遮挡问题,实现高保真几何与纹理重建。

Comments CVPR2025, Project page: https://penghtyx.github.io/PSHuman

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30417 2026-06-30 cs.CV cs.AI 79%

Beyond Point Estimates for Glaucoma Visual Field Forecasting with Diffusion Models

超越点估计:基于扩散模型的青光眼视野预测

Marta Colmenar Herrera, Pablo Márquez Neila, Şerife Seda Kucur Ergünay, Martin S. Zinkernagel, Raphael Sznitman

机构 * ARTORG Center for Biomedical Engineering Research, UniBe, Switzerland(瑞士UniBe生物医学工程研究中心ARTORG) PeriVision SA, Epalinges, Switzerland(瑞士Epalinges市PeriVision公司) Department of Ophthalmology, Inselspital, Bern, Switzerland(瑞士伯恩Inselspital眼科部门)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出使用条件去噪扩散模型进行概率性视野预测,生成未来视野的分布,实现校准良好的预测,并在点估计上达到最先进精度,支持从点估计向不确定性感知的临床风险评估转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30012 2026-06-30 cs.CV 79%

SkelEM: Training-Signal Decoupling of Skeleton and Diffusion for Self-supervised Axial Super-Resolution in Volume Microscopy

SkelEM:用于体积显微镜中自监督轴向超分辨率的骨架与扩散训练信号解耦

Bohao Chen, Yanchao Zhang, Yanan Lv, Chenxun Deng, Hua Han, Xi Chen

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, China(中国科学院大学先进交叉学科学院) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, China(中国科学院脑认知与脑启发智能技术国家重点实验室) School of Future Technology, University of Chinese Academy of Sciences, China(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出SkelEM框架,通过解耦低频拓扑与高频细节的训练信号,结合确定性骨架与扩散精炼器,实现体积显微镜自监督轴向超分辨率,仅需≤5步即可恢复高保真细节,并在新基准BRAVE-ASR上取得最优平衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29387 2026-06-30 cs.GR cs.NA math.NA 79%

Dipole Diffusion Error in Thin Geometry: Optical Thickness Laws for Grid-Free Subsurface Scattering

薄几何中的偶极子扩散误差:无网格次表面散射的光学厚度定律

Faruk Alpay, Baris Basaran

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 针对偶极子模型在薄和弯曲物体上的几何误差,通过有限板多极子对比发现漫反射率误差具有材料无关的主导率$C e^{-2τ}$,透射率主导衰减为$e^{-τ}$,并利用Walk on Spheres方法直接求解扩散方程,无需网格或半空间近似。

Comments 22 pages, 13 figures, 1 table. Ancillary files include the full reproduction code (Python/NumPy CPU reference and Apple Metal GPU kernels) and all result data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29360 2026-06-30 cs.CV 79%

SAFE-DiT: Semantics-Aware Fast-path Execution for High-Resolution Diffusion Transformers

SAFE-DiT:面向高分辨率扩散Transformer的语义感知快速路径执行

Xuanhua Yin, Yuxuan Jia, Chuanzhi Xu, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对高分辨率扩散Transformer推理中的空间冗余导致注意力掩码引发性能瓶颈(MIDT),提出无训练框架SAFE-DiT,通过分离精确掩码消除与近似空间调度,实现2.69-5.09倍加速并降低内存占用,同时保持视觉质量。

Comments 20 pages, 12 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29319 2026-06-30 cs.CV 79%

FDM-MFVT: Few-step Sampling Diffusion Model for Mask-Free Virtual Try-On

FDM-MFVT: 用于无掩模虚拟试穿的少步采样扩散模型

Jiaxin Liu, Xiaoye Liang, Lai Jiang, Mai Xu, Jun Liu

机构 * School of Electronic Information Engineering, Beihang University, Beijing, China(北京航空航天大学电子信息工程学院) Zhongguancun Academy, Beijing, China(中关村学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FDM-MFVT,一种少步扩散模型,通过噪声优化模块和指令驱动模块实现高效无掩模虚拟试穿,并构建了3万对的无掩模数据集MFVT。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28785 2026-06-30 cs.CV 79%

Stochastic Optimal Control Sampling for Diffusion Inverse Problems

扩散逆问题的随机最优控制采样

Jie Zhang, Youmei Qiu, Hanling Tian, Jingyuan Zhang, Xiang Yin, Xiaolin Huang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化与智能感知学院,上海,中国) Shanghai Key Laboratory of Flexible Medical Robotics, Tongren Hospital, Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海柔性医疗机器人重点实验室,同仁医院,医学机器人研究所,上海交通大学,上海,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出随机最优控制采样(SOCS),通过闭式控制更新在每一步将测量一致的干净预测拉回去噪流,以高效解决扩散逆问题,提升视觉保真度和定量性能。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28677 2026-06-30 cs.CV 79%

SATB-VR: Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending

SATB-VR:使用信噪比感知轨迹混合训练少步视频恢复扩散模型

Haoran Bai, Xiaoxu Chen, Xiaoyu Liu, Zongsheng Yue, Sibin Deng, Wangmeng Zuo, Ying Chen

机构 * Alibaba Group(阿里巴巴集团) Harbin Institute of Technology(哈尔滨工业大学) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出SATB-VR少步视频恢复框架,通过辅助预测器跳过低信噪比步骤,并利用SNR感知轨迹混合策略解决训练-推理不一致,实现高效高质量恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17980 2026-06-30 cs.CV 79%

Learning to Balance: Decoupled Siamese Diffusion Transformer for Reference-Based Remote Sensing Image Super-Resolution

学习平衡:用于基于参考的遥感图像超分辨率的解耦孪生扩散变换器

Bin Luo, Runmin Dong, Zhaoyang Luo, Jinxiao Zhang, Jiyao Zhao, Fan Wei, Haohuan Fu

机构 * Tsinghua Shenzhen International Graduate School, Shenzhen, China(清华大学深圳国际研究生院) Sun Yat-sen University, Zhuhai, China(中山大学) National Supercomputing Center in Shenzhen, Shenzhen, China(深圳国家超算中心) Tsinghua University, Beijing, China(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DS-DiT解耦孪生扩散变换器,通过在注意力层面解耦低分辨率和参考信息交互,解决参考基于超分辨率中参考信息依赖过重和利用不足的问题,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10629 2026-06-30 cs.CV 79%

Product-of-Gaussian-Mixture Diffusion Models for Joint Nonlinear MRI Reconstruction

基于高斯混合积的扩散模型用于联合非线性MRI重建

Laurenz Nagler, Martin Zach, Thomas Pock

机构 * Graz University of Technology(格拉茨技术大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Biomedical Imaging Group and Center for Biomedical Imaging(生物医学成像组和生物医学成像中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结合参数高效高斯混合积扩散模型与经典平滑先验的联合重建方法,提升MRI重建的效率和鲁棒性,同时改善去噪和图像重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17975 2026-06-30 cs.CV 79%

AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors

AHOY! 从YouTube视频中通过高斯点云和视频扩散先验构建可动画的遮挡人类

Aymen Mir, Riza Alp Guler, Xiangjun Tang, Peter Wonka, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Imperial College London(帝国理工学院) KAUST(阿卜杜拉国王科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AHOY方法,通过高斯点云和视频扩散先验从真实视频中重建完整可动画3D人体,解决遮挡挑战,提出四点贡献:生成监督、两阶段架构、解耦策略、头身监督。

Comments ECCV 2026. Project page is available at https://miraymen.github.io/ahoy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14526 2026-06-30 cs.CV 79%

LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion

LatSearch:基于潜在奖励的搜索以加速推理时间扩展在视频扩散中

Zengqun Zhao, Ziquan Liu, Yu Cao, Shaogang Gong, Zhensong Zhang, Jifei Song, Jiankang Deng, Ioannis Patras

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LatSearch,通过潜在奖励引导的重采样和剪枝机制,提升视频扩散的推理效率和生成质量,验证其在VBench-2.0基准上的优越性。

Comments Accepted at ECCV 2026. Project page: see https://zengqunzhao.github.io/LatSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20606 2026-06-30 cs.CV 79%

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

探查并利用视频扩散变换器特征以实现稳健的点跟踪

Soowon Son, Honggyu An, Jisu Nam, Hyunah Ko, Chaehyun Kim, Dahyun Chung, Siyoon Jin, Jung Yi, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文探讨了视频扩散变换器在点跟踪中的优势,提出DiTracker框架,通过整合视频DiT特征提升跟踪鲁棒性,实验证明其在挑战性场景下表现优异。

Comments Project Page: https://cvlab-kaist.github.io/DiTracker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08505 2026-06-30 cs.CV 79%

Early Estimation of Language to Latent Alignment in Diffusion Models

扩散模型中语言到潜在对齐的早期估计

Vasco Ramos, Regev Cohen, Idan Szpektor, Joao Magalhaes

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NoisyCLIP模型,通过噪声感知双塔结构实现扩散模型中语言与潜在对齐的早期评估,降低计算成本并提升语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28092 2026-06-29 cs.CV 新提交 79%

Diffusion Model Attribution via Spectral Coupling of Denoiser Responses

通过去噪器响应的谱耦合进行扩散模型归因

Pragati Shuddhodhan Meshram, Varun Chandrasekaran

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出谱去噪签名(SDS)方法,通过分析去噪过程中的谱几何特性,实现高精度非侵入式扩散模型归因,准确率达99.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28039 2026-06-29 cs.CV cs.AI 新提交 79%

Mind the Gap: Quantifying the Domain Gap in Cross-Sensor Diffusion Super-Resolution

注意差距:量化跨传感器扩散超分辨率中的域差距

Dawid Kopeć, Katarzyna Jabłońska, Wojciech Kozłowski, Maciej Zięba

机构 * WUST(弗罗茨瓦夫科技大学) Tooploox

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对跨传感器超分辨率中合成数据与真实数据之间的域差距,首次系统研究其对扩散模型的影响,提出域自适应感知指标LPIPS-Sat,并揭示合成训练与真实训练的双重挑战。

Comments 26th International Conference on Computational Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27988 2026-06-29 cs.CV 新提交 79%

Latent Visual Diffusion Reasoning with Monte Carlo Tree Search

潜在视觉扩散推理与蒙特卡洛树搜索

Xirui Teng, Nan Xi, Junsong Yuan

机构 * Beijing Jiaotong University(北京交通大学) Virginia Commonwealth University(弗吉尼亚联邦大学) University at Buffalo(布法罗大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出LVDR框架,结合关键点引导的蒙特卡洛树搜索,实现细粒度技能活动的可解释视觉推理,在多个体育和手术数据集上取得竞争性表现。

Comments Accepted to ECCV 2026. Project page: https://github.com/XiruiTeng/LVDR_Official.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27760 2026-06-29 cs.CV 新提交 79%

PixelU: A U-Shaped Transformer for Efficient End-to-End Pixel Diffusion

PixelU: 一种用于高效端到端像素扩散的U形Transformer

Zipeng Guo, Lichen Ma, Yu He, Xiaolong Fu, Jingling Fu, Junshi Huang, Yan Li

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PixelU,一种极简单阶段U形扩散Transformer,通过零成本跳跃连接和恒通道空间下采样解耦高低频建模,在ImageNet上以约1/3计算成本超越强基线JiT-G。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27659 2026-06-29 cs.CV 新提交 79%

GeoFace: Consistent Multi-View Face Generation with Geometry-Constrained Diffusion

GeoFace: 基于几何约束的一致多视角人脸生成扩散模型

Yeji Choi, Jinhyeok Choi, Jaewon Min, Minkyung Kwon, Jin Hyeon Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出GeoFace,一种几何约束的多视角扩散框架,通过外观与几何流的共享注意力层和几何引导注意力对齐损失,实现从单张输入生成一致的多视角人脸图像和3D几何,显著提升跨视角几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04049 2026-06-29 cs.CV cs.RO 版本更新 79%

DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving

DIVER:强化扩散突破端到端自动驾驶的模仿瓶颈

Ziying Song, Lin Liu, Hongyu Pan, Bencheng Liao, Mingzhe Guo, Lei Yang, Yongchang Zhang, Shaoqing Xu, Caiyan Jia, Yadan Luo

机构 * School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大数据挖掘与具身智能关键实验室,北京交通大学计算机科学与技术学院) Horizon Robotics(地平线机器人) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) University of Macau(澳门大学) School of Electrical Engineering and Computer Science, The University of Queensland(昆士兰大学电子工程与计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DIVER通过融合强化学习与扩散生成,生成多样化可行轨迹,提升自动驾驶的泛化能力,解决模仿学习中的模式崩溃问题。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17426 2026-06-29 cs.CV 版本更新 79%

SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning

SHIFT: 视频扩散模型中的运动对齐与对抗混合微调

Xi Ye, Wenjia Yang, Yangyang Xu, Xiaoyang Liu, Duo Su, Mengfei Xia, Jun Zhu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) University of Chinese Academy of Science(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型微调后运动保真度下降的问题,提出基于像素通量动力学的像素运动奖励和SHIFT框架(平滑混合微调),通过对抗优势改进收敛并缓解奖励黑客,有效解决动态度坍塌。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26712 2026-06-26 eess.IV cs.AI cs.CV 新提交 79%

MLFFM-SegDiff: A Multi-Level Feature Fusion Diffusion Model for Skin Lesion Segmentation

MLFFM-SegDiff:一种用于皮肤病变分割的多级特征融合扩散模型

Jingjun Gu, Chaojie Shen, Yifeng Cao, Wei Zhang, Yiliu Li, Aobo Fan

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对皮肤镜图像分割中边界模糊、对比度低等问题,提出基于扩散模型的多级特征融合方法MLFFM-SegDiff,通过双路径U-Net编码器、多级特征融合模块和边界敏感损失函数提升分割精度,在ISIC2018等数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27123 2026-06-26 cs.RO cs.CV 新提交 79%

Proposal-Conditioned Latent Diffusion for Closed-Loop Traffic Scenario Generation

基于提议条件的闭环交通场景生成潜扩散模型

Shubham Vaijanath Phoolari, Aleyna Kara, Christoph Lauer, Steven Peters

机构 * CARIAD SE Technical University of Munich(慕尼黑工业大学) Institute of Automotive Engineering (FZD), TU Darmstadt(达姆施塔特工业大学汽车工程研究所(FZD))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于实例场景上下文和多模态提议先验的扩散框架,通过紧凑动作潜表示和提议初始化提升采样效率,实现闭环交通场景的逼真、安全且可控生成。

Comments Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26938 2026-06-26 cs.CV 新提交 79%

Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE

关注重要之处:面向扩散MoE的显著性引导精确路由

Haoyou Deng, Keyu Yan, Chaojie Mao, Xiang Wang, Yu Liu, Changxin Gao, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院图像处理与智能控制重点实验室) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散MoE中路由无法准确分配计算资源给显著令牌的问题,提出SharpMoE后训练框架,利用干净潜在特征作为无噪声引导信号,并引入轨迹路由损失,实现精确资源分配,在视觉生成中达到最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26778 2026-06-26 cs.CV cs.LG 新提交 79%

LearniBridge: Learnable Calibration of Feature Caching for Diffusion Models Acceleration

LearniBridge: 用于扩散模型加速的特征缓存的可学习校准

Xuyue Huang, Zhe Chen, Wang Shen, Xiao-Ping Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出LearniBridge,一种基于低秩共享子空间的可学习校准机制,通过轻量LoRA更新实现特征缓存的多时间步校准,仅需3-5个训练样本即可在图像和视频生成中实现高达5.87倍加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26769 2026-06-26 cs.AI cs.CV 新提交 79%

ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration

ResilPhase: 即插即用的相位映射与抗噪宏轨迹外推用于扩散加速

Qicheng Zhao, Yu Li, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散模型推理延迟高的问题,提出ResilPhase框架,通过将加速推理重构为ODE空间中的稳定宏轨迹外推,并引入无导数重心拉格朗日外推器和有界相位映射,实现高加速比下的抗噪加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17434 2026-06-26 cs.CV 版本更新 79%

TinySR: Pruning Diffusion for Real-World Image Super-Resolution

TinySR:剪枝扩散模型用于现实世界图像超分辨率

Linwei Dong, Qingnan Fan, Yuhang Yu, Qi Zhang, Jinwei Chen, Yawei Luo, Changqing Zou

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co. Ltd(沃伊通信有限公司) Zhejiang Lab(浙江实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TinySR,一种针对现实世界图像超分辨率的紧凑高效扩散模型,通过动态块激活和扩展-腐蚀策略实现实时性能与高质量输出,相比教师模型TSD-SR在计算成本和参数量上分别减少5.68倍和83%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25740 2026-06-25 cs.CV cs.AI 新提交 79%

Point Cloud Diffusion with Global and Local Reconstruction for Instance-Level 3D Anomaly Detection

基于全局与局部重建的点云扩散用于实例级3D异常检测

Linchun Wu, Qin Zou, Jiwen Lu, Qingquan Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Automation, Tsinghua University(清华大学自动化系) Guangdong Artificial Intelligence and Digital Economy Laboratory (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PCDiff框架,通过实例级多模态条件生成弱缺陷异常,并采用联合局部-全局重建算法恢复前景缺陷同时保持背景正常结构,在3D异常检测中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25736 2026-06-25 cs.CV 新提交 79%

UniTeD: Unified Temporal Diffusion for Joint Perception and Planning in Autonomous Driving

UniTeD: 面向自动驾驶联合感知与规划的时域统一扩散模型

Bo Zhao, Xinting Zhao, Naifan Li, Erkang Cheng, Haibin Ling

机构 * Nullmax Westlake University(西湖大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出UniTeD框架,通过共享生成空间的迭代去噪统一建模感知与规划,引入时域过渡模块和锚点刷新策略,在多个基准上达到最先进性能。

Comments Accept to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25545 2026-06-25 cs.CV 新提交 79%

TensorLDM: A Component-Wise Latent Diffusion Model for Volumetric DTI Reconstruction from Sparse DWIs

TensorLDM: 一种用于从稀疏DWI重建体积DTI的组件式潜在扩散模型

Junhyeok Lee, Kyu Sung Choi

机构 * Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine(首尔大学医学院癌症生物学跨学科项目) Department of Radiology, Seoul National University Hospital(首尔大学医院放射科) Department of Radiology, Seoul National University College of Medicine(首尔大学医学院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔大学医院医疗AI研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TensorLDM,一种组件式潜在扩散模型,通过分组编码器、解剖条件自编码器、跨组件注意力和专家混合条件机制,从稀疏DWI中重建扩散张量,在HCP数据集上实现高精度和物理有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏