arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2310.20389 2026-05-19 eess.IV cs.CV 79%

High-Resolution Reference Image Assisted Volumetric Super-Resolution of Cardiac Diffusion Weighted Imaging

高分辨率参考图像辅助的心脏扩散加权成像体积分辨率提升

Yinzhe Wu, Jiahao Huang, Fanwen Wang, Pedro Ferreira, Andrew Scott, Sonia Nielles-Vallespin, Guang Yang

机构 * Department of Bioengineering, Imperial College London(帝国理工学院生物工程系) Cardiovascular Magnetic Resonance Unit, Royal Brompton Hospital(皇家布里托尼医院心血管磁共振单位) National Heart and Lung Institute, Imperial College London(帝国理工学院国家心脏和肺研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于深度学习的体积分辨率提升框架,利用高分辨率b0 DWI作为输入,提升心脏扩散加权成像的图像质量,并证明了该框架在未见b值下的泛化能力。

Comments Accepted by SPIE Medical Imaging 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16444 2026-05-19 cs.CV cs.AI 79%

Diffusion Attention Expert Model for Predicting and Semi-automatic Localizing STAS in Lung Cancer Histopathological Images

扩散注意力专家模型用于预测和半自动定位肺癌组织病理图像中的STAS

Liangrui Pan, Jiadi Luo, Yuxuan Xiao, Chenchen Nie, Xiaoshuai Wu, Songqing Fan, Ling Chu, Manqiu Li, Rongfang He, Zhenyu Zhao, Ruixing Wang, Shulin Liu, Yiyi Liang, Xiang Wang, Qingchun Liang, Shaoliang Peng

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Department of Pathology, The Second Xiangya Hospital, Central South University(中南大学湘雅医院病理科) Hunan Clinical Medical Research Center for Cancer Pathogenic Genes Testing and Diagnosis(湖南临床医学肿瘤基因检测与诊断研究中心) Department of Thoracic Surgery, The Second Xiangya Hospital, Central South University(中南大学湘雅医院胸外科) Department of pathology, Hunan Cancer Hospital, The Affiliated Cancer Hospital of Xiangya School of Medicine, Central South University(湖南肿瘤医院病理科) Department of Pathology, The Third Xiangya Hospital, Central South University(中南大学湘雅第三医院病理科) Department of Pathology, First People's Hospital of Pingjiang County(平江县第一人民医院病理科) Department of Pathology, the First Affiliated Hospital, Hengyang Medical School, University of South China(南华大学衡阳医学院第一附属医院病理科) Department of Radiology, The Second Xiangya Hospital of Central South University(中南大学湘雅医院放射科) Department of Radiology, Xiangya Hospital, Central South University(中南大学湘雅医院放射科) Oncology Department and State Key Laboratory of Systems Medicine for Cancer of Shanghai Cancer Institute, Renji Hospital, School of Medicine, Shanghai Jiaotong University(上海癌症研究院肿瘤科及上海交通大学医学院系统医学重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DAEM模型,通过多尺度特征学习和双分支架构提升STAS检测精度,实现对冷冻切片和石蜡切片的高AUC值检测,并利用肿瘤微环境特征实现STAS半自动定位。

Comments Accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16420 2026-05-19 cs.CV cs.LG 79%

Video Reconstruction using Diffusion-based Image-to-Video Generation with Trajectory Guidance

基于扩散模型的图像到视频生成与轨迹引导的视频重建

Stelio Bompai, Ioannis Kontopoulos, Giannis Spiliopoulos, Dimitris Zissis, Konstantinos Tserpes

机构 * Department of Electrical and Computer Engineering, National Technical University of Athens, Greece(电气与计算机工程系,希腊国家技术大学雅典分校) Department of Product and Systems Design Engineering, University of the Aegean, Syros, Greece(产品与系统设计工程系,爱琴海大学锡罗斯分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用预训练的图像到视频扩散模型,通过GPS轨迹引导生成无人机视频的缺失或丢失帧,无需领域特定微调,展示了在低纹理和小目标条件下视频重建的有效性。

Comments Accepted at the 1st Workshop on Multi-Sensor Trajectory Knowledge Discovery and Extraction (MuseKDE 2026), co-located with the 27th IEEE International Conference on Mobile Data Management (IEEE MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15908 2026-05-18 cs.CV cs.AI 79%

RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations

RaPD:通过语义增强的隐式表示实现分辨率无关的像素扩散

Yanhao Ge, Shanyan Guan, Weihao Wang, Ying Tai, Mingyu You

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RaPD通过语义表示引导和坐标查询注意力渲染器,在连续神经图像场的潜在空间中实现分辨率无关的像素扩散,解决了重建与生成之间的差距,提升了生成质量和分辨率扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15895 2026-05-18 eess.IV cs.CV 79%

Layer Selection in Feature-Based Losses Affects Image Quality and Microstructural Consistency in Deep Learning Super-Resolution of Brain Diffusion MRI

基于特征的损失函数中层选择影响深度学习超分辨率中图像质量及微结构一致性

David Lohr, Rene Werner

机构 * Institue for Applied Medical Informatics, University Medical Center Hamburg-Eppendorf(应用医学信息学研究所,汉堡大学医学中心) Institute of Computational Neuroscience, University Medical Center Hamburg-Eppendorf(计算神经科学研究所,汉堡大学医学中心) Center for Biomedical Artificial Intelligence (bAIome), University Medical Center Hamburg-Eppendorf(生物医学人工智能中心(bAIome),汉堡大学医学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究探讨了基于特征的损失函数在深度学习超分辨率中对扩散信号一致性的影响,发现深层网络层会导致网格状伪影,而浅层网络层能保持图像与地面真实的一致性,尤其在9倍超分辨率下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15855 2026-05-18 cs.CV 79%

Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?

少即是多:我们是否需要为扩散模型的强化学习微调进行每一步优化?

Renye Yan, Jikang Cheng, Shikun Sun, Yi Sun, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Junliang Xing, Yimao Cai

机构 * Peking University(北京大学) Tsinghua University(清华大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散模型强化学习微调中优化步骤的影响,提出AdaScope方法通过动态控制训练时机提升生成质量并降低计算成本。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12894 2026-05-18 cs.RO cs.CV 79%

Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning

稀疏动作生成:通过实时剪枝加速扩散策略

Kangye Ji, Jianbo Zhou, Yuan Meng, Ye Li, Hanyun Cui, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SAG方法,通过自适应剪枝和重用机制实现稀疏动作生成,提升实时视觉运动控制效率,实验显示生成速度提升4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04321 2026-05-18 cs.AI cs.MM 79%

Generative Semantic Communication: Diffusion Models Beyond Bit Recovery

生成语义通信:扩散模型超越位恢复

Eleonora Grassucci, Sergio Barbarossa, Danilo Comminiello

机构 * Dept. of Information Engineering, Electronics, and Telecommunication, Sapienza University of Rome(信息工程、电子与电信系,罗马萨皮恩扎大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 本文提出一种新的生成扩散框架,利用扩散模型合成多媒体内容并保留语义特征,通过空间自适应归一化生成语义一致的场景,提升在信道噪声下的图像生成质量。

Journal ref IEEE Transactions on Cognitive Communication and Networking, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15682 2026-05-18 cs.CV 79%

DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer

DreamSR:通过增强感受野的扩散变换器实现超高清图像超分辨率

Qingji Dong, Hang Dong, Mingqin Chen, Rui Zhang, Yitong Wang

机构 * ByteDance Inc.(字节跳动公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamSR通过双分支MM-ControlNet和增强感受野策略,解决超分辨率中局部过生成和细节合成问题,实现高质量细节恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15660 2026-05-18 cs.CV 79%

MaTe: Images Are All You Need for Material Transfer via Diffusion Transformer

MaTe:仅需图像进行材料迁移的扩散变换器

Nisha Huang, Henglin Liu, Yizhou Lin, Kaer Huang, Chubin Chen, Jie Guo, Tong-Yee Lee, Xiu Li

机构 * Tsinghua University(清华大学) PengCheng Laboratory(鹏城实验室) Lenovo Research(联想研究院) National Cheng-Kung University(国立成功大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MaTe通过多模态注意力机制实现材料迁移,无需文本指导或辅助网络,提升了生成质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15519 2026-05-18 cs.CV cs.AI 79%

DiffVAS: Diffusion-Guided Visual Active Search in Partially Observable Environments

DiffVAS: 在部分可观测环境中基于扩散的视觉主动搜索

Anindya Sarkar, Srikumar Sastry, Aleksis Pirinen, Nathan Jacobs, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) RISE Research Institutes of Sweden(瑞典RISE研究机构) Climate AI Nordics(北欧气候AI)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffVAS提出了一种目标条件化的策略,能够在部分可观测环境中同时搜索多种目标,提升了视觉主动搜索在现实应用中的部署能力。

Comments 26 Pages, 12 figures, Accepted to AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12202 2026-05-15 cs.CV 79%

Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generation

Hunyuan3D 2.0:基于扩散模型的高分辨率纹理3D资产生成

Zibo Zhao, Zeqiang Lai, Qingxiang Lin, Yunfei Zhao, Haolin Liu, Shuhui Yang, Yifei Feng, Mingxin Yang, Sheng Zhang, Xianghui Yang, Huiwen Shi, Sicong Liu, Junta Wu, Yihang Lian, Fan Yang, Ruining Tang, Zebin He, Xinzhou Wang, Jian Liu, Xuhui Zuo, Zhuo Chen, Biwen Lei, Haohan Weng, Jing Xu, Yiling Zhu, Xinhai Liu, Lixin Xu, Changrong Hu, Shaoxiong Yang, Song Zhang, Yang Liu, Tianyu Huang, Lifu Wang, Jihong Zhang, Meng Chen, Liang Dong, Yiwen Jia, Yulin Cai, Jiaao Yu, Yixuan Tang, Hao Zhang, Zheng Ye, Peng He, Runzhou Wu, Chao Zhang, Yonghao Tan, Jie Xiao, Yangyu Tao, Jianchen Zhu, Jinbao Xue, Kai Liu, Chongqing Zhao, Xinming Wu, Zhichao Hu, Lei Qin, Jianbing Peng, Zhan Li, Minghui Chen, Xipeng Zhang, Lin Niu, Paige Wang, Yingkai Wang, Haozhao Kuang, Zhongyi Fan, Xu Zheng, Weihao Zhuang, YingPing He, Tian Liu, Yong Yang, Di Wang, Yuhong Liu, Jie Jiang, Jingwei Huang, Chunchao Guo

机构 * Tencent(腾讯)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Hunyuan3D 2.0通过大规模形状生成模型和纹理合成模型,实现高分辨率纹理3D资产生成,其核心贡献在于提升几何细节、条件对齐和纹理质量,并提供用户友好的生产平台。

Comments GitHub link: https://github.com/Tencent/Hunyuan3D-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14396 2026-05-15 cs.CV cs.CR cs.LG cs.RO 79%

Systematic Discovery of Semantic Attacks in Online Map Construction through Conditional Diffusion

通过条件扩散系统发现在线地图构建中的语义攻击

Chenyi Wang, Ruoyu Song, Raymond Muller, Jean-Philippe Monteuuis, Jonathan Petit, Z. Berkay Celik, Ryan Gerdes, Ming F. Li

机构 * University of Arizona(亚利桑那大学) Purdue University(普渡大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MIRAGE框架,系统发现能绕过对抗防御的语义攻击,通过寻找环境变化(如阴影、湿路)来降低地图预测准确性,实验显示两种攻击在多种防御下仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14337 2026-05-15 cs.CV 79%

IG-Diff: Complex Night Scene Restoration with Illumination-Guided Diffusion Model

IG-Diff: 复杂夜间场景恢复与光照引导扩散模型

Yifan Chen, Fei Yin, Chunle Guo, Chongyi Li, Yujiu Yang

机构 * Tsinghua Univerisity(清华大学) NanKai University(南开大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出IG-Diff模型,通过光照引导模块提升低光照环境下复杂场景的恢复能力,解决天气与低光共存的挑战。

Comments Accepted by CGI-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14191 2026-05-15 cs.CV 79%

CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers

CoReDiT:基于空间一致性引导的令牌剪枝与重建用于高效的扩散变换器

Zhuojin Li, Hsin-Pai Cheng, Hong Cai, Shizhong Han, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CoReDiT通过空间一致性引导的令牌剪枝与重建,显著降低扩散变换器的计算量,提升推理速度,同时保持高质量视觉输出。

Comments 8 pages, 8 figures, CVPR workshop

Journal ref 2026 CVPR Workshop of EDGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04473 2026-05-15 cs.CV 79%

CC-Pan: Channel-wise Compression based Diffusion for Efficient Pan-Sharpening

CC-Pan: 基于通道压缩的扩散模型用于高效全色锐化

Junjie Li, Congyang Ou, Haokui Zhang, Guoting Wei, Shengqin Jiang, Ying Li

机构 * School of Cyberspace Security, Northwestern Polytechnical University(网络安全学院,西北工业大学) Nanjing University of Science and Technology(南京理工大学) School of Computer Science, Nanjing University of Information Science and Technology(计算机科学学院,南京信息工程大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CC-Pan,一种跨传感器潜在扩散框架,通过带级单通道变分自编码器编码高分辨率多谱段图像,结合轻量级区域基于跨带注意力模块,提升全色锐化精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12083 2026-05-15 cs.CV 79%

RePack then Refine: Efficient Diffusion Transformer with Vision Foundation Model

RePack then Refine:高效的扩散变换器与视觉基础模型

Guanfang Dong, Luke Schultz, Negar Hassanpour, Chao Gao

机构 * Huawei Technologies Canada Ltd.(华为加拿大有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出RePack then Refine框架,通过压缩高维VFM特征并细化提升扩散变换器的生成效率与质量,在ImageNet-1K上取得优于最新LDMs的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09549 2026-05-15 cs.CV 79%

SD-ReID: View-aware Stable Diffusion for Aerial-Ground Person Re-Identification

SD-ReID: 视角感知的稳定扩散用于空-地人员重识别

Yuhao Wang, Xiang Hu, Lixin Wang, Pingping Zhang, Huchuan Lu

机构 * School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SD-ReID框架,通过生成模型模仿不同视角的特征分布,提取稳健的身份表示,提升空-地人员重识别的鲁棒性和准确性。

Comments This work is accepted by IEEE TIP 2026. More modifications may performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14136 2026-05-15 cs.CV 79%

TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion

TeDiO:基于时间对角优化的训练自由一致视频扩散

Nurislam Tursynbek, Zhiqiang Lao, Heather Yu, Gedas Bertasius, Marc Niethammer

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Futurewei Technologies Inc(未来科技有限公司) UCSD(加州大学圣迭戈分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TeDiO通过优化内部注意力模式提升视频生成的时序一致性,无需训练或外部监督,实现更流畅的动态表现。

Comments CVPR'26 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13910 2026-05-15 stat.ML cs.CV cs.LG 79%

Covariance-aware sampling for Diffusion Models

考虑协方差的扩散模型采样

Andrea Schioppa, Tim Salimans

机构 * GDM - Amsterdam(阿姆斯特丹GDM)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种考虑协方差的采样器,改进了扩散模型在少步 regime 中的像素空间采样质量。通过显式建模反向过程的协方差,结合 Tweedie 公式和结构化傅里叶空间分解,实现高效采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17353 2026-05-15 cs.CV cs.AI cs.LG eess.IV 79%

Dual Ascent Diffusion for Inverse Problems

双上升扩散用于逆问题

Minseo Kim, Axel Levy, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出双上升优化框架解决逆问题,提升图像质量与鲁棒性,改进扩散模型先验的MAP求解方法。

Comments Project page: https://soniaminseokim.github.io/ddiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13815 2026-05-14 cs.CV cs.RO 79%

OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation

OmniLiDAR:一个多领域3D激光雷达生成的统一扩散框架

Youquan Liu, Weidong Yang, Ao Liang, Xiang Xu, Lingdong Kong, Yang Wu, Dekai Zhu, Xin Li, Runnan Chen, Ben Fei, Tongliang Liu, Wanli Ouyang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computing, Department of Computer Science, National University of Singapore(新加坡国立大学计算机学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Technical University of Munich(慕尼黑技术大学) Nanjing University of Science and Technology(南京理工大学) Shanghai AI Laboratory(上海人工智能实验室) University of Sydney(悉尼大学) The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OmniLiDAR提出一种统一的文本条件扩散框架,生成跨八个领域的3D激光雷达扫描,通过跨域训练策略和特征建模提升多域生成能力,实验显示在数据增强和鲁棒性评估中表现优异。

Comments Preprint; 12 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13778 2026-05-14 cs.RO cs.CV 79%

Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs

实时-VLA FLASH:基于扩散模型的视觉-语言-动作模型的推测推理框架

Jiahui Niu, Kefan Gu, Yucheng Zhao, Shengwen Liang, Tiancai Wang, Xing Hu, Ying Wang, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学) Dexmal

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出实时-VLA FLASH框架,通过轻量级草案模型和主模型的Action Expert并行验证,实现低延迟高频率重规划,实验显示在LIBERO上任务性能保持良好,推理延迟降低至19.1ms。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13713 2026-05-14 cs.CV eess.IV 79%

Learning to Optimize Radiotherapy Plans via Fluence Maps Diffusion Model Generation and LSTM-based Optimization

通过束流图扩散模型生成和基于LSTM的优化学习优化放射治疗计划

Isabella Poles, Simon Arberet, Riqiang Gao, Martin Kraus, Marco D. Santambrogio, Florin C. Ghesu, Ali Kamen, Dorin Comaniciu

机构 * Politecnico di Milano(米兰理工学院) Digital Technology and Innovation, Siemens Healthineers(西门子医疗数字化技术与创新)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种扩散驱动的学习优化方法,用于端到端的VMAT计划,通过生成可行的束流图并利用LSTM优化模块提高计划效率和机器可交付性。

Comments Early Accept at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13316 2026-05-14 cs.CV 79%

Test-time Sparsity for Extreme Fast Action Diffusion

测试时稀疏性用于极端快速动作扩散

Kangye Ji, Yuan Meng, Jianbo Zhou, Ye Li, Chen Tang, Zhi Wang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出测试时稀疏性方法,通过动态预测可剪枝的残差计算来加速动作扩散,解决开放环境中的动态策略问题,实验表明在减少92% FLOPs的同时提升5倍生成速度,保持无损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13182 2026-05-14 cs.CV 79%

DiffST: Spatiotemporal-Aware Diffusion for Real-World Space-Time Video Super-Resolution

DiffST: 用于现实世界时空视频超分辨率的时空感知扩散模型

Zheng Chen, Ruofan Yang, Jin Han, Dehua Song, Zichen Zou, Chunming He, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Duke University(杜克大学) Huawei Consumer Business Group(华为消费者业务集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffST提出一种高效时空感知视频扩散框架,通过跨帧上下文聚合和视频表示引导提升时空信息利用,实现高效实时世界时空视频超分辨率。

Comments Code is available at: https://github.com/zhengchen1999/DiffST

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13041 2026-05-14 cs.CV 79%

EgoForce: Robust Online Egocentric Motion Reconstruction via Diffusion Forcing

EgoForce:通过扩散强迫实现鲁棒的在线自体视角运动重建

Inwoo Hwang, Donggeun Lim, Hojun Jang, Young Min Kim

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出EgoForce框架,通过扩散强迫方法实现从噪声自体视角输入中鲁棒的长时间全身体运动重建,优于现有在线和离线方法。

Comments Project page: https://inwoohwang.me/EgoForce

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13027 2026-05-14 cs.CV 79%

PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution

PRISM:基于先验校正和不确定性感知结构建模的扩散文本图像超分辨率

Zihang Xu, Xiaoyang Liu, Zheng Chen, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PRISM通过Flow-Matching Prior Rectification和Structure-guided Uncertainty-aware Residual Encoder解决文本超分辨率中的先验校正和局部结构细化问题,实现高精度文本生成。

Comments Code is available at https://github.com/faithxuz/PRISM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12957 2026-05-14 cs.CV 79%

GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion

GTA: 通过几何然后外观视频扩散推进图像到3D世界生成

Hanxin Zhu, Cong Wang, Peiyan Tu, Jiayi Luo, Tianyu He, Xin Jin, Zhibo Chen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GTA方法,通过几何先于外观的两阶段框架提升3D场景生成的结构精度和视觉质量,同时引入随机潜在shuffle策略和测试时缩放方案,实验表明其在保真度、视觉质量和几何准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29917 2026-05-14 cs.CV 79%

Diffusion-Based Feature Denoising with NNMF for Robust handwritten digit multi-class classification

基于NNMF的扩散特征去噪在鲁棒手写数字多类分类中的应用

Hiba Adil Al-kharsan, Róbert Rajkó

机构 * Doctoral School of Computer Science, University of Szeged(塞格德大学计算机科学博士学院) University Research and Innovation Center (EKIK), Óbuda University(奥布达大学研究与创新中心(EKIK))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结合扩散驱动特征去噪与混合特征表示的鲁棒多类分类框架,通过NNMF提取紧致可解释特征并结合CNN深度特征,提升噪声和对抗攻击下的分类鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏