arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-09-01 至 2026-09-01 共收录 155 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 155 篇

2603.00763 2026-09-01 cs.CV 版本更新 89%

Analyzing and Improving Fast Sampling of Text-to-Image Diffusion Models

分析和改进文本到图像扩散模型的快速采样

Zhenyu Zhou, Defang Chen, Siwei Lyu, Chun Chen, Can Wang

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Institute for Artificial Intelligence and Data Science(人工智能与数据科学研究院) University at Buffalo(布法罗大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出TORS调度策略,通过优化采样轨迹的几何变化,提升文本到图像扩散模型在有限采样步数下的生成质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12527 2026-09-01 cs.CV 版本更新 88%

Comprehensive Assessment and Analysis for NSFW Content Erasure in Text-to-Image Diffusion Models

文本到图像扩散模型中NSFW内容擦除的综合评估与分析

Die Chen, Zhiwen Li, Cen Chen, Yuexiang Xie, Xiaodan Li, Jinyan Ye, Yingda Chen, Yaliang Li

机构 * East China Normal University(华东师范大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对文本到图像扩散模型的NSFW内容问题,构建全流程工具包开展首次系统性评估,为相关概念擦除方法的应用提供指导,助力扩散模型内容安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16830 2026-09-01 cs.CL 版本更新 88%

PEPPER: Perception-Guided Perturbation for Robust Backdoor Defense in Text-to-Image Diffusion Models

PEPPER:基于感知的扰动用于文本到图像扩散模型的鲁棒后门防御

Oscar Chew, Po-Yi Lu, Jayden Lin, Kuan-Hao Huang, Hsuan-Tien Lin

机构 * Texas A&M University(德克萨斯A&M大学) National Taiwan University(台湾国立大学) University of Michigan(密歇根大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 PEPPER通过重写提示生成语义上不同但视觉上相似的描述,干扰输入提示中的触发器,提高文本到图像扩散模型的鲁棒性,尤其有效对抗基于文本编码器的攻击。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29997 2026-09-01 cs.CV 新提交 87%

Discrete Diffusion Bridges for Spatiotemporally Aligned Image Translation and Generation

用于时空对齐图像翻译与生成的离散扩散桥

Xing Xie, Jiawei Liu, Shijun Zhou, Huijie Fan, Zhi Han, Yandong Tang, Liangqiong Qu

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究提出离散扩散桥(DDB)框架,解决离散扩散在图像翻译与生成中的时空错位问题,通过混合吸收机制和信息引导噪声调度实现平衡,在多生成任务中表现优异且适配低采样步数场景。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15132 2026-09-01 cs.CV 版本更新 86%

WiT: Waypoint Diffusion Transformers for Alleviating Trajectory Conflict in Pixel-Space Image Generation

WiT:通过轨迹冲突导航实现方式点扩散变换

Hainuo Wang, Mingjia Li, Xiaojie Guo

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出WiT,通过分解连续向量场中的语义方式点,解决像素空间中的轨迹冲突问题,提升扩散生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29809 2026-09-01 cs.CV 新提交 85%

RegionCache: Semantic-Aware Region Reuse for Efficient Multi-Turn Image Generation

RegionCache:面向高效多轮图像生成的语义感知区域复用

Peizheng Li, Xin Ai, Hanyuan Liu, Qiange Wang, Yanfeng Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 针对多轮图像编辑中现有DiT方法的冗余计算问题,提出RegionCache框架,通过语义感知的区域复用实现1.43-2.55倍端到端加速且保持图像质量。

Comments Accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29281 2026-09-01 cs.CV 新提交 83%

Elastic Token Compression for Pixel-Space Diffusion Transformers

像素空间扩散Transformer的弹性令牌压缩

Eduard Zamfir, Christian Reisswig, Zongwei Wu, Yongqin Xian, Radu Timofte

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对像素空间扩散Transformer的令牌冗余问题,提出Region Token Interface弹性令牌压缩方法,可在多压缩预算下提升效率,2.0倍速时达密集模型质量,2.6倍速时仍接近该质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29233 2026-09-01 cs.CV 新提交 83%

Generalization over Memorization: Generalization-Aware Diffusion Adaptation for Single-Image Multi-View Synthesis

超越记忆的泛化:面向单图像多视图合成的泛化感知扩散适配

Jie Li, Xingchen Zou, Yuxuan Liang

机构 * Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本研究提出ACM MM 2026单图像多视图合成挑战赛的获奖方案GoM,通过场景不相交验证等技术,在40个训练场景下实现293支队伍中排名第一,揭示小数据生成建模中验证设计与训练轨迹控制的关键作用。

Comments ACM Multimedia 2026 Grand Challenge Track winning paper; presents the 1st-place solution among 293 registered teams. 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28929 2026-09-01 cs.CR cs.CV 新提交 83%

Membership is Ownership: A Robust Ownership Verification Framework for Diffusion Models

成员即所有权:一种针对扩散模型的鲁棒所有权验证框架

Feng Jiang, Zuobin Xiong, An Huang, Zhipeng Cai, Yingshu Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出MiO框架,通过总体假设检验实现扩散模型所有权验证,未修改原模型,在窃后微调等对抗场景下鲁棒性优于水印方法,为AI模型IP保护提供了新方案。

Comments This paper has been accepted to the IEEE International Conference on Data Mining (ICDM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28681 2026-09-01 cs.CV 新提交 83%

CARD: Calibration via Agreement in Reverse Diffusion for Out-of-Domain MRI Segmentation

CARD:基于反向扩散一致性的域外MRI分割校准方法

Jiaheng Dai, Weidong Guo, Qingbiao Li, Jie Xu, Yi Guo, Yuanyuan Wang, Zeju Li

机构 * College of Biomedical Engineering, Fudan University(复旦大学生物医学工程学院) Faculty of Information Science and Computing, University of Macau(澳门大学信息科学与计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对域外MRI分割的域偏移导致概率校准失效的问题,提出基于反向扩散一致性的CARD方法,利用生成式形状先验的分歧实现像素级校准,显著降低了多器官MRI域偏移下的校准误差。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16861 2026-09-01 cs.CV cs.AI 版本更新 83%

Prefix-Adaptive Block Diffusion for Efficient Document Recognition

前缀自适应块扩散用于高效的文档识别

Mingxu Chai, Ziyu Shen, Chenyu Liu, Jihua Kang, Tao Gui, Qi Zhang

机构 * Computation and Artificial Intelligence Innovative College, Fudan University, Shanghai, China(复旦大学计算与人工智能创新学院,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) ByteDance, Shanghai, China(字节跳动,上海,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出前缀自适应块扩散模型(PA-BDM),通过改进块内去噪和缓存机制,提升文档识别的效率和准确性。

Comments 16pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30745 2026-09-01 cs.LG 新提交 82%

TDDM-Melatt: A Decoupled Memory and Diffusion Framework for Generalizable Encrypted Traffic Classification

TDDM-Melatt:用于通用加密流量分类的解耦内存与扩散框架

Ze Chen, Qiming Yu, Zijia Song, Guozheng Yang, Wei Yan

机构 * National University of Defense Technology(国防科技大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对加密流量分类的泛化性局限,研究提出TDDM-Melatt框架,结合解耦内存模型Melatt与流量去噪扩散模型TDDM,在4个公开数据集上的实验性能优于6种基础分类模型和6种SOTA表示学习模型。

Comments 18 pages, 13 figures, 9 tables, accepted at the 2026 ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29907 2026-09-01 cs.LG physics.app-ph physics.comp-ph 新提交 82%

Diffusion-Based Inverse Design of Dielectric Resonator Metasurfaces for Shaping Smart Electromagnetic Environments

基于扩散模型的介质谐振器超表面逆设计用于构建智能电磁环境

M. Tsukerman, K. Grotov, D. Vovchuk, P. Ginzburg

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出条件扩散框架用于介质谐振器超表面逆设计,可生成多个候选设计,其误差低于CMA-ES优化及确定性神经基线,推理效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21247 2026-09-01 stat.ML cs.LG math.DG physics.data-an 版本更新 82%

Accelerate Vector Diffusion Maps by Landmarks

通过地标加速向量扩散图

Sing-Yuan Yeh, Yi-An Wu, Hau-Tieng Wu, Mao-Pei Tsui

机构 * Department of Mathematics, National Taiwan University, Taipei, 106, Taiwan(台湾大学数学系) National Center for Theoretical Sciences, Mathematics Division, Taipei, 106, Taiwan(理论科学国家中心数学组) Courant Institute of Mathematical Sciences, New York University, New York, NY, 10012 USA(纽约大学数学科学学院) Data Science Degree Program, National Taiwan University(台湾大学数据科学学士学位计划)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出LA-VDM算法,通过两阶段归一化加速基于图连接拉普拉斯的向量扩散图框架,有效处理数据和地标集的非均匀采样密度,通过流形模型恢复平行运输,提升连接拉普拉斯的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29048 2026-09-01 cs.CV cs.GR 新提交 81%

DReSG: Diffusion Residuals for Stylized Gaussian Splatting

DReSG:用于风格化高斯溅射的扩散残差

Zhongliang Liu, Wenjie Liu, Yang Li

机构 * School of Software Engineering, East China Normal University(华东师范大学软件工程学院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 针对现有3D风格化方法的缺陷,提出DReSG框架,将扩散提议作为残差目标并通过多视图高斯反馈优化,实现稳定可控的参考引导风格化,更好保留场景结构与跨视图稳定性。

Comments Accepted to Pacific Graphics 2026 (Conference Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30603 2026-09-01 cs.CV cs.AI 新提交 79%

DiffSAC: Diffusion-guided Sampling for Consensus-based Robust Estimation

DiffSAC:用于基于共识的鲁棒估计的扩散引导采样

Chang Nie, Guangming Wang, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(教育部系统控制与信息处理重点实验室) Department of Engineering, Cambridge University(剑桥大学工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对传统样本共识鲁棒估计采样效率低的问题,提出DiffSAC框架,通过扩散模型学习有效最小集分布,仅需几十个假设就实现最先进性能,可作为即插即用模块改进现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29820 2026-09-01 cs.CV 新提交 79%

Null-Space Diffusion Restoration with Adaptive Uncertainty-Guided Fusion for Ultrasound Speckle Reduction

用于超声散斑抑制的自适应不确定性引导融合的零空间扩散恢复

Juneyong Lee, Jaeyoung Choi

机构 * Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对超声B型成像的散斑噪声抑制问题,提出不确定性引导零空间扩散框架,在PICMUS等数据集上实现了散斑抑制与结构保留的平衡,达到了具竞争力的gCNR值。

Comments 14 pages, 4 figures, 5 tables. Accepted for publication in IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29549 2026-09-01 cs.SD cs.AI cs.MM 新提交 79%

PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation

PhysWave:用于可控空间音频生成的物理引导潜在扩散模型

Lingfeng Yao, Chenpei Huang, Xingke Yang, Ziye Geng, Changqing Luo, Hao Wang, Jiang Liu, Miao Pan

机构 * University of Houston(休斯顿大学) Stevens Institute of Technology(史蒂文斯理工学院) Waseda University(早稻田大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 PhysWave是一种物理引导潜在扩散模型,通过统一控制与加入声学先验,生成空间一致的文本到FOA音频,还构建了30万段FOA数据集,可用于推理时的空间优化。

Comments Accepted by EMNLP 2026 Main Conference. Project website: this https URL (https://lingfengyao.github.io/PhysWave/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29456 2026-09-01 cs.CV 新提交 79%

Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images

基于文本引导扩散模型的胸部X射线图像对抗攻击

Basudha Pal, Arjun Narayanan, Neha Ajith, Vikas R Bhat, Muhammad Umair

机构 * The Johns Hopkins University(约翰斯·霍普金斯大学) Manipal Institute of Technology(马尼帕尔理工学院) Manipal Academy of Higher Education(马尼帕尔高等教育学院) The Johns Hopkins Hospital(约翰斯·霍普金斯医院) Columbia University Irving Medical Center(哥伦比亚大学欧文医学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出文本引导扩散对抗框架攻击胸部X射线分类模型,在多架构上验证其能显著降低分类性能,同时发现人机判读存在重要差异,凸显需扩展医疗AI鲁棒性评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29322 2026-09-01 cs.CV 新提交 79%

Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling

基于诊断引导候选回收的视频扩散模型测试时缩放

Hangzhou He, Lunhao Duan, Shanshan Zhao, Kaiwen Li, Qing-Guo Chen, Weihua Luo, Yanye Lu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对视频扩散模型测试时缩放的“生成-丢弃”范式缺陷,提出无需训练的 GEARS 框架,通过阶段感知调度器与候选回收器提升轻量模型性能,在 VBench 上使 13 亿参数模型得分接近 140 亿参数模型。

Comments Accepted by ACM TOG (SIGGRAPH Asia 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29243 2026-09-01 cs.CV 新提交 79%

DARD: Zero-Shot Degradation-Aware Retinex-Guided Diffusion for Low-Light Image Enhancement

DARD:用于低光照图像增强的零样本退化感知Retinex引导扩散模型

Wenjie Cai, Yuezhe Yang, Jianyang Xia, Xingbo Dong, Zhe Jin

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Anhui University(安徽大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现有扩散增强方法的缺陷,提出零样本退化感知Retinex引导扩散框架DARD,经多基准实验及语义分割下游验证,其性能优于现有零样本基线,可提升图像增强后的mIoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29227 2026-09-01 cs.CV 新提交 79%

Using Channel Representations in Regularization Terms: A Case Study on Image Diffusion

在正则化项中使用通道表示:图像扩散的案例研究

Christian Heinemann, Freddie Åström, George Baravdish, Kai Krajsek, Michael Felsberg, Hanno Scharr

机构 * Forschungszentrum Jülich(于利希研究中心) Linköping University(林雪平大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出基于图像通道表示的新型非线性扩散滤波方法,构建含通道表示权重项的能量泛函,在含混合噪声的图像重建与去噪任务中表现具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21786 2026-09-01 cs.CV 版本更新 79%

UniDiffFusion: A Unified Diffusion Framework for Multi-Task and Degradation-Robust Image Fusion

HP-UniIF:用于统一图像融合的分层提示学习

Xingxin Xu, Siqi Zhao, Xin Li, Xinjie Yao, Yiming Sun, Pengfei Zhu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HP-UniIF是一种基于分层条件调制策略的统一视觉框架,利用扩散先验实现异构图像融合、视觉恢复与下游感知的协同,在多任务实验中表现出优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20308 2026-09-01 cs.CV 版本更新 79%

ACE-Ego-Hand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

DreamHand:复用视频扩散模型实现遮挡鲁棒的第一人称视角3D手部运动恢复

Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao, Kaitong Cai, Chengkai Jin, Chunxiao Liu, Jianbo Liu, Siyuan Huang, Xingang Pan, Hongsheng Li

机构 * ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamHand是复用视频扩散模型的离线片段级框架,通过确定性干净潜在编码器与双向时空解码器恢复带度量位置的连续双手轨迹,在五个第一人称视角基准测试中实现最佳性能,为机器人操作数据提供可扩展路径。

Comments Project Page: this https URL (https://ggxxii.github.io/ace-ego-hand)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00798 2026-09-01 cs.CV cs.AI cs.LG 版本更新 79%

DASH: Dual-Branch Score Distillation for Guidance-Calibrated Compact Diffusion Models

DASH: 用于引导校准紧凑扩散模型的双分支分数蒸馏

Abdullah Al Shafi, Kazi Saeed Alam, Sk Imran Hossain, Engelbert Mephu Nguifo

机构 * Khulna University of Engineering & Technology(Khulna 工程与技术大学) University Clermont Auvergne(克莱蒙特-奥弗涅大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对类条件扩散模型参数压缩中无监督无条件分数分支导致引导失效的问题,提出双分支蒸馏框架DASH,通过独立监督两个分支并引入锚点正则化和课程迁移,在5.9倍压缩下保持与教师模型相近的FID和引导保真度。

Comments 30 pages, 12 figures, 19 tables. Code: this https URL (https://github.com/C-loud-Nine/DASH_Dual-Branch-Score-Distillation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22311 2026-09-01 cs.CV 版本更新 79%

PIU: Proximity-guided Identity Unlearning in ID-Conditioned Diffusion Models

PIU:基于接近性的身份去学习在ID条件化的扩散模型中

Jose Edgar Hernandez Cancino Estrada, Mauro Díaz Lupone, Žiga Emeršič, Vitomir Štruc, Peter Peer, Darian Tomašević

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学系) University of Ljubljana, Faculty of Electrical Engineering(卢布尔雅那大学电子工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了在ID条件化的扩散模型中身份去学习的问题,提出了一种基于接近性的身份去学习框架PIU,通过在学习的身份空间中重新分配源身份到选定的锚身份来实现身份移除,并结合基于ArcFace表示几何的锚点选择策略,通过局部微调少量身份敏感的交叉注意力层实现有效的去学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26783 2026-09-01 cs.CV cs.AI 版本更新 79%

Can We Change the Stroke Size for Easier Diffusion?

我们能否通过改变笔触大小来使扩散更简单?

Yunwei Bai, Ying Kiat Tan, Yao Shu, Tsuhan Chen

机构 * National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究通过控制笔触大小改变监督目标的粗糙度,以缓解低信噪比下的预测挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23709 2026-09-01 cs.CV 版本更新 79%

Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion

Stream-DiffVSR: 通过自回归扩散实现低延迟可流式传输视频超分辨率

Hau-Shiang Shiu, Chin-Yang Lin, Zhixiang Wang, Chi-Wei Hsiao, Po-Fan Yu, Yu-Chih Chen, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Shanda AI Research Tokyo(盛大AI研究东京) MediaTek Inc.(联发科技股份有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Stream-DiffVSR提出一种因果条件扩散框架,通过四步蒸馏去噪器、自回归时间引导模块和轻量时间感知解码器,实现高效在线视频超分辨率,显著降低延迟并提升质量。

Comments ECCV 2026 Spotlight. Project page: this https URL (https://jamichss.github.io/stream-diffvsr-project-page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26509 2026-09-01 cs.CV 版本更新 79%

Conditional Diffusion for 3D CT Volume Reconstruction from 2D X-rays

基于条件扩散的3DCT体积重建从2DX光

Martin Rath, Morteza Ghahremani, Yitong Li, Ashkan Taghipour, Marcus Makowski, Christian Wachinger

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Western Australia (UWA)(西澳大利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AXON框架,通过多阶段扩散模型直接从真实X光重建高保真3DCT体积,采用粗到细策略和ControlNet优化,支持双平面X光输入并提升诊断分辨率。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06399 2026-09-01 cs.CV 版本更新 79%

DiffInf: Influence-Guided Diffusion for Supervision Alignment in Facial Attribute Learning

DiffInf: 基于影响的扩散法用于面部属性学习中的监督对齐

Basudha Pal, Zhaoyang Wang, Rama Chellappa

机构 * Departement of Electrical and Computer Engineering(电气与计算机工程系) Departement of Biomedical Engineering(生物医学工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffInf通过自影响引导的扩散方法,修复面部属性学习中的标注不一致,提升分类泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏