arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1384 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1384 篇

2512.17310 2026-08-04 cs.CR 版本更新 80%

Cryptanalysis of LDPC-Based Pseudorandom Error-Correcting Codes

基于LDPC的伪随机纠错码的密码分析

Tianrui Wang, Anyu Wang, Tianshuo Cong, Delong Ran, Jinyuan Liu, Xiaoyun Wang

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 首次对LDPC-PRC进行密码分析,提出三种攻击破坏其不可检测性和安全性,在DeepSeek和Stable Diffusion等模型上验证有效,并给出防御建议。

Comments Accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09235 2026-07-01 cs.LG cs.AI stat.ML 版本更新 80%

On Variance Reduction in Learning Mean Flows

在学习均值流中的方差缩减

Juanwu Lu, Ziran Wang

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 本文通过理论分析揭示了均值流训练中损失非递减和梯度方差无界的问题根源,提出最优系数的闭式解,并在基准和Diffusion Transformer上验证了其提升样本质量和FID趋势的效果。

Comments 27 pages, 8 figures, 8 tables. Added supplementary experiment: independent validation of the small-bias regime, to break the circularity in bias estimation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22700 2026-08-21 cs.CV 版本更新 79%

4DLoG: Generative Modeling of Neurodegenerative Brain Anatomy with 4D Longitudinal Diffusion Model

利用4D纵向扩散模型生成神经退行性脑解剖结构

Nivetha Jayakumar, Swakshar Deb, Bahram Jafrasteh, Qingyu Zhao, Miaomiao Zhang

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Radiology(放射学系) Department of Electrical and Computer Engineering, Department of Computer Science(电气与计算机工程系、计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种4D纵向扩散模型,用于生成神经退行性疾病的脑解剖结构,通过临床变量条件生成准确的脑部变化轨迹,验证了其在疾病分类和分割中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18400 2026-08-21 eess.IV cs.CV 版本更新 79%

Exploiting Completeness Perception with Diffusion Transformer for Unified 3D MRI Synthesis

利用扩散变换器的完整性感知实现统一的3D MRI合成

Junkai Liu, Nay Aung, Theodoros N. Arvanitis, Joao A. C. Lima, Steffen E. Petersen, Le Zhang

机构 * School of Engineering, University of Birmingham, UK(伯明翰大学工程学院) William Harvey Research Institute, Queen Mary University London, UK(女王玛丽大学伦敦威廉·哈里维研究所) Barts Heart Centre, St Bartholomew’s Hospital, Barts Health NHS Trust, UK(巴特勒心脏中心,圣巴塞洛缪医院,巴特勒健康 NHS信托) Division of Cardiology, Johns Hopkins University School of Medicine, US(约翰霍普金斯大学医学院心脏病科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CoPeDiT模型,通过完整性感知机制提升3D MRI合成的语义一致性与鲁棒性。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15648 2026-08-21 cs.LG cs.CE cs.CV 版本更新 79%

Guided Diffusion by Optimized Loss Functions on Relaxed Parameters for Inverse Material Design

通过放松参数优化损失函数引导扩散用于逆材料设计

Jens U. Kreber, Christian Weißenfels, Joerg Stueckler

机构 * Intelligent Perception in Technical Systems Group, University of Augsburg, Germany(技术系统智能感知组,乌尔姆大学,德国) Faculty of Mathematics, Natural Science and Engineering, University of Augsburg, Germany(数学、自然科学与工程学院,乌尔姆大学,德国) Centre for Advanced Analytics and Predictive Sciences, University of Augsburg, Germany(高级分析与预测科学中心,乌尔姆大学,德国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过优化损失函数引导扩散模型,用于逆材料设计,实现高效且多样化的设计生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05441 2026-08-21 cs.CV cs.LG 版本更新 79%

Decoupling High and Low Frequencies for Faithful Image Generation with Fine Details

解耦高低频以生成具有精细细节的忠实图像

Tejaswini Medi, Hsien-Yi Wang, Arianna Rampini, Margret Keuper

机构 * University of Mannheim(曼海姆大学) Autodesk AI Lab(Autodesk人工智能实验室) MPI for Informatics(信息研究所)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 该研究针对潜在生成模型难以恢复图像高频细节的问题,提出DeBaT解耦频带分词器,将其集成到潜在扩散模型后,可生成更锐利、更真实的图像样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11748 2026-08-20 cs.CV 版本更新 79%

Dual Modality Prompted Diffusion Priors for Zero Shot Hyperspectral Pansharpening

用于零样本高光谱 pansharpening 的双模态提示扩散先验

Pengwei Xie, Fei Zhu, Jiajun Li, Xiangyuan Liu, Xiangyuan Liu, Kangqing Shen, Gemine Vivone

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Peking University(北京大学) National Center for Applied Mathematics Shenzhen (NCAMS), Southern University of Science and Technology(南方科技大学深圳应用数学国家中心) Department of Automation, Tsinghua University(清华大学自动化系) National Research Council of Italy, Institute of Integrated Methodologies for Earth Observation (CNR-IMIOT)(意大利国家研究委员会综合地球观测方法研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对零样本高光谱 pansharpening 问题,提出双模态提示扩散模型 DIDM,通过双模态提示注入与全色引导正则化实现空间细节与光谱保真的平衡,在多数据集实验中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21307 2026-08-20 cs.CV 版本更新 79%

The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models

可解释令牌的线性几何:未学习扩散模型的越狱攻击与防御

Siyi Chen, Yimeng Zhang, Sijia Liu, Qing Qu

机构 * Department of Electrical Engineering & Computer Science, University of Michigan(电气工程与计算机科学系,密歇根大学) Department of Computer Science, Michigan State University(计算机科学系,密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究揭示未学习扩散模型中擦除的有害概念以线性子空间存在,提出SubAttack越狱攻击与SubDefense防御,实验表明其提升了对扩散未学习漏洞的理解与缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26747 2026-08-19 cs.CV cs.LG 版本更新 79%

From Diffusion to Flow: Efficient Motion Generation in MotionGPT3

从扩散到流:在MotionGPT3中实现高效的运动生成

Jaymin Bhan, JiHong Jeon, SangYeop Jeong

机构 * Department of Applied Artificial Intelligence(应用人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文比较了扩散与校正流在MotionGPT3中的表现,发现流在训练速度、性能和效率上更具优势。

Comments ReALM-GEN Workshop ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11534 2026-08-19 cs.CV 版本更新 79%

Risk-Controllable Multi-View Diffusion for Driving Scenario Generation

可控风险多视角扩散用于驾驶场景生成

Hongyi Lin, Wenxiu Shi, Heye Huang, Dingyi Zhuang, Song Zhang, Yang Liu, Xiaobo Qu, Jinhua Zhao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RiskMV-DPO通过整合风险水平与物理风险建模,实现可控风险的多视角驾驶场景生成,提升3D检测性能并减少FID,推动安全导向的具身智能发展。

Comments 10 pages, 4 figures; accepted at the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE). Updated to the complete camera-ready version

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10162 2026-08-18 cs.CV 版本更新 79%

MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text

MAD-HOI:用于从文本生成关节手-物体交互的掩码自回归扩散模型

Ananya Bal, Kartik Sharma, Ethan Lai, Samyak Tiwari, Liza Dahiya, Chaitanya Chawla, Laszlo A. Jeni

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MAD-HOI是一种结合掩码自回归与扩散的HOI生成模型,可生成多样且符合物理规律的手-物体交互序列,支持可变长度生成、运动补全填充等功能,在ARCTIC和GRAB数据集上优于开源基线。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18736 2026-08-18 cs.CV 版本更新 79%

Spectral Progressive Diffusion for Efficient Image and Video Generation

频域渐进扩散用于高效图像和视频生成

Howard Xiao, Brian Chao, Lior Yariv, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种频域渐进扩散框架,通过在预训练扩散模型的去噪轨迹中逐步提高分辨率,实现高效的图像和视频生成,同时改进了效率和质量。

Comments Project website at https://howardxiao.ca/speed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17555 2026-08-18 cs.CV cs.AI 版本更新 79%

FrescoDiffusion: 4K Image-to-Video with Prior-Regularized Tiled Diffusion

FrescoDiffusion: 4K图像到视频的先验正则化拼接扩散

Hugo Caselles-Dupré, Mathis Koroglu, Guillaume Jeanneret, Arnaud Dapogny, Matthieu Cord

机构 * Obvious Research, Paris, France Institute of Intelligent Systems(Obvious Research,巴黎,法国智能系统研究所) Robotics - Sorbonne University, Paris, France(机器人学 - 索邦大学,巴黎,法国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FrescoDiffusion通过先验正则化拼接扩散方法,实现从单张复杂图像生成4K图像到视频,提升全局一致性与细节保真度。

Comments 5 authors. Hugo Caselles-Dupré, Mathis Koroglu, and Guillaume Jeanneret contributed equally. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10076 2026-08-18 cs.CV 版本更新 79%

Mitigating Error Accumulation in Co-Speech Motion Generation via Global Rotation Diffusion and Multi-Level Constraints

通过全局旋转扩散和多级约束缓解语音同步运动生成中的误差累积

Xiangyue Zhang, Jianfang Li, Jianqiang Ren, Jiaxu Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GlobalDiff,通过全局旋转扩散和多级约束缓解语音同步运动生成中的误差累积,提升生成运动的平滑度和准确性。

Comments AAAI 2026. Project page: https://xiangyuezhang.com/GlobalDiff/; code and pretrained models: https://github.com/Xiangyue-Zhang/GlobalDiff

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(15), 12834-12842, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18911 2026-08-18 cs.LG cs.AI cs.CV 版本更新 79%

Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching

重新思考逐令牌特征缓存:通过双特征缓存加速扩散Transformer

Chang Zou, Shikang Zheng, Evelyn Zhang, Runlin Guo, Haohang Xu, Zhengyi Shi, Conghui He, Xuming Hu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(南方科技大学) Beihang University(北航) Huawei Technologies Ltd(华为技术有限公司) Shanghai AI Lab(上海人工智能实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对逐令牌特征缓存的核心问题提出质疑,提出双特征缓存方法DuCa,在DiT等生成模型上实现了优于现有逐令牌特征缓存的性能。

Journal ref IEEE Transactions on Image Processing, vol. 35, pp. 6211-6220, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09231 2026-08-17 cs.CV 版本更新 79%

BAG: Budget-Aware Gating for Diffusion Caching

BAG:面向扩散缓存的预算感知门控机制

Tong Zhao, Mingkun Lei, Yucheng Han, Chi Zhang

机构 * Westlake AGI Lab(西湖AGI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出BAG(预算感知门控机制),通过离线到在线调度蒸馏训练轻量门控网络,在FLUX.1-dev和Wan2.1上实现优于现有最优缓存方法的性能。

Comments 23 pages, 13 figures, and 14 tables. Code Link: see AGI-Lab/BAG" target="_blank" rel="noopener">https://github.com/Westlake-AGI-Lab/BAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01677 2026-08-14 cs.CV cs.LG 版本更新 79%

Generative Brownian Bridge Diffusion In Motion Space For Enhanced Myocardial Strain Analysis

用于增强心肌应变分析的运动空间生成布朗桥扩散模型

Rishov Paul, Frederick H. Epstein, Miaomiao Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出运动空间生成布朗桥扩散模型,以标准CMR图像为条件学习运动映射,在多中心CMR数据集上验证其可提升应变分析准确性,为开发临床可用的低成本心脏评估AI工具提供新范式。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17492 2026-08-14 cs.CV 版本更新 79%

EvDiff: Event-Based Video Reconstruction using One-Step Diffusion Models

EvDiff:高质视频与事件相机

Weilun Li, Lei Sun, Ruixi Gao, Qi Jiang, Yuqin Ma, Kaiwei Wang, Ming-Hsuan Yang, Luc Van Gool, Danda Pani Paudel

机构 * Zhejiang University(浙江大学) INSAIT UC Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EvDiff通过基于事件的扩散模型和替代训练框架,从单色事件流生成高质量彩色视频,提升视频生成的保真度和现实感。

Comments Replacement note: This manuscript has been transferred from the CVPR format to the ECCV 2026 format, with the corresponding title and template updated accordingly. The technical content remains largely unchanged from the previous version. (Current version: 21 pages, 6 figures, and 3 tables.) Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27345 2026-08-13 cs.CV 版本更新 79%

SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers

RayPE: 用于3D感知视频生成的射线空间位置编码

Minghao Yin, Jiahao Lu, Wenbo Hu, Wang Zhao, Shan Ying, Kai Han

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) ARC Lab, Tencent(腾讯ARC Lab)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出RayPE,通过向自注意力注入6D Plücker坐标编码射线几何关系,提升视频扩散Transformer的3D一致性和相机可控性。

Comments Project page: https://visual-ai.github.io/scope/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07661 2026-08-13 cs.CV 版本更新 79%

Optimization-Guided Diffusion for Interactive Scene Generation

基于优化的扩散生成交互场景

Shihao Li, Naisheng Ye, Tianyu Li, Kashyap Chitta, Tuo An, Peng Su, Boyang Wang, Haiou Liu, Chen Lv, Hongyang Li

机构 * Beijing Institute of Technology(北京理工大学) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Nanyang Technological University(南洋理工大学) NVIDIA Research(英伟达研究院) Yinwang Intelligent Tech. Co. Ltd.(银网智能科技有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OMEGA框架,通过优化引导扩散过程生成符合物理和行为约束的多智能体驾驶场景,提升生成场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02943 2026-08-13 cs.CV 版本更新 79%

TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration

TC-Padé:轨迹一致的Padé近似用于扩散加速

Benlei Cui, Shaoxuan He, Bukun Huang, Zhizeng Ye, Yunyun Sun, Longtao Huang, Hui Xue, Yang Yang, Jingqun Tang, Zhou Zhao, Haiwen Hong

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang Gongshang University(浙江工商大学) ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出轨迹一致的Padé近似方法,通过有理函数建模特征演变,实现低步数下的高效扩散模型加速。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16188 2026-08-12 cs.CV 版本更新 79%

TEASR: Training-Efficient Any-Step Diffusion Transformer for Real-World Image Super-Resolution

teasr: 面向真实世界图像超分辨率的训练高效任意步扩散Transformer

Xiang Gao, Chenxin Zhu, Yushun Fang, Qiang Hu, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TEASR框架,通过自对抗蒸馏和时步感知矫正策略,在单一扩散模型中实现任意步采样,无需辅助教师模型,显著提升训练效率并超越现有方法。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13058 2026-08-12 cs.CV cs.AI 版本更新 79%

SynBoost: A Synergistic Framework for Fast Sampling of Diffusion Models

SynBoost:用于扩散模型快速采样的协同框架

Hu Yu, Hao Luo, Xueyang Fu, Jie Huang, Fan Wang, Feng Zhao

机构 * USTC(中国科学技术大学) DAMO Academy, Alibaba Group(阿里云达摩院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对扩散模型采样速度慢的问题,提出无需训练的SynBoost框架,通过双误差解耦策略缓解离散化与近似误差,可与现有采样器集成并提升速度与生成质量,在少步数场景中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27974 2026-08-11 cs.CV 版本更新 79%

Now You Have My Healthy Attention: A U-DiT for Brain-MRI Inpainting

现在你拥有我的健康注意力:用于脑部MRI修复的U-DiT

Danilo Danese, Angela Lombardi, Tommaso Di Noia

机构 * Politecnico di Bari(巴里理工大学)

专题命中 扩散模型 :inpainting(title,abstract);分类 cs.CV

AI总结 针对脑部MRI修复任务,提出U-DiT模型,结合对侧对称先验与注意力约束,在BraTS-2026验证集219例病例上取得健康区域SSIM 0.864等优异指标,提升了解剖学合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14513 2026-08-11 cs.CV cs.AI 版本更新 79%

HEART: Exploiting Head Heterogeneity in Sparse Attention for Video Diffusion

HASTE:通过头级自适应稀疏注意力实现无训练视频扩散加速

Xuzhe Zheng, Yuexiao Ma, Jing Xu, Xiawu Zheng, Rongrong Ji, Fei Chao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HASTE框架,通过时间掩码复用和误差引导预算校准,提升无训练稀疏注意力在视频生成中的速度与质量平衡,实现在720P下1.93倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25003 2026-08-11 cs.LG cs.CV 版本更新 79%

Score-based Membership Inference on Diffusion Models

基于扩散模型的分数化成员推断

Mingxing Rao, Bowen Qu, Daniel Moyer

机构 * Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SimA攻击方法,通过预测噪声向量实现高效成员推断,优于现有多查询方法,在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27519 2026-08-11 cs.CV 版本更新 79%

SPROUT: A Scalable Diffusion Foundation Model for Agricultural Vision

SPROUT:一种用于农业视觉的可扩展扩散基础模型

Shuai Xiang, James Burridge, Shouyang Liu, Hao Lu, Tokihiro Fukatsu, Yinqiang Zheng, Wei Guo

机构 * Graduate School of Agricultural and Life Sciences, The University of Tokyo(东京大学大学院农学生命科学研究科) National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学多谱信息智能处理技术全国重点实验室、人工智能与自动化学院) Institute of Agricultural Machinery, NARO(日本国立研究开发法人农业·食品产业技术综合研究机构农业机械研究所) Institute of Life and Environmental Sciences, University of Tsukuba(筑波大学生命环境科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SPROUT是一种基于扩散去噪的多作物多任务农业基础模型,通过大规模未标注数据预训练,在多种下游任务中表现优异,且预训练成本较低。

Comments Code: https://github.com/UTokyo-FieldPhenomics-Lab/SPROUT Dataset: https://huggingface.co/datasets/XIANG-Shuai/MCD-2.6m

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18093 2026-08-11 cs.CV 版本更新 79%

Predict to Skip: Linear Multistep Feature Forecasting for Efficient Diffusion Transformers

预测以跳过:线性多步特征预测用于高效的扩散变换器

Hanshuai Cui, Zhiqing Tang, Qianli Ma, Zhi Yao, Weijia Jia, Wei Zhao

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing 100875, China(人工智能学院,北京师范大学,北京) Institute of Artificial Intelligence(人工智能研究所) Future Networks, Beijing Normal University, Zhuhai 519087, China(未来网络,北京师范大学,珠海)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PrediT通过线性多步特征预测方法,在不训练的情况下加速扩散变换器,实现显著的延迟降低同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00506 2026-08-11 cs.CV 版本更新 79%

Affordance-Guided Diffusion Prior for 3D Hand Reconstruction

用于3D手部重建的可负担性引导扩散先验

Naru Suzuki, Takehiko Ohkawa, Tatsuro Banno, Jihyun Lee, Ryosuke Furuta, Yoichi Sato

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究在手部大量被遮挡时3D手部姿势重建问题;核心方法是用基于扩散的生成模型,由视觉语言模型推断的可负担性描述引导;主要贡献是显著提升手部姿势估计准确性,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://narusuzuki.github.io/projects/26-affhandgen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18469 2026-08-11 cs.CV 版本更新 79%

HonestFace: Towards Honest Face Restoration with One-Step Diffusion Model

HonestFace:基于单步扩散模型的诚实人脸复原方法

Jingkai Wang, Wu Miao, Jue Gong, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出基于单步扩散模型的HonestFace人脸复原方法,通过身份嵌入器、掩码人脸对齐等组件构建新数据集MultiRefCeleb-Test,其性能优于现有最优方法。

Comments Published at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏