arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2508.04559 2026-04-15 cs.CV 79%

One Model for All: Unified Try-On and Try-Off in Any Pose via LLM-Inspired Bidirectional Tweedie Diffusion

一个模型解决所有问题:通过LLM启发的双向 Tweedie 扩散实现任意姿态的统一试穿与试脱

Jinxi Liu, Zijian He, Guangrun Wang, Guanbin Li, Liang Lin

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OMFA模型,通过双向Tweedie扩散实现无需展示服装的试穿试脱,支持任意姿态,提升实际应用中的灵活性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13340 2026-04-15 cs.CV 79%

Retrievals Can Be Detrimental: Unveiling the Backdoor Vulnerability of Retrieval-Augmented Diffusion Models

检索可能有害:揭示检索增强扩散模型的后门漏洞

Hao Fang, Xiaohang Sui, Hongyao Yu, Kuofeng Gao, Jiawei Kong, Sijin Yu, Bin Chen, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文揭示了检索增强扩散模型(RDM)的后门漏洞,通过多模态对比攻击方法BadRDM,展示了如何利用检索数据库中的毒害代理进行攻击,同时保持模型的正常功能。

Comments Accepted by ACL-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12152 2026-04-15 cs.CV cs.AI 79%

Domain-Specific Latent Representations Improve the Fidelity of Diffusion-Based Medical Image Super-Resolution

领域特定潜在表示提高基于扩散的医学图像超分辨率的保真度

Sebastian Cajas, Ashaba Judith, Rahul Gorijavolu, Sahil Kapadia, Hillary Clinton Kasimbazi, Leo Kinyera, Emmanuel Paul Kwesiga, Sri Sri Jaithra Varma Manthena, Luis Filipe Nakayama, Ninsiima Doreen, Leo Anthony Celi

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Biomedical Engineering, Mbarara University of Science and Technology(姆巴拉大学科学与技术学院生物医学工程系) Johns Hopkins University(约翰霍普金斯大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Makerere University(Makerere大学) Federal University of São Paulo(圣保罗联邦大学) Technical University of Applied Sciences Lübeck (TH Lübeck)(吕贝克应用技术大学) Harvard T.H. Chan School of Public Health(哈佛大学T.H. Chan公共卫生学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文通过替换通用稳定扩散VAE为领域特定的MedVAE,显著提升了医学图像超分辨率的PSNR,验证了领域特定自动编码器对重建质量的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11390 2026-04-15 cs.CV 79%

Beyond Reconstruction: Reconstruction-to-Vector Diffusion for Hyperspectral Anomaly Detection

超越重建:超谱异常检测中的重建到向量扩散

Jijun Xiang, Tao Wang, Jiayi Wang, Pengxiang Wang, Cheng Chen, Nian Wang

机构 * Rocket Force University of Engineering(火箭军工程大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出R2VD方法,通过四阶段流程解决超谱异常检测中重建终点范式的局限,利用向量动力学实现更稳健的目标检测与背景抑制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01591 2026-04-15 cs.LG cs.AI cs.CV 79%

FAST-DIPS: Adjoint-Free Analytic Steps and Hard-Constrained Likelihood Correction for Diffusion-Prior Inverse Problems

FAST-DIPS: 无训练分析步骤和硬约束似然校正用于扩散先验逆问题

Minwoo Kim, Seunghyeok Shin, Hongki Lim

机构 * Department of Electrical and Computer Engineering, Inha University(信息电子工程系,釜山大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无训练扩散先验求解器,通过硬测量空间可行性约束和分析最优步长,减少迭代次数,实现高效逆问题求解,实验显示在PSNR/SSIM/LPIPS上表现优异,速度提升达19.5倍。

Journal ref International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25749 2026-04-15 cs.CV cs.AI 79%

ART-VITON: Measurement-Guided Latent Diffusion for Artifact-Free Virtual Try-On

ART-VITON: 基于测量的潜变量扩散模型用于无瑕疵虚拟试穿

Junseo Park, Hyeryung Jang

机构 * Department of Computer Science & Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ART-VITON通过测量引导的扩散框架解决虚拟试穿中非试穿区域的保真度问题,结合残差先验初始化和无瑕疵测量引导采样,提升视觉保真度和鲁棒性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11559 2026-04-14 cs.CV physics.med-ph 79%

Progressively Texture-Aware Diffusion for Contrast-Enhanced Sparse-View CT

逐步纹理感知扩散用于对比增强稀疏视图CT

Tianqi Wang, Wenchao Du, Hongyu Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出逐步纹理感知扩散模型,通过粗到细框架提升稀疏视图CT重建的结构相似性和视觉效果,仅需少量采样步即可实现高质量与高保真度的平衡。

Comments ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11097 2026-04-14 cs.CV 79%

CDPR: Cross-modal Diffusion with Polarization for Reliable Monocular Depth Estimation

CDPR:基于极化交叉模态扩散的可靠单目深度估计

Rongjia Yu, Tong Jia, Hao Wang, Xiaofang Li, Xiao Yang, Zinuo Zhang, Cuiwei Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CDPR框架,通过融合RGB和极化图像信息提升单目深度估计鲁棒性,尤其在复杂场景中表现优异。

Comments preprint version of IEEE TMM 2026 Regular Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01390 2026-04-14 cs.CV 79%

FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution

FRAMER:基于扩散先验的频率对齐自蒸馏与自适应调制的现实世界图像超分辨率

Seungho Choi, Jeahun Sung, Jihyong Oh

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FRAMER通过利用扩散先验,采用频率对齐自蒸馏和自适应调制方法,提升现实世界图像超分辨率的PSNR/SSIM及感知指标。

Comments CVPR 2026 (camera ready ver.). Please visit our project page at https://cmlab-korea.github.io/FRAMER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13292 2026-04-14 cs.CV 79%

DiffClean: Diffusion-based Makeup Removal for Accurate Age Estimation

DiffClean: 基于扩散模型的化妆去除用于准确年龄估计

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffClean,通过文本引导的扩散模型去除化妆痕迹,提升年龄估计和面部验证的准确性,有效对抗化妆攻击。

Comments Revised version with minor changes and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10465 2026-04-14 cs.LG cs.AI cs.CV 79%

Rethinking the Diffusion Model from a Langevin Perspective

从兰格罕视角重新思考扩散模型

Candi Zheng, Yuan Lan

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科技大学数学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从兰格罕视角系统整理扩散模型,提供更直观的解释,探讨ODE和SDE模型统一框架及扩散模型优于VAE的理论依据。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12156 2026-04-14 cs.GR 79%

SmokeSVD: Smoke Reconstruction from A Single View via Progressive Novel View Synthesis and Refinement with Diffusion Models

SmokeSVD:通过扩散模型进行渐进式新视角合成与细化实现单视角烟雾重建

Chen Li, Shanshan Dong, Sheng Qiu, Jianmin Han, Yibo Zhao, Zan Gao, Taku Komura, Kemeng Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出SmokeSVD框架,结合扩散模型生成能力与物理引导优化,实现单视角动态烟雾重建,通过多阶段渐进过程生成高质量多视角序列,提升重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20704 2026-04-14 cs.CV cs.LG 79%

HFI: A unified framework for training-free detection and implicit watermarking of latent diffusion model generated images

HFI:一种用于训练自由检测和隐式水印的潜在扩散模型生成图像的统一框架

Sungik Choi, Hankook Lee, Jaehoon Lee, Seunghyun Kim, Stanley Jungkyu Choi, Moontae Lee

机构 * LG AI Research(LG AI研究院) Sungkyunkwan University(成均馆大学) University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HFI框架,用于训练自由检测和隐式水印,通过分析潜在扩散模型生成图像的高频信息畸变,有效检测复杂背景图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17163 2026-04-14 cs.CV 79%

OSDFace: One-Step Diffusion Model for Face Restoration

OSDFace:面向面部修复的一步扩散模型

Jingkai Wang, Jue Gong, Lin Zhang, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OSDFace提出一种一步扩散模型,通过视觉嵌入器和面部身份损失提升面部修复的视觉质量和身份一致性。

Comments Accepted to CVPR 2025. The code and model will be available at https://github.com/jkwang28/OSDFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10085 2026-04-14 cs.CV 79%

Particle Diffusion Matching: Random Walk Correspondence Search for the Alignment of Standard and Ultra-Widefield Fundus Images

粒子扩散匹配:用于标准和超宽场视网膜图像对齐的随机游走对应搜索

Kanggeon Lee, Soochahn Lee, Kyoung Mu Lee

机构 * ASRI, Dept. of ECE, Seoul National University(首尔大学电气与计算机工程系ASRI) School of Electrical Engineering, Kookmin University(国民大学电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种稳健的对齐技术,通过扩散模型引导的迭代随机游走对应搜索(RWCS)实现标准视网膜图像(SFIs)和超宽场视网膜图像(UWFIs)的对齐,解决了尺度、外观差异和特征稀少的问题,展示了在多个视网膜图像对齐基准上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10084 2026-04-14 cs.CV 79%

Active Diffusion Matching: Score-based Iterative Alignment of Cross-Modal Retinal Images

主动扩散匹配:基于分数模型的跨模态视网膜图像迭代对齐

Kanggeon Lee, Su Jeong Song, Soochahn Lee, Kyoung Mu Lee

机构 * ASRI, Dept. of ECE, Seoul National University(首尔大学电子与计算机工程系ASRI) Dept. of Ophthalmology, Kangbuk Samsung Hospital, Sungkyunkwan University(成均馆大学三星首尔医院眼科) School of Electrical Engineering, Kookmin University(国民大学电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出主动扩散匹配方法,通过迭代 Langevin 马尔可夫链联合估计全局和局部变换,实现视网膜图像的跨模态对齐,实验表明其在对齐精度上达到最先进的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10040 2026-04-14 cs.CV 79%

Intra-finger Variability of Diffusion-based Latent Fingerprint Generation

基于扩散模型的指纹生成内部手指变异性研究

Noor Hussein, Anil K. Jain, Karthik Nandakumar

机构 * Michigan State University(密歇根州立大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文系统评估了使用先进扩散模型生成的合成指纹(特别是潜在指纹)的内部手指变异性,通过构建包含七种多样数据集的潜在风格库,提高了生成模型的潜在风格多样性,并分析了生成指纹中ridge和 minutiae的完整性。

Comments Accepted at the 2nd Workshop on Foundation and Generative Models in Biometrics (FoundGen-Bio), held in conjunction with CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09838 2026-04-14 cs.CV 79%

Vector Field Synthesis with Sparse Streamlines Using Diffusion Model

基于扩散模型的稀疏流线向量场合成

Nguyen K. Phan, Ricardo Morales, Sebastian D. Espriella, Guoning Chen

机构 * University of Houston(休斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的向量场合成方法,利用稀疏流线输入生成符合物理规律的2D向量场,通过条件去噪扩散模型和分类器自由引导,实现几何和物理约束的保真重建。

Comments 5 pages, 4 figures; published at IEEE VIS 2025

Journal ref 2025 IEEE Visualization and Visual Analytics (VIS), pp. 296-300

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02003 2026-04-14 cs.CV 79%

ProDiG: Progressive Diffusion-Guided Gaussian Splatting for Aerial to Ground Reconstruction

ProDiG:渐进式扩散引导高斯点云法用于空到地重建

Sirshapan Mitra, Yogesh S. Rawat

机构 * CRCV, University of Central Florida(中佛罗里达大学计算机视觉研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ProDiG方法,通过扩散引导逐步将空视图转换为地面级视图,利用几何感知因果注意力模块和距离自适应高斯模块,实现高斯点云的渐进式优化,提升重建的几何一致性和鲁棒性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05880 2026-04-14 cs.CV 79%

Contour Refinement using Discrete Diffusion in Low Data Regime

利用离散扩散进行低数据环境下的轮廓优化

Fei Yu Guan, Ian Keefe, Sophie Wilkinson, Daniel D. B. Perrakis, Steven Waslander

机构 * University of Toronto(多伦多大学) Simon Fraser University(西蒙弗雷泽大学) Natural Resources Canada(加拿大自然资源部)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出轻量离散扩散轮廓优化方法,通过自注意力CNN和条件处理,在低数据环境下实现鲁棒边界检测,提升推理效率3.5倍。

Comments CRV 2026, 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09022 2026-04-13 cs.CV 79%

BlendFusion -- Scalable Synthetic Data Generation for Diffusion Model Training

BlendFusion -- 可扩展的合成数据生成用于扩散模型训练

Thejas Venkatesh, Suguna Varshini Velury

机构 * Samaya AI, Inc.(Samaya AI公司) Stanford University(斯坦福大学) Independent Researcher(独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出BlendFusion框架,通过路径追踪生成高质量图像-描述对,构建FineBLEND数据集,并分析其质量及与现有数据集的对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08945 2026-04-13 cs.CV cs.RO 79%

TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches

TouchAnything: 从稀疏机器人触碰引导的3D重建

Langzhe Gu, Hung-Jui Huang, Mohamad Qadri, Michael Kaess, Wenzhen Yuan

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TouchAnything框架,利用预训练的2D视觉扩散模型作为语义和几何先验,从稀疏触觉测量中实现准确的3D重建,优于现有基线方法,支持开放世界中未见过的物体实例重建。

Comments Project Page: https://grange007.github.io/touchanything

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08922 2026-04-13 cs.CV 79%

Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios

抗退化融合:一种高效的抗退化扩散框架,用于任意退化场景下的多模态图像融合

Yu Shi, Yu Liu, Zhong-Cheng Wu, Juan Cheng, Huafeng Li, Xun Chen

机构 * Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学生物医学工程系) Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种高效的抗退化扩散框架,用于处理多模态图像融合中的复杂退化场景。该框架通过隐式去噪和联合观测模型校正机制,提升了在复杂退化下的融合性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08716 2026-04-13 cs.CV 79%

What Matters in Virtual Try-Off? Dual-UNet Diffusion Model For Garment Reconstruction

虚拟试穿中什么重要?用于服装重建的双UNet扩散模型

Loc-Phat Truong, Meysam Madadi, Sergio Escalera

机构 * Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat de Barcelona, Spain(西班牙巴塞罗那大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了虚拟试穿的逆问题,提出双UNet扩散模型,通过比较生成骨干、条件设计和损失函数,实现了服装重建的先进性能,提升了基线并为未来研究提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08646 2026-04-13 cs.CV 79%

InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation

InsEdit:通过数据高效的视频扩散模型适应实现基于指令的视觉编辑

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(title);image editing(abstract);分类 cs.CV

AI总结 本文提出InsEdit,基于HunyuanVideo-1.5构建指令式编辑模型,结合Mutual Context Attention机制,仅需少量视频编辑数据即可实现高质量视频编辑,并支持图像编辑。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08546 2026-04-10 cs.CV 79%

When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例

Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学) Afari Intelligent Drive(阿法里智能驾驶)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。

Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08329 2026-04-10 eess.IV cs.MM 79%

DiV-INR: Extreme Low-Bitrate Diffusion Video Compression with INR Conditioning

DiV-INR:基于INR条件的极端低比特率扩散视频压缩

Eren Çetin, Lucas Relic, Yuanyi Xue, Markus Gross, Christopher Schroers, Roberto Azevedo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 本文提出一种结合隐式神经表示与预训练视频扩散模型的视频压缩框架,旨在解决极低比特率下的压缩问题,通过INR条件引导扩散过程,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08305 2026-04-10 eess.IV cs.AI cs.CV cs.ET cs.LG q-bio.QM 79%

HistDiT: A Structure-Aware Latent Conditional Diffusion Model for High-Fidelity Virtual Staining in Histopathology

HistDiT:一种结构感知的潜在条件扩散模型,用于病理学高保真的虚拟染色

Aasim Bin Saleem, Amr Ahmed, Ardhendu Behera, Hafeezullah Amin, Iman Yi Liao, Mahmoud Khattab, Pan Jia Wern, Haslina Makmur

机构 * Edge Hill University(埃奇希尔大学) University of Nottingham Malaysia(诺丁汉大学马来西亚分校) University of Southampton Malaysia(南安普顿大学马来西亚分校) Cancer Research Malaysia(马来西亚癌症研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HistDiT,一种新的潜在条件扩散变换器架构,通过双流条件策略和多目标损失函数提升虚拟组织染色的视觉保真度,解决传统方法在结构与染色平衡上的不足。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21366 2026-04-10 cs.CV cs.LG 79%

BADiff: Bandwidth Adaptive Diffusion Model

BADiff:带宽自适应扩散模型

Xi Zhang, Hanwei Zhu, Yan Zhong, Jiamang Wang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种带宽自适应扩散模型,通过端到端训练策略使模型根据实时网络带宽调整生成质量,提升带宽受限环境下的图像传输效率。

Comments NeurIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08084 2026-04-10 cs.CV 79%

DiffVC: A Non-autoregressive Framework Based on Diffusion Model for Video Captioning

DiffVC: 一种基于扩散模型的非自回归框架用于视频描述生成

Junbo Wang, Liangyu Fu, Yuke Li, Yining Zhu, Ya Jing, Xuecheng Wu, Jiangbin Zheng

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Beijing University Of Technology(北京工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffVC,一种基于扩散模型的非自回归框架,解决视频描述生成中自回归方法速度慢和累积误差问题,通过并行解码和判别性条件扩散模型提升生成质量,实验表明其在多个数据集上优于非自回归方法并接近自回归方法。

详情

展开后加载摘要…

URL PDF HTML 收藏