arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70082 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2606.25535 2026-06-25 cs.CV 新提交 79%

Spatio-Temporal Mixture-of-Modality-Experts Diffusion for Quantitative DCE-MRI Synthesis from Incomplete MR Sequences

时空模态专家混合扩散:从不完整MR序列合成定量DCE-MRI

Junhyeok Lee, Kyu Sung Choi

机构 * Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine(首尔大学医学院癌症生物学跨学科项目) Department of Radiology, Seoul National University Hospital(首尔大学医院放射科) Department of Radiology, Seoul National University College of Medicine(首尔大学医学院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔大学医院医疗人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出时空模态专家混合(ST-MoME)条件扩散框架,通过时空门控网络融合多模态专家特征,从任意子集合成3D DCE参数图,在386例脑肿瘤数据上16种缺失场景下取得最优NMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25390 2026-06-25 cs.CV cs.AI 新提交 79%

Anatomically-conditioned Latent Diffusion Model for Data-Efficient Few-Shot Cross-Domain 3D Glioma MRI Synthesis

解剖条件约束的潜在扩散模型用于数据高效的小样本跨域3D胶质瘤MRI合成

Salman Shaik, Truong Thanh Hung Nguyen, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick, Canada(新不伦瑞克大学分析无处不在实验室,加拿大)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出解剖条件约束的潜在扩散模型(ALDM),通过两阶段框架(3D变分自编码器学习解剖先验,ControlNet引导的潜在扩散生成结构一致体积)在仅16张目标图像的小样本设置下优于GAN基线,实现FID 85.40和分类AUC 0.987。

Comments Published in Canadian AI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25255 2026-06-25 cs.CV 新提交 79%

Cross-Modality Structural Guidance in 3D Latent Diffusion for Robust FLAIR Super-Resolution

跨模态结构引导的3D潜在扩散用于鲁棒FLAIR超分辨率

Haoyu Lan, Jiazhen Zhang, John Onofrey, Bino Varghese, Nasim Sheikh-Bahaei, Arthur W. Toga, Jeiran Choupan

机构 * University of Southern California(南加州大学) Yale University(耶鲁大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MR-DiffuSR框架,利用HR T1w结构先验通过跨模态结构swin注意力引导厚层FLAIR超分辨率,采用混合尺度退化策略和DINOv3感知损失,在ADNI-4数据集上优于CNN和2D扩散方法,并在下游白质高信号分割中保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25661 2026-06-25 cs.CV 版本更新 79%

DRM: Diffusion-based Reward Model With Step-wise Guidance

DRM: 基于扩散的奖励模型与逐步引导

Jaxon Zhang, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17917 2026-06-25 cs.LG cs.AI cs.CL cs.CV 版本更新 79%

Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding

Streaming-dLLM: 通过后缀剪枝和动态解码加速扩散大语言模型

Zhongyu Xiao, Zhiwei Hao, Jianyuan Guo, Yong Luo, Jia Liu, Jie Xu, Han Hu

机构 * School of information(信息学院) Electronics, Beijing Institute of Technology, Beijing(电子学院,北京理工大学,北京) Department of Computer Science, City University of Hong Kong, Hong Kong(计算机科学系,香港城市大学,香港) School of Computer Science, Wuhan University, Wuhan(计算机科学学院,武汉大学,武汉) School of Economics(经济学院) Management, Communication University of China, Beijing(管理学院,中国传媒大学,北京) School of Science(科学学院) Engineering, The Chinese University of Hong Kong (Shenzhen), Shenzhen(工程学院,香港中文大学(深圳),深圳)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Streaming-dLLM,通过空间上的注意力引导后缀建模剪枝冗余掩码令牌和时间上的动态置信度感知早停策略,实现无需训练的扩散大语言模型推理加速,最高达68.2倍加速且保持生成质量。

Comments Tech report. Code is available at https://github.com/xiaoshideta/Streaming-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24874 2026-06-24 cs.CV cs.AI 新提交 79%

FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation

FLUX3D: 基于扩散对齐稀疏表示的高保真3D高斯生成

Haorui Ji, Weizhe Liu, Hongdong Li, Hengkai Guo

机构 * The Australian National University(澳大利亚国立大学) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FLUX3D框架,通过扩散对齐结构化潜变量(DA-SLAT)和稀疏结构感知扩散变压器(SMDiT)解决稀疏体素表示中高频细节丢失和跨模态对齐问题,实现高保真图像到3D高斯生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24192 2026-06-24 cs.CV cs.AI cs.CL 新提交 79%

Co-occurring associated retained concepts in Diffusion Unlearning

扩散模型遗忘中的共现关联保留概念

Miso Kim, Georu Lee, Yunji Kim, Hoki Kim, Jinseong Park, Woojin Lee

机构 * Dongguk University-Seoul(东国大学-首尔) Chung-Ang University(Chung-Ang 大学) Korea Institute for Advanced Study(韩国高级研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散模型遗忘中误删良性共现概念的问题,提出CARE评分量化保留程度,并设计ReCARE框架通过自动构建CARE集实现稳健遗忘,平衡概念擦除、整体效用与共现概念保留。

Comments Accepted as a poster at ICLR 2026. Code available at https://github.com/damilab/CARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24161 2026-06-24 cs.CV 新提交 79%

Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement

基于扩散解耦的双分支交叉投影去偏

Xiangqian Zhao, Xinyang Jiang, Zhipeng Xu, Lingfeng He, Zilong Wang, Dongsheng Li, De Cheng, Nannan Wang

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对有偏数据下基础模型的泛化问题,提出置信引导的偏差概念挖掘(CBCM)和双分支交叉投影去偏(DCD)框架,通过扩散解耦和交叉零空间投影分离目标与虚假特征,在无组标签条件下实现最差组准确率最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22371 2026-06-24 eess.IV cs.CV 新提交 79%

ZeroGVC: Zero-Shot Generative Video Compression with Autoregressive Diffusion Priors

ZeroGVC:基于自回归扩散先验的零样本生成式视频压缩

Yixin Gao, Xiaohan Pan, Lin Liu, Xin Li, Zhibo Chen, Qi Tian

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Inc(华为公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ZeroGVC,一种零样本生成式视频压缩框架,利用预训练自回归扩散先验,通过码本引导的自回归潜压缩和双向参考模式,在超低码率下实现高质量感知重建,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22314 2026-06-24 cs.LG cs.AI cs.CV 新提交 79%

Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution

扩散积分梯度:用于灵活特征归因的可控路径生成

Soyeon Kim, Kyowoon Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) Ajou University(亚洲大学) INEEJI Corp.(INEEJI公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出扩散积分梯度(DiffIG),通过扩散模型生成路径并嵌入用户引导,实现灵活可控的特征归因,在定量和定性上优于现有方法。

Comments 44 pages, 22 figures, 10 tables. Accepted to ECCV 2026; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20189 2026-06-24 cs.CV cs.AI cs.RO 新提交 79%

HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-training

HilDA:利用扩散的分层蒸馏推进自监督LiDAR预训练

Maciej Wozniak, Jesper Ericsson, Hariprasath Govindarajan, Truls Nyberg, Thomas Gustafsson, Patric Jensfelt, Olov Andersson

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Linköping University(林雪平大学) TRATON AB(TRATON公司) Qualcomm Auto Ltd Sweden Filial(高通汽车有限公司瑞典分公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出HilDA框架,通过分层蒸馏(多层蒸馏和全局上下文蒸馏)结合时间占用扩散目标,自监督预训练LiDAR骨干网络,在3D检测、场景流和语义占用预测任务上达到最先进水平。

Comments Accepted to ECCV 2026. Maciej and Jesper contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22249 2026-06-24 cs.CV 版本更新 79%

D3Seg: Dependency-Aware Diffusion for Brain Tumor Segmentation with Missing Modalities

D3Seg: 依赖感知的扩散模型用于缺失模态的脑肿瘤分割

Danish Ali, Ajmal Mian, Naveed Akhtar, Ghulam Mubashar Hassan

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出D3Seg模型,通过多跳模态图融合、轻量扩散插补机制和概率空间决策细化,解决缺失MRI模态下的脑肿瘤分割问题,提升分割性能并保持计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29578 2026-06-24 cs.CV 版本更新 79%

Emotion Diffusion Classifier with Adaptive Margin Discrepancy Training for Facial Expression Recognition

具有自适应间隔差异训练的情感扩散分类器用于面部表情识别

Rongkang Dong, Cuixin Yang, Cong Zhang, Yushen Zuo, Kin-Man Lam

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于条件生成扩散模型的情感扩散分类器(EmoDC),通过自适应间隔差异训练(AMDiT)动态调整间隔,提升噪声预测判别能力,在面部表情识别中优于现有判别模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21414 2026-06-23 eess.IV cs.AI cs.CV 新提交 79%

2D Versus 3D Diffusion for In Silico Training of Interventional X-ray AI Models

二维与三维扩散在介入X射线AI模型模拟训练中的比较

Sampath Rapuri, Jeremy Ko, Benjamin D. Killeen, Russell H. Taylor, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文比较了基于3D条件潜在扩散模型生成CT体数据用于DRR合成与基于视图条件的2D扩散模型直接生成合成X射线两种方法,发现2D扩散生成的合成X射线可用于训练解剖标志检测模型,性能接近真实数据训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23362 2026-06-23 cs.CR cs.CV 新提交 79%

TooBad: Backdoor Diffusion Models with Ultra-Low Poison Rate and Imperceptible Trigger

TooBad: 超低投毒率和不可察觉触发器的后门扩散模型

Vu Tuan Truong, Long Bao Le

机构 * INRS, University of Quebec(INRS大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TooBad框架,通过针对扩散模型的触发器优化技术,在极低投毒率(0.5%)下实现高攻击成功率(>85%),并保持高隐蔽性和实用性。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23298 2026-06-23 cs.CV 新提交 79%

Ocean4D: Generative Underwater 4D Reconstruction via Medium-Aware Video Diffusion

Ocean4D:通过介质感知视频扩散的生成式水下4D重建

Yuqiang Huang, Yuxi Wang, Junyu Dong, Zhaoxiang Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Ocean4D生成式框架,通过4D几何一致性条件化和介质感知去噪扩散,解决水下动态场景中吸收与散射导致的几何不稳定和跨视角不一致问题,实现单目视频到目标轨迹的高质量4D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23019 2026-06-23 cs.CV cs.AI 新提交 79%

ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

ScalingAttention: 发现视频扩散变换器的内在稀疏注意力拓扑

Ruiliang Zhou, Xuecheng Wu, Kang He, Guangyun Han, Bin Liu, Qinqin Chen, Wende Xu, Qingjie Zhao, Chengru Song

机构 * KlingAI Research(KlingAI研究院) Beijing Institute of Technology(北京理工大学) NVIDIA(英伟达) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ScalingAttention框架,通过权重编码的稀疏拓扑(WEST)和保真度感知灵敏度调优(FAST)实现训练无关的注意力稀疏化,在Wan2.1上获得最高1.90倍加速并保持高质量。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22959 2026-06-23 cs.AI cs.CV 新提交 79%

The Impact of VAE Design on Latent Pose Representations for Diffusion-based Sign Language Production

VAE设计对基于扩散的手语生成中潜在姿态表示的影响

Guilhem Fauré, Mostafa Sadeghi, Sam Bigeard, Slim Ouni

机构 * CNRS(国家科学研究中心) Inria(法国国家信息与自动化技术研究所) LORIA(洛林信息与自动化研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究变分自编码器(VAE)架构和训练目标设计如何影响潜在空间结构,进而影响基于潜在扩散模型的手语生成性能,发现潜在空间特性比重建精度更能解释生成性能差异。

Journal ref GenSign Generative AI for Sign Language CVPR 2026 Workshop, Jun 2026, Denver (Colorado, USA), France. pp. 10631-10640

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22702 2026-06-23 cs.CV 新提交 79%

Modular Diffusion Models for Structured Visual Recognition

模块化扩散模型用于结构化视觉识别

Siddhesh Khandelwal, Björn Ommer, Leonid Sigal

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Vector Institute for AI(向量人工智能研究所) CompVis, Ludwig Maximilian University of Munich(慕尼黑路德维希·马克西米利安大学计算机视觉实验室) Munich Center for Machine Learning(慕尼黑机器学习中心) CIFAR AI Chair(CIFAR人工智能教席)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出模块化扩散模型(MDMs),通过将扩散过程分解为任务特定模块,学习结构化输出的分布,以处理视觉识别中的不确定性,在目标检测、实例分割和场景图生成任务上取得优势。

Comments 34 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22660 2026-06-23 cs.CV 新提交 79%

Prompting Diffusion Models for Zero-Shot Instance Segmentation

提示扩散模型用于零样本实例分割

Irem Zeynep Alagöz, Nils Morbitzer, Andrea Ramazzina, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center of Machine Learning (MCML)(慕尼黑机器学习中心) Mercedes-Benz AG(梅赛德斯-奔驰集团) Visualais

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Prompt2Seg框架,通过空间条件化增强扩散模型,利用2D高斯或置信度图作为提示,实现零样本实例分割,在多个数据集上优于基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21700 2026-06-23 cs.CV 新提交 79%

VT-DUDA: Visual Token Conditioning for Diffusion-guided Unsupervised Domain Adaptation

VT-DUDA: 扩散引导的无监督域适应的视觉令牌条件化

Xuan Qi, Daniele Berardini, Dario Serez, Vito Paolo Pastore, Vittorio Murino

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) University of Genoa(热那亚大学) University of Verona(维罗纳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出VT-DUDA框架,通过将源图像映射为视觉令牌并与文本嵌入拼接作为条件,增强扩散模型生成目标风格图像时的实例级引导,提升无监督域适应性能。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21234 2026-06-23 cs.CV 新提交 79%

Context-Aware Autoregressive Diffusion for Gloss-Wise Sign Language Production

上下文感知的自回归扩散用于逐词汇手语生成

JungHoon Sung, Boeun Kim, Chu Xin, Hyung Jin Chang, ChangHo Kim, Sang-Il Choi, Younggeun Choi

机构 * Dankook University(檀国大学) University of Birmingham(伯明翰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出GARD模型,通过语义和运动上下文条件化,结合词汇间过渡引导和全局运动协调器,实现逐词汇手语生成,在Phoenix-T和CSL-Daily数据集上优于现有方法。

Comments 18 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10983 2026-06-23 cs.LG cs.AI cs.CV 版本更新 79%

TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment

TMPO:用于多样化和高效扩散对齐的轨迹匹配策略优化

Jiaming Li, Chenyu Zhu, Nanxi Yi, Youjun Bao, Li Sun, Quanying Lv, Xiang Fang, Daizong Liu, Jianjun Li, Kun He, Bowen Zhou, Zhiyuan Ma

机构 * Huazhong University of Science and Technology(华中科技大学) Kuaishou Technology(快手科技) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TMPO,通过轨迹级奖励分布匹配提升扩散模型生成多样性,采用Softmax-TB目标和动态随机树采样,有效减少训练时间并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15098 2026-06-23 cs.CV 版本更新 79%

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models

基于离散扩散的多模态大语言模型中视觉标记冗余的综合研究

Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * CCDS, NTU, Singapore(南洋理工大学新加坡分校) CCST, ZJUT, China(浙江工业大学中国分校) Terminus AI Lab, UCAS, China(中国科学院大学人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究系统分析了离散扩散多模态大语言模型中视觉标记冗余的演化规律,发现其仅出现在从头训练的模型处理长答案任务时,并验证了视觉标记剪枝会导致信息损失,而层跳过和渐进剪枝分别适用于不同架构的加速。

Comments Accepted by CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 2823-2833

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14310 2026-06-23 cs.CV 版本更新 79%

Iterative Diffusion-Refined Neural Attenuation Fields for Multi-Source Stationary CT Reconstruction: NAF Meets Diffusion Model

迭代扩散精化神经衰减场用于多源静态CT重建:NAF遇见扩散模型

Jiancheng Fang, Shaoyu Wang, Junlin Wang, Weiwen Wu, Yikun Zhang, Qiegen Liu

机构 * School of Information Engineering, Nanchang University(南昌大学信息工程学院) School of Mathematics and Computer Sciences, Nanchang University(南昌大学数学与计算机科学学院) School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) Laboratory of Image Science and Technology, School of Computer Science and Engineering, and the Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, Southeast University(东南大学计算机科学与工程学院图像科学与技术实验室,以及教育部新一代人工智能技术及其交叉应用重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对超稀疏视角下多源静态CT重建质量差的问题,提出Diff-NAF框架,结合神经衰减场与双分支条件扩散模型,通过迭代投影合成与精化,显著提升重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04495 2026-06-23 cs.CV 版本更新 79%

MoFusion: A Framework for Denoising-Diffusion-based Motion Synthesis

MoFusion: 一种基于去噪扩散的运动合成框架

Rishabh Dabral, Muhammad Hamza Mughal, Vladislav Golyanik, Christian Theobalt

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) Saarland University(萨尔兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MoFusion框架,利用去噪扩散模型实现高质量、多样化的条件人体运动合成,支持音乐和文本等多种条件,并通过调度加权策略引入运动学损失,适用于运动编辑应用。

Comments CVPR23, 11 pages, 6 figures, 2 tables; project page: https://vcai.mpi-inf.mpg.de/projects/MoFusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20112 2026-06-19 cs.CV eess.IV 新提交 79%

Pixel-Level Residual Diffusion Transformer: Scalable 3D CT Volume Generation

像素级残差扩散Transformer:可扩展的3D CT体生成

Zhenkai Zhang, Markus Hiller, Krista A. Ehinger, Tom Drummond

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出像素级残差扩散Transformer(PRDiT),通过两阶段训练(局部MLP盲估计器分离低频结构+全局残差扩散Transformer建模高频残差)实现高保真3D CT体生成,在LIDC-IDRI和RAD-ChestCT数据集上优于现有方法。

Comments Accepted at ICLR 2026. Code available at https://github.com/Fredy-Zhang/PRDiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20110 2026-06-19 cs.CV 新提交 79%

FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model

FrozenDrive: 零样本文本引导驾驶场景生成与数据增强的无参数冻结扩散模型

Yuhwan Jeong, Hyeonseong Kim, Daehyun We, Seonkyu Song, Jinnyeong Yang, Hyun-Kurl Jang, Youngho Yoon, Kuk-Jin Yoon

机构 * KAIST, Visual Intelligence Lab(韩国科学技术院视觉智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FrozenDrive框架,利用冻结的预训练扩散模型,通过知识保留的时空注意力实现多视图一致性和时间连贯性,无需微调即可生成恶劣天气下的驾驶场景,提升自动驾驶模型鲁棒性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20076 2026-06-19 cs.CV cs.AI 新提交 79%

Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers

基于可学习全局合并的可变长度分词用于扩散变换器

Dong Hoon Lee, Seunghoon Hong

机构 * Kim Jaechul Graduate School of AI, KAIST, Daejeon, South Korea(韩国科学技术院金载哲人工智能研究生院,大田,韩国) School of Computing, KAIST, Daejeon, South Korea(韩国科学技术院计算学院,大田,韩国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对固定压缩比限制扩散模型质量-计算权衡的问题,提出基于可学习全局合并的可变长度分词器,通过合并令牌实现跨长度表示对齐,在ImageNet 256×256生成中实现更优的gFID-计算权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19961 2026-06-19 cs.CV 新提交 79%

Addressing Detail Bottlenecks in Latent Diffusion for RGB-to-SWIR Image Translation

解决潜在扩散模型中RGB到SWIR图像翻译的细节瓶颈

Kaili Wang, Martin Dimitrievski, Jose Maria Salvador, Ben Stoffelen, David Van Hamme, Lore Goetschalckx

机构 * imec imec-IPI-Ghent University(imec-IPI-根特大学) Yale University(耶鲁大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对潜在扩散模型在RGB到SWIR图像翻译中丢失空间细节的问题,提出源条件自编码器和可学习引导编码器两种轻量级改进,在驾驶场景下将检测mAP提升至2倍,小目标提升3.4倍,并达到最优FID。

详情

展开后加载摘要…

URL PDF HTML 收藏