arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2605.09503 2026-06-02 cs.CV 79%

PermuQuant: Lowering Per-Group Quantization Error by Reordering Channels for Diffusion Models

PermuQuant:通过重新排列通道降低扩散模型每组量化误差

Yongsen Cheng, Kai Liu, Kaiwen Tao, Junxian Li, Zhixin Wang, Zhikai Chen, Renjing Pei, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PermuQuant框架,通过基于联合二阶矩的通道重排序和校准接受规则,降低低比特扩散模型每组量化误差,实现显著加速和内存压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17415 2026-06-02 cs.LG cs.AI cs.CV 79%

Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models

奖励分数匹配:统一流模型和扩散模型的基于奖励的微调

Jeongjae Lee, Jinho Chang, Jeongsol Kim, Jong Chul Ye

机构 * Graduate School of AI, KAIST, Korea(人工智能研究生院,韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出奖励分数匹配(RSM)框架,统一了多种基于奖励的微调方法,通过分数匹配与值引导目标对齐,简化了设计空间并提高了效率。

Comments 43 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09063 2026-06-02 cs.CV cs.AI 79%

Frequency-Enhanced Diffusion Models: Curriculum-Guided Semantic Alignment for Zero-Shot Skeleton Action Recognition

频率增强扩散模型:基于课程引导语义对齐的零样本骨架动作识别

Yuxi Zhou, Zhengbo Zhang, Jingyu Pan, Zhiyu Lin, Zhigang Tu

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(测绘遥感信息工程国家重点实验室) Wuhan University(武汉大学) Information Systems Technology and Design Pillar(信息系统技术与设计学院) Singapore University of Technology and Design(新加坡科技与设计大学) School of Geodesy and Geomatics(测绘学院) School of Mathematics and Statistics(数学与统计学院) Wuhan University Shenzhen Research Institute(武汉大学深圳研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出频率感知扩散模型FDSM,通过语义引导频谱残差模块、时间步自适应频谱损失和课程语义抽象,解决扩散模型频谱偏差导致的高频动态过度平滑问题,实现零样本骨架动作识别,在多个数据集上达到最优性能。

Comments Accepted by The Visual Computer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27645 2026-06-02 cs.CV 79%

OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery

OpenDPR:面向遥感影像的基于视觉中心扩散引导原型检索的开放词汇变化检测

Qi Guo, Jue Wang, Yinhe Liu, Yanfei Zhong

机构 * Wuhan University(武汉大学) Beijing Institute of Technology(北京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出OpenDPR框架,通过扩散模型构建原型并检索视觉相似性,解决开放词汇变化检测中类别识别瓶颈,并设计S2C模块增强变化定位能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19848 2026-06-02 cs.CV 79%

DerMAE: Improving skin lesion classification through conditioned latent diffusion and MAE distillation

DerMAE: 通过条件潜在扩散和MAE蒸馏改进皮肤病变分类

Francisco Filho, Kelvin Cunha, Fábio Papais, Emanoel dos Santos, Rodrigo Mota, Thales Bezerra, Erico Medeiros, Paulo Borba, Tsang Ing Ren

机构 * Universidade Federal do Pernambuco(佛罗里达州帕尔马大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对皮肤病变分类中恶性样本不足导致的类别不平衡问题,提出使用类别条件扩散模型生成合成图像,结合自监督MAE预训练学习鲁棒特征,并通过知识蒸馏将大模型知识迁移至轻量级ViT学生模型,在提升分类性能的同时实现高效设备端推理。

Comments 4 pages, 2 figures, 1 table, Published in: 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20072 2026-06-02 cs.CV cs.LG cs.RO 79%

Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies

离散扩散VLA:将离散扩散引入视觉-语言-动作策略中的动作解码

Zhixuan Liang, Yizhuo Li, Tianshuo Yang, Chengyue Wu, Sitong Mao, Liuao Pei, Tian Nian, Shunbo Zhou, Xiaokang Yang, Jiangmiao Pang, Yao Mu, Ping Luo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出离散扩散VLA,通过将动作块离散化并在统一Transformer骨干内使用离散扩散模式进行渐进细化,实现自适应解码顺序和错误纠正,在多个基准上取得高性能并保留预训练的视觉-语言先验。

Comments Accepted by ICML 2026. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06136 2026-06-02 cs.CV cs.AI 79%

GSV3D: Gaussian Splatting-based Geometric Distillation with Stable Video Diffusion for Single-Image 3D Object Generation

GSV3D: 基于高斯溅射的几何蒸馏与稳定视频扩散用于单图像3D物体生成

Ye Tao, Jiawei Zhang, Yahao Shi, Dongqing Zou, Bin Zhou

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) SenseTime Research(商汤科技研究院) PBVR

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种结合2D扩散模型隐式3D推理能力与高斯溅射几何蒸馏的方法,通过高斯溅射解码器将SV3D潜变量输出转换为显式3D表示,实现多视图一致性和高质量3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31596 2026-06-01 cs.CV cs.LG 79%

KLIP: localized distribution shift detection via KL-divergence with diffusion priors in Inverse Problems

KLIP:通过逆问题中扩散先验的KL散度进行局部分布偏移检测

Alireza Kheirandish, Jihoon Hong, Sara Fridovich-Keil

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于KL散度的OOD检测指标,无需校准数据或偏移分布知识,可检测并定位图像中的局部分布偏移。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31590 2026-06-01 cs.CV cs.AI 79%

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation

TunerDiT: 无需训练的多事件视频生成扩散变压器渐进式引导

Ruotong Liao, Guowen Huang, Qing Cheng, Guangyao Zhai, Lei Zhang, Xun Xiao, Thomas Seidl, Daniel Cremers, Volker Tresp

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Technical University of Munich(慕尼黑技术大学) MCML University of Hamburg(汉堡大学) Huawei European Research Institute(华为欧洲研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对长视频多事件生成难题,提出无需额外训练的TunerDiT方法,通过事件分区掩码和跨事件提示融合实现渐进式引导,在8项指标上达到最优。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31115 2026-06-01 cs.CV 79%

Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning

Polyphony: 基于扩散的双手动作分割,采用交替视觉Transformer和语义条件

Hao Zheng, Hu Wang, Tiantian Zheng, Prajjwal Bhattarai, Tuka Alhanai

机构 * New York University Abu Dhabi(纽约大学阿布扎赫尔分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Polyphony三阶段方法,通过交替训练双手视觉Transformer、语义特征条件化和扩散分割,解决双手动作分割中的手间依赖、视觉不对称和语义模糊问题,在多个数据集上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31057 2026-06-01 cs.CV cs.LG 79%

LVSA: Training-Free Sparse Attention for Long Video Diffusion

LVSA:长视频扩散的无训练稀疏注意力

Gael Glorian, Ioannis Lamprou, Zhen Zhang, Yujie Yuan, Hongsheng Liu

机构 * Distributed Parallel Technology Laboratory, Paris Research Center, Huawei Technologies France(华为法国巴黎研究中心分布式并行技术实验室) AI Framework and Data Technology Lab, Huawei Technologies Co., Ltd.(华为技术有限公司人工智能框架与数据技术实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种无需训练、模型无关的块稀疏注意力方法LVSA,通过结构化窗口模式与旋转全局锚点结合,在降低长视频扩散推理计算成本的同时消除固定网格偏差,支持超训练时域的视频生成。

Comments 10 pages, 5 figures, 4 tables. Code: https://github.com/JiusiServe/LongVideoSparseAttention

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30940 2026-06-01 eess.AS cs.MM cs.SD 79%

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

面向流式同步空间音频生成的自回归扩散Transformer

Ke Lei, Yu Zhang, Changhao Pan, Xueyi Pu, Wenxiang Guo, Ruiqi Li, Zhou Zhao

机构 * Zhejiang University, China(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 提出SwanSphere统一流式框架,通过因果自回归扩散Transformer、空间视频-音频对比学习及多目标在线直接偏好优化,实现从全景视频和文本提示生成高保真空间音频,并开发自动化标注管道缓解数据稀缺。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30631 2026-06-01 cs.CV cs.AI cs.LG 79%

Controllable Lung Nodule Synthesis via Histogram-Regularized Latent Diffusion Models

基于直方图正则化潜扩散模型的可控肺结节合成

Arunkumar Kannan, Yanbo Zhang, Han Liu, Michael Baumgartner, Jianing Wang, Alexander Hertel, Bogdan Georgescu, Sasa Grbic

机构 * Johns Hopkins University(约翰霍普金斯大学) Department of Radiology and Nuclear Medicine, University Medical Center Mannheim, Heidelberg University(放射学与核医学科,曼海姆大学医学中心,海德堡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种直方图正则化潜扩散模型,通过结合亚型、空间掩码和HU直方图条件以及可微特征空间直方图正则化项,在3D CT体积中合成肺结节,以准确建模结节特异性强度分布,提高视觉真实感和亚型一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30431 2026-06-01 cs.CV 79%

DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution

DTG-Restore: 无需训练的视频超分辨率扩散精炼

Hidir Yesiltepe, Koutilya PNVR, Gaurav Pathak, Navaneeth Bodla, Bharat Singh, Pinar Yanardag, Jinrong Xie

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe(Adobe公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出解耦时间引导(DTG)方法,通过时间解耦条件与无条件分支,无需训练即可增强扭曲低分辨率视频,提升结构保真度和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30409 2026-06-01 cs.CV cs.AI 79%

SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer

SANA-Streaming: 基于混合扩散Transformer的实时流式视频编辑

Yuyang Zhao, Yicheng Pan, Qiyuan He, Jincheng Yu, Junsong Chen, Tian Ye, Haozhe Liu, Enze Xie, Song Han

机构 * NVIDIA MIT(麻省理工学院) THU(清华大学) NUS(新加坡国立大学) HKU(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出系统-算法协同设计的SANA-Streaming框架,通过混合扩散Transformer架构、循环反向正则化训练策略和高效系统协同设计,在消费级GPU上实现高分辨率实时流式视频编辑,达到1280×704分辨率24 FPS的端到端性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21379 2026-06-01 cs.CV cs.AI 79%

SAEmnesia: Erasing Concepts in Diffusion Models with Supervised Sparse Autoencoders

SAEmnesia:基于监督稀疏自编码器的扩散模型概念擦除

Enrico Cassano, Riccardo Renzulli, Marco Nurisso, Mirko Zaffaroni, Alan Perotti, Marco Grangetto

机构 * University of Turin, Italy(意大利都灵大学) Intesa Sanpaolo AI Research, Italy(意大利Intesa Sanpaolo人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出监督稀疏自编码器框架SAEmnesia,通过强制一对一概念-神经元映射实现特征集中化,从而高效、精准地擦除扩散模型中的概念。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06161 2026-06-01 cs.CV 79%

Sinkhorn Normalization of Diffusion Kernels

扩散核的Sinkhorn归一化

Nathan Kessler, Robin Magnet, Jean Feydy

机构 * ENS Paris-Saclay(巴黎-萨克雷大学) Inria, Université Paris Cité, Inserm, HeKA(法国国家科学研究中心、巴黎-城市大学、法国国家医学研究院、HeKA)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于Sinkhorn算法的对称变体,将通用相似性矩阵归一化为类似扩散算子,继承拉普拉斯算子的理想性质,用于不规则数据(如点云、稀疏体素网格、高斯混合)的平滑处理,并保留谱信息用于形状分析与匹配。

Comments 33 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30351 2026-05-29 cs.CV cs.AI 79%

VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

VideoMLA: 用于分钟级自回归视频扩散的低秩潜在KV缓存

Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学) fal Project(fal项目)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出VideoMLA,通过多头潜在注意力(MLA)将每头KV替换为共享低秩内容潜在和分离的3D-RoPE位置键,在视频扩散中减少92.7%的KV内存,并保持质量与吞吐量提升。

Comments Project Page: https://videomla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30325 2026-05-29 cs.CV 79%

Veda: Scalable Video Diffusion via Distilled Sparse Attention

Veda: 通过蒸馏稀疏注意力实现可扩展的视频扩散

Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

机构 * ByteDance Inc.(字节跳动公司) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Veda蒸馏稀疏注意力框架,通过统计感知的tile评分和头感知tile选择,在保持生成质量的同时实现视频扩散模型的高效加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29932 2026-05-29 cs.LG cs.CV 79%

Treatment-Conditioned Diffusion for Forecasting Neurodegenerative Disease Progression

治疗条件扩散用于预测神经退行性疾病进展

Danylo Boiko, Viktoriia Mishkurova

机构 * Innoloft Inc.(Innoloft公司) Bogomolets National Medical University(博戈莫列茨国家医学大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种治疗条件扩散框架,通过条件化生成过程于患者的筛查DaTscan图像和一年内左旋多巴等效日剂量,预测高保真未来脑状态,在临床保真度上显著优于基线。

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29858 2026-05-29 cs.CV 79%

Masked Diffusion Vision-Language Models for Temporal Action Localization

用于时序动作定位的掩码扩散视觉语言模型

Fengshun Wang, Zhengbo Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出掩码扩散视觉语言模型(MDVLM)用于时序动作定位,通过双向注意力迭代去噪联合优化语义和边界,并引入边界感知掩码和步级IoU奖励解决训练不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19316 2026-05-29 cs.CV cs.AI 79%

Evaluating Dataset Watermarking for Fine-tuning Traceability of Customized Diffusion Models: A Comprehensive Benchmark and Removal Approach

评估数据集水印用于定制扩散模型微调可追溯性:一个综合基准与移除方法

Xincheng Wang, Hanchi Sun, Wenjun Sun, Kejun Xue, Wangqiu Zhou, Jianbo Zhang, Wei Sun, Dandan Zhu, Xiongkuo Min, Jun Jia, Zhijun Fang

机构 * Donghua University(东华大学) Shanghai Jiao Tong University(上海交通大学) Xidian University(西安电子科技大学) Hefei University of Technology(合肥工业大学) East China Normal University(华东师范大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散模型微调中的版权与安全风险,本文建立统一威胁模型并提出包含普适性、可传递性和鲁棒性的评估框架,揭示现有数据集水印方法的脆弱性,并进一步提出一种实用的水印移除方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28962 2026-05-29 cs.CV 79%

Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment

通过噪声对齐解决扩散桥中的端点欠拟合

Yurong Gao, Zicheng Zhang, Congying Han, Tiande Guo, Xinmin Qiu

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散桥模型在目标端点附近出现的欠拟合问题,提出噪声对齐扩散桥(NADB),通过均值网络和噪声对齐映射解决噪声不匹配,在图像恢复和翻译任务中验证有效性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18518 2026-05-29 cs.CV cs.LG 79%

UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models

UDM-GRPO:面向均匀离散扩散模型的稳定高效组相对策略优化

Jiaqi Wang, Haoge Deng, Ting Pan, Yang Liu, Chengyuan Wang, Fan Zhang, Yonggang Qi, Xinlong Wang

机构 * Beijing University of Posts(北京邮电大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对均匀离散扩散模型(UDM)与强化学习(RL)集成时训练不稳定、性能提升有限的问题,提出UDM-GRPO框架,通过将最终干净样本作为动作、利用扩散前向过程重建轨迹以及引入简化步数和无CFG策略,显著提升文本到图像生成任务的性能。

Comments UDM-GRPO is accepted by ICML 2026 (Spotlight). Code is available at https://github.com/Yovecent/UDM-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21032 2026-05-29 cs.CV 79%

Multi-Attribute guided Thermal Face Image Translation based on Latent Diffusion Model

基于潜在扩散模型的多属性引导热人脸图像翻译

Mingshu Cai, Osamu Yoshie, Yuya Ieiri

机构 * Graduate School of Information, Production and Systems, Waseda University(早稻田大学信息、生产与系统研究生院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于潜在扩散模型的多属性引导方法,从热红外图像生成高质量可见光人脸图像,同时保留关键身份特征,解决异质人脸识别中的域偏移和特征丢失问题。

Comments Accepted by 2025 IEEE International Joint Conference on Biometrics (IJCB 2025)

Journal ref 2025 IEEE International Joint Conference on Biometrics (IJCB), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15151 2026-05-29 eess.IV cs.CV 79%

Zero-shot CT Super-Resolution using Diffusion-based 2D Projection Priors and Signed 3D Gaussians

基于扩散的二维投影先验和有符号三维高斯的零样本CT超分辨率

Jeonghyun Noh, Hyun-Jic Oh, Won-Ki Jeong

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Korea University(韩国大学) Seoul, Korea(韩国首尔)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种零样本三维CT超分辨率框架,通过扩散模型上采样二维投影先验并结合有符号三维高斯溅射(NAB-GS)重建高分辨率CT体积,在公开数据集上实现4倍超分辨率的优越性能。

Comments MICCAI 2026 early accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28456 2026-05-28 cs.AI cs.CV eess.AS 79%

Diffusion Large Language Models for Visual Speech Recognition

用于视觉语音识别的扩散大语言模型

Jeong Hun Yeo, Chae Won Kim, Hyeongseop Rha, Yong Man Ro

机构 * Integrated Vision Language Lab, KAIST, South Korea(韩国加耶大学集成视觉语言实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出首个基于扩散大语言模型(DLLM)的视觉语音识别框架DLLM-VSR,通过迭代掩码去噪和灵活顺序解码,结合置信度引导的解掩码策略及两阶段训练,并引入长度引导候选解码以降低目标长度不确定性,在LRS3上取得19.5%的词错误率。

Comments Code: https://github.com/JeongHun0716/dllm-vsr

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27102 2026-05-28 cs.CV cs.LG 79%

JLT: Clean-Latent Prediction in Latent Diffusion Transformers

JLT: 潜在扩散Transformer中的干净潜在预测

Funing Fu, Tenghui Wang, Guanyu Zhou, Junyong Cen, Qichao Zhu

机构 * Independent Researcher(独立研究者) Wuhan University of Technology(武汉理工大学) Hangzhou Jiyi Artificial Intelligence Co., Ltd.(杭州智益人工智能有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出JLT,一种在冻结的FLUX.2 VAE编码上训练的130M潜在扩散Transformer,通过干净潜在预测相比速度预测在ImageNet 256×256上获得更优的FID分数,表明潜在扩散中的预测目标是依赖于表示的几何选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27990 2026-05-28 cs.LG cs.AI cs.CV 79%

Geometry-Correct Diffusion Posterior Sampling with Denoiser-Pullback Curvature Guidance and Manifold-Aligned Damping

几何校正扩散后验采样:基于去噪器回拉曲率引导与流形对齐阻尼

Seunghyeok Shin, Minwoo Kim, Dabin Kim, Hongki Lim

机构 * Department of Electrical and Computer Engineering, Inha University, Incheon, 22212, South Korea(电气与计算机工程系,Inha大学,Incheon,22212,韩国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于去噪器回拉曲率引导和流形对齐阻尼的几何校正扩散后验采样方法,通过每噪声水平的阻尼高斯-牛顿校正替代标量引导,实现稳定高效的后验采样。

Comments Code: https://github.com/Seunghyeok0715/CLAMP

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27736 2026-05-28 cs.LG cs.CV 79%

Explicit Critic Guidance for Aligning Diffusion Models

显式评论家引导的对齐扩散模型

Zhengyang Liang, Qihang Zhang, Ceyuan Yang

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种状态对齐的潜在演员-评论家框架,通过将扩散模型自身作为时间步条件价值函数,实现轨迹级PPO训练和推理时引导,在单/多奖励基准上优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏