EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering
EasyText: 用于多语言文本渲染的可控扩散变换器
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 EasyText提出了一种基于DiT的可控扩散变换器,用于多语言文本渲染,通过字符位置编码和插值技术实现精确生成,并利用大规模数据集提升性能。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
EasyText: 用于多语言文本渲染的可控扩散变换器
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 EasyText提出了一种基于DiT的可控扩散变换器,用于多语言文本渲染,通过字符位置编码和插值技术实现精确生成,并利用大规模数据集提升性能。
半监督生物医学图像分割:通过扩散模型和教师-学生协同训练
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种基于扩散模型的半监督生物医学图像分割框架,通过教师-学生协同训练和多轮伪标签生成策略,在有限标注数据下提升分割性能。
谱结构扩散用于单图像雨去除
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 SpectralDiff通过引入结构化的频谱扰动,提升单图像雨去除的效率和性能。
Comments 15 pages, 4 figures
基于扩散的复制检测模式认证:一种多模态框架与打印机签名条件化
机构 * Université Lumière Lyon 2, CNRS, INSA Lyon, Universite Claude Bernard Lyon 1, LIRIS UMR5205(里摩日大学里昂2分校、法国国家科学研究中心、里昂国立应用科学学院、里昂大学克莱尔-贝尔纳分校、LIRIS UMR5205)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出基于扩散的多模态认证框架,利用打印机签名条件化技术,实现对复制检测模式的高效认证,优于传统方法和深度学习方法。
Comments Accepted at WACV 2026
基于扩散的数据增强用于图像识别:系统分析与评估
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出UniDiffDA框架,系统分析DiffDA方法的三个核心组件,通过全面评估揭示不同策略的优劣,提供可复现的代码和配置以促进研究。
Journal ref Int J Comput Vis 134, 126 (2026)
可解释的运动注意力图:在视频扩散变换器中进行时空定位概念
机构 * Yonsei University(延世大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种可解释的运动注意力图方法,通过时空定位运动概念,提升视频扩散变换器的可解释性与定位能力。
Comments CVPR 2026
M4Diffuser:多视角扩散策略与具有操纵性意识的控制的多自由度扩散策略用于鲁棒移动操纵
机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院技术多模态系统部门) ; Technical University of Munich(慕尼黑技术大学) ; Agile Robots SE(敏捷机器人有限公司)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 M4Diffuser通过多视角扩散策略与操纵性意识控制器实现鲁棒移动操纵,提升任务成功率与环境适应性。
Comments Project page: https://sites.google.com/view/m4diffuser, 10 pages, 9 figures
VesselFusion:基于扩散模型的3D CT图像血管中心线提取
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 VesselFusion通过扩散模型实现3D CT图像中血管中心线的提取,采用粗到细表示和投票聚合方法,提升提取精度和结果自然度。
VSDiffusion:通过可见性约束扩散镇定模糊的阴影生成
机构 * East China University of Science and Technology(东华大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 VSDiffusion通过可见性约束扩散框架,结合多尺度结构指导和软先验图,有效生成逼真阴影,提升复杂场景下的几何一致性。
Comments 12 pages,8 figures
结构与进展感知扩散用于医学图像分割
机构 * School of Artificial Intelligence(人工智能学院) ; School of Computer Science and Technology(计算机科学与技术学院) ; State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) ; Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) ; Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出SPAD方法,结合语义集中扩散和边界集中扩散,通过进展感知调度器实现医学图像分割的粗到细的扩散过程。
SoundWeaver: 语义预热启动用于文本到音频扩散服务
机构 * University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校) ; Assured Intelligence, USA(Assured Intelligence)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 SoundWeaver通过语义预热启动技术,提升文本到音频扩散服务的效率,减少延迟并保持音频质量。
Comments Submitted to INTERSPEECH 2026
DECADE:一种用于增强Rb-82动态心脏PET图像去噪的时序一致无监督扩散模型
机构 * Yale University(耶鲁大学) ; Yale School of Medicine(耶鲁医学院) ; Siemens Medical Solutions USA, Inc.(西门子医疗解决方案美国公司) ; Inselspital, Bern University Hospital(伯尔尼大学医院Inselspital) ; University of Bern(伯尔尼大学) ; Department of Biomedical Engineering(生物医学工程系) ; Department of Radiology and Biomedical Imaging(放射科和生物医学成像系) ; Department of Medicine (Cardiology)(医学系(心脏病学))
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DECADE是一种用于增强Rb-82动态心脏PET图像去噪的无监督扩散模型,通过引入时间一致性提升去噪效果,实现高质量动态和参数图像重建。
学习上下文自适应的运动先验以实现遮蔽运动扩散模型的高效运动学注意力聚合
机构 * Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 MMDM通过高效运动学注意力聚合机制,学习上下文自适应的运动先验,实现遮蔽运动数据的高效重建与生成。
Comments Accepted by IEEE Transactions on Multimedia. Supplementary material is included
解耦文本先验用于基于扩散的图像超分辨率
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DTPSR通过解耦文本先验提升基于扩散的图像超分辨率性能,引入空间层次和频率语义两个维度,实现高感知质量和强泛化能力。
Comments Accepted by CVPR 2026
N-Tree Diffusion用于长周期野火风险预测
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 N-Tree Diffusion通过共享早期去噪阶段和后期分支,提高了长周期野火风险预测的效率和准确性。
Comments 15 pages, 6 figures
实时可控的自回归视频扩散
机构 * Nanyang Technological University(南洋理工大学) ; Xmax.AI Ltd(Xmax.AI有限公司) ; Zhejiang University(浙江大学) ; Singapore Management University(新加坡国立大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 AR-Drag是一种基于强化学习的实时图像到视频生成模型,通过自回归机制和轨迹奖励模型实现高效运动控制,提升视频生成质量和效率。
Vid2World: 构建视频扩散模型以交互式世界模型
机构 * Tsinghua University(清华大学) ; Chongqing University(重庆大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 Vid2World通过因果化视频扩散模型,提升其在交互式世界建模中的可控性和生成能力,适用于机器人操作、游戏模拟和开放世界导航等多种领域。
Comments Project page: http://knightnemo.github.io/vid2world/
Prompt-SID: 通过潜在扩散学习结构表示提示进行单图像去噪
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 Prompt-SID通过潜在扩散学习结构表示提示,提升单图像去噪效果,有效保留结构细节。
RDM:用于人类动作生成的递归扩散模型
机构 * Department of Computer Science, University College London(计算机科学系,伦敦大学学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 RDM通过递归扩散模型生成长序列人类动作,利用归一化流建模循环连接,提升效率并保持概率性质。
Comments v2: Major revision with extensive text polishing and structural updates. Added new experiments on the rollout effect, specifically analyzing the trade-offs between compute time and sequence length. Includes several new visualizations (Figures 6, 9, 10) and an expanded discussion in Section 4
HARP: 仅使用假体数据进行体内扩散磁共振成像的协调
机构 * Department of Psychiatry(精神医学系) ; Brigham and Women's Hospital(布里奇沃特医院) ; Harvard Medical School(哈佛医学院) ; College of Engineering(工程学院) ; Northeastern University(东北大学) ; National Institute of Standards and Technology(国家标准技术研究院) ; University of Utah School of Medicine(犹他大学医学院) ; George E. Wahlen Veterans Affairs Medical Center(乔治·E·瓦伦的退伍军人事务医疗中心) ; University of Pittsburgh(匹兹堡大学) ; Department of Radiology(放射医学系) ; Harvard-MIT Health Sciences and Technology(哈佛-麻省理工健康科学与技术)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 HARP通过仅使用假体数据训练深度学习模型,实现了无需多站点活体数据的扩散磁共振成像协调,有效降低了扫描仪间变异性。
剪枝之下:揭示基于剪枝的去学习中概念复兴的风险
机构 * University of Georgia(佐治亚大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Northeastern University(东北大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; University of Arizona(亚利桑那大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文揭示基于剪枝的去学习中概念复兴的风险,提出攻击框架可无数据恢复被擦除概念,并探讨安全剪枝机制。
Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
S2DiT:用于移动流媒体视频生成的 Sandwich Diffusion Transformer
机构 * Snap Inc. ; Northeastern University(东北大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 S2DiT 通过高效注意力机制和 2-in-1 深度学习框架,在移动设备上实现高质量、高速度的流式视频生成。
LD-RPS:通过潜势扩散递归后验采样实现零样本统一图像修复
机构 * Tsinghua University(清华大学) ; AMAP, Alibaba Group(阿里云(AMAP))
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 LD-RPS通过潜势扩散递归后验采样实现零样本统一图像修复,结合多模态模型和轻量模块提升修复效果。
从二维对齐到三维合理性:统一异构二维先验和无穿透扩散以实现抗遮挡的双手重建
机构 * AgiBot ; Mohamed bin Zayed University of Artificial Intelligence ; The University of Sydney ; La Trobe University
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出统一异构二维先验和无穿透扩散模型,以实现抗遮挡的双手重建,提升交互对齐和穿透抑制性能。
Comments Accepted by CVPR 2026 Main, Project: https://gaogehan.github.io/A2P/
ExpGest:利用扩散模型和混合音频-文本引导的表达性说话生成
机构 * Northwest A&F University(西北农林科技大学) ; University of Technology Sydney(悉尼大学) ; Tencent AILab(腾讯AI实验室) ; City University of Hong Kong(香港城市大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 ExpGest通过结合文本和音频信息,利用扩散模型生成更自然、可控的全身表达性手势。
Comments Accepted by ICME 2024
探索扩散模型在少样本微调中的腐蚀阶段并利用贝叶斯神经网络缓解
机构 * Shanghai Jiao Tong University(上海交通大学) ; Queen’s University Belfast(女王学院 Belfast) ; Tsinghua University(清华大学) ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本研究通过贝叶斯神经网络缓解扩散模型在少样本微调中的腐蚀阶段问题,提升生成图像质量。
Comments Accepted by KDD' 26
DiffInf: 基于影响的扩散法用于面部属性学习中的监督对齐
机构 * Departement of Electrical and Computer Engineering(电气与计算机工程系) ; Departement of Biomedical Engineering(生物医学工程系)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DiffInf通过自影响引导的扩散方法,修复面部属性学习中的标注不一致,提升分类泛化能力。
TempoSyncDiff: 压缩时间一致扩散用于低延迟音频驱动说话头生成
机构 * Computer and Informatics Group, Variable Energy Cyclotron Centre(计算机与信息组,变能循环中心)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 TempoSyncDiff通过压缩扩散模型实现低延迟音频驱动说话头生成,结合教师-学生压缩和时间正则化以提高生成稳定性。
去噪作为路径规划:通过DPCache实现扩散模型的训练免费加速
机构 * Alibaba Group(阿里巴巴集团)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DPCache通过全局路径规划框架实现扩散模型的高效加速,减少计算开销并提升生成质量。
Comments Accepted by CVPR 2026
SRA 2: 变分自编码器自表示对齐用于高效的扩散训练
机构 * Zhejiang University of Technology(浙江工业大学) ; SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) ; Zhejiang University(浙江大学) ; Baidu(百度)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 SRA 2通过利用预训练变分自编码器特征,提供一种轻量级的内在引导框架,提升扩散模型的生成质量和训练效率,仅增加4%的计算开销。