LoSA: Near-Lossless Sparse Attention for Training-Free Video Diffusion Acceleration
LoSA:用于无训练视频扩散加速的近无损稀疏注意力
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 LoSA是一种无训练稀疏注意力方法,通过固定99%的注意力质量阈值移除冗余计算,在多款视频扩散Transformer上实现最高3.2倍加速,且速度-质量权衡优于现有基线。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
LoSA:用于无训练视频扩散加速的近无损稀疏注意力
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 LoSA是一种无训练稀疏注意力方法,通过固定99%的注意力质量阈值移除冗余计算,在多款视频扩散Transformer上实现最高3.2倍加速,且速度-质量权衡优于现有基线。
评估与校准扩散模型衍生的定量MRI成像不确定性
机构 * Erasmus MC(伊拉斯姆斯医学中心) ; TU Delft(代尔夫特理工大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 该研究针对深度学习定量MRI成像方法可靠性未明确表征的问题,评估了扩散模型衍生的不确定性,发现其与成像误差正相关,经校准后可用于可靠性评估与选择性预测。
Comments 11 pages, 6 figures. Accepted at the MICCAI 2026 Workshop on Uncertainty for Safe Utilization of Machine Learning in Medical Imaging (UNSURE 2026)
HarmoniDPO:基于偏好优化扩散模型的视频引导音频生成
机构 * Tsinghua University(清华大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出HarmoniDPO框架,采用双视频表示、online-DPO微调及DDS算法,实现更精准的视频到音频生成,在音视频同步性与主观质量上优于现有最优方法。
Comments 31 pages
ProBAG:用于弱监督组织病理学分割的原型引导边界感知图扩散
机构 * AI VIETNAM Lab(AI越南实验室) ; Washington University School of Medicine(华盛顿大学医学院) ; Jeonbuk National University(全北国立大学) ; Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 ProBAG是一种新的弱监督组织病理学分割方法,通过结合视觉与文本原型、逐类功率重新校准及图扩散机制,在BCSS-WSSS和LUAD-HistoSeg数据集上取得优于现有方法的性能。
Comments 12 pages, 2 figures, 4 tables. Accepted by MICCAI Workshop (COMPAYL) 2026
KANResDiff:基于柯尔莫哥洛夫-阿诺德网络学习局部残差扩散以解决模糊医学图像分割问题
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部) ; College of Computer and Control Engineering, Northeast Forestry University(东北林业大学计算机与控制工程学院) ; Case Western Reserve University(凯斯西储大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对现有模糊医学图像分割方法无法形成渐进式语义建模的问题,提出KANResDiff模型,通过独立时间编码与残差薛定谔桥实现阶段感知模糊性建模,在公开数据集上取得SOTA性能。
Comments 10 pages, 3 figures, MICCAI 2026 conference paper
从合成到去除:基于物理的反射模拟与基于扩散的视频去反射
机构 * Xiaomi Inc.(小米公司) ; MiLM Plus
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 该研究针对视频反射去除数据与模型缺失问题,提出闭环框架S2R,含基于物理的反射模拟、首个扩散式视频去反射模型及专用基准,实现了更优性能与更快推理。
Comments Project page: https://codingwzp.github.io/VideoDereflection_S2R
RayPE: 用于3D感知视频生成的射线空间位置编码
机构 * The University of Hong Kong(香港大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; ARC Lab, Tencent(腾讯ARC Lab)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 提出RayPE,通过向自注意力注入6D Plücker坐标编码射线几何关系,提升视频扩散Transformer的3D一致性和相机可控性。
Comments Project page: https://visual-ai.github.io/scope/
q3-MuPa: 快速、安静、定量的多参数MRI使用物理引导的扩散模型
机构 * Erasmus University Medical Center(埃拉斯姆斯大学医学中心)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种基于扩散模型的qMRI映射方法,结合物理数据一致性约束,提升映射性能并实现四倍加速的高质qMRI成像。
Journal ref Magnetic Resonance Imaging 131 (2026) 110699
基于优化的扩散生成交互场景
机构 * Beijing Institute of Technology(北京理工大学) ; OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) ; Nanyang Technological University(南洋理工大学) ; NVIDIA Research(英伟达研究院) ; Yinwang Intelligent Tech. Co. Ltd.(银网智能科技有限公司)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出OMEGA框架,通过优化引导扩散过程生成符合物理和行为约束的多智能体驾驶场景,提升生成场景的真实性和可控性。
TC-Padé:轨迹一致的Padé近似用于扩散加速
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang Gongshang University(浙江工商大学) ; ByteDance Intelligent Creation(字节跳动智能创作)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 提出轨迹一致的Padé近似方法,通过有理函数建模特征演变,实现低步数下的高效扩散模型加速。
Comments CVPR 2026
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
Comments Accepted by Deep Generative Models workshop at MICCAI 2024
Journal ref Deep Generative Models, Lecture Notes in Computer Science 15224 (2025) 129-138
DoseBridge:用于肺调强质子治疗剂量预测的去噪扩散桥模型
机构 * Corewell Health William Beaumont University Hospital(Corewell Health William Beaumont大学医院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 研究针对肺调强质子治疗剂量预测问题,提出DoseBridge去噪扩散桥模型,融合CT与射野几何信息,在52例患者数据上的多项指标优于对比模型,为放疗剂量预测提供新方法。
teasr: 面向真实世界图像超分辨率的训练高效任意步扩散Transformer
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 提出TEASR框架,通过自对抗蒸馏和时步感知矫正策略,在单一扩散模型中实现任意步采样,无需辅助教师模型,显著提升训练效率并超越现有方法。
Comments Accepted by ECCV26
SynBoost:用于扩散模型快速采样的协同框架
机构 * USTC(中国科学技术大学) ; DAMO Academy, Alibaba Group(阿里云达摩院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本研究针对扩散模型采样速度慢的问题,提出无需训练的SynBoost框架,通过双误差解耦策略缓解离散化与近似误差,可与现有采样器集成并提升速度与生成质量,在少步数场景中效果显著。
DiffSafeMerge:缓解扩散模型合并中的后门继承问题
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DiffSafeMerge是一种缓解扩散模型合并中后门继承的方法,通过评分源模块、收缩可疑贡献并在干净去噪损失预算下选择衰减,在多组实验中实现低攻击成功率和低FID。
当潜变量遗忘像素时:在扩散Transformer超分辨率中恢复保真度
机构 * Dartmouth College(达特茅斯学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本研究针对扩散Transformer超分辨率中VAE压缩导致的保真度下降问题,提出像素锚定超分辨率框架,通过复用VAE前的像素证据提升结果的忠实度,实验验证其性能优于现有潜变量生成式超分辨率方法。
DeepFreqMark:面向潜在扩散模型的、结合球形攻击模拟的端到端可学习频域水印
机构 * National Taiwan University(台湾大学) ; Kyushu Institute of Technology(九州工业大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对潜在扩散模型生成图像的版权与虚假信息问题,提出DeepFreqMark频域水印框架,结合球形攻击模拟规避计算瓶颈,其误码率显著低于基线,消息容量可达256位。
Comments accepted by APSIPA ASC 2026
SC-Diff:用于可见光到红外图像转换的语义校准扩散模型
机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区智能系统工程学院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 SC-Diff 是一种语义校准潜扩散框架,通过结合语义先验作为条件与自注意力校准,提升可见光转红外图像的语义一致性,生成更适用于红外目标检测的合成训练数据。
eBIRD:基于可控扩散模型的事件驱动强度图像重建
机构 * Institute of Engineering Sciences, Universidad de O’Higgins(奥伊金斯大学工程科学学院) ; The Iniciativa de Datos e Inteligencia Artificial, University of Chile(智利大学数据与人工智能倡议)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本研究提出eBIRD框架,结合DDPM与ControlNet实现事件引导强度图像重建,在N-MNIST和RGBE-Gaze数据集上验证了通用与专用扩散学习策略的效果,表明可控扩散模型是该任务的有前景方法。
Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)
BRACE:利用重心有理预测控制快速扩散Transformer推理中的尖锐不规则性
机构 * Sichuan University(四川大学) ; School of Artificial Intelligence, Sichuan University(四川大学人工智能学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本研究针对扩散Transformer(DiTs)高加速推理时的质量下降问题,提出带切比雪夫增强的重心有理预测方法BRACE,通过特征驱动的有理预测实现最优质量-效率权衡,且计算开销极低。
Comments 10 pages, 6 figures, 5 tables. Project page: https://youngkinlon.github.io/BRACE-Taming-Sharp-Irregularities-via-Barycentric-Rational-Forecasting-for-Fast-DiT-Inference/
现在你拥有我的健康注意力:用于脑部MRI修复的U-DiT
机构 * Politecnico di Bari(巴里理工大学)
专题命中 扩散模型 :inpainting(title,abstract);分类 cs.CV
AI总结 针对脑部MRI修复任务,提出U-DiT模型,结合对侧对称先验与注意力约束,在BraTS-2026验证集219例病例上取得健康区域SSIM 0.864等优异指标,提升了解剖学合理性。
HASTE:通过头级自适应稀疏注意力实现无训练视频扩散加速
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出HASTE框架,通过时间掩码复用和误差引导预算校准,提升无训练稀疏注意力在视频生成中的速度与质量平衡,实现在720P下1.93倍的加速效果。
基于扩散模型的分数化成员推断
机构 * Department of Computer Science(计算机科学系)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出SimA攻击方法,通过预测噪声向量实现高效成员推断,优于现有多查询方法,在多个数据集上表现优异。
SPROUT:一种用于农业视觉的可扩展扩散基础模型
机构 * Graduate School of Agricultural and Life Sciences, The University of Tokyo(东京大学大学院农学生命科学研究科) ; National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学多谱信息智能处理技术全国重点实验室、人工智能与自动化学院) ; Institute of Agricultural Machinery, NARO(日本国立研究开发法人农业·食品产业技术综合研究机构农业机械研究所) ; Institute of Life and Environmental Sciences, University of Tsukuba(筑波大学生命环境科学研究所)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 SPROUT是一种基于扩散去噪的多作物多任务农业基础模型,通过大规模未标注数据预训练,在多种下游任务中表现优异,且预训练成本较低。
Comments Code: https://github.com/UTokyo-FieldPhenomics-Lab/SPROUT Dataset: https://huggingface.co/datasets/XIANG-Shuai/MCD-2.6m
预测以跳过:线性多步特征预测用于高效的扩散变换器
机构 * School of Artificial Intelligence, Beijing Normal University, Beijing 100875, China(人工智能学院,北京师范大学,北京) ; Institute of Artificial Intelligence(人工智能研究所) ; Future Networks, Beijing Normal University, Zhuhai 519087, China(未来网络,北京师范大学,珠海)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 PrediT通过线性多步特征预测方法,在不训练的情况下加速扩散变换器,实现显著的延迟降低同时保持生成质量。
用于3D手部重建的可负担性引导扩散先验
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 研究在手部大量被遮挡时3D手部姿势重建问题;核心方法是用基于扩散的生成模型,由视觉语言模型推断的可负担性描述引导;主要贡献是显著提升手部姿势估计准确性,优于现有方法。
Comments Accepted to ECCV 2026. Project page: https://narusuzuki.github.io/projects/26-affhandgen/
HonestFace:基于单步扩散模型的诚实人脸复原方法
机构 * Shanghai Jiao Tong University(上海交通大学) ; vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本研究提出基于单步扩散模型的HonestFace人脸复原方法,通过身份嵌入器、掩码人脸对齐等组件构建新数据集MultiRefCeleb-Test,其性能优于现有最优方法。
Comments Published at ACM MM 2026
更多检索到的证据是否有助于基于扩散语言模型的视觉检索增强生成?
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对基于扩散语言模型的视觉检索增强生成,研究发现无条件扩大检索证据会因语义冲突降低准确率,提出无需训练的基于熵的候选过滤框架,可平均提升答案准确率2.62个百分点。
探索还是收敛?面向扩散模型的阶段引导式逐步优化方法
机构 * Peking University(北京大学) ; Nanjing University(南京大学) ; Stanford University(斯坦福大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对扩散模型RL偏好对齐的奖励不匹配问题,提出SGPO方法,通过分阶段分配目标,使生成质量提升26.7%、收敛速度提高36.7%。
PointDiffusion: 点云领域的基于扩散的场景补全
机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(斯科尔科沃科学技术学院智能空间机器人实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 提出多令牌高斯VAE和锚点ICP地面真值精化,实现单步扩散场景补全,在SemanticKITTI上平方倒角距离降低16倍,推理延迟降低25-143倍。