DiffATS: Diffusion in Aligned Tensor Space
DiffATS: 在对齐张量空间中的扩散
机构 * Northwestern University(西北大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出DiffATS,一种基于对齐张量空间的生成框架,通过构建数据依赖的张量原始元来高效生成高分辨率时空场,实现压缩比达3.9至210倍的生成性能。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
DiffATS: 在对齐张量空间中的扩散
机构 * Northwestern University(西北大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出DiffATS,一种基于对齐张量空间的生成框架,通过构建数据依赖的张量原始元来高效生成高分辨率时空场,实现压缩比达3.9至210倍的生成性能。
具有几何意识的扩散模型离散化误差
机构 * Univ. Gustave Eiffel, CNRS, LIGM(法国埃菲尔大学、国家科学研究中心、LIGM实验室) ; Univ. Paris-Saclay, Inria, CEA(巴黎-萨克雷大学、法国国家信息与自动化技术研究院、法国原子能委员会) ; CNRS, ENS, PSL Université(国家科学研究中心、巴黎高等师范学院、巴黎-萨克雷大学)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)
AI总结 本文研究了扩散模型中离散化误差的几何适应性,通过推导Euler-Maruyama方法的弱和Fréchet离散化误差的一阶渐进行为,揭示了数据几何结构与扩散参数的交互作用,为几何感知参数优化提供可操作的目标。
JUST-DUB-IT: 通过联合音频-视觉扩散进行视频配音
机构 * Tel Aviv University(特拉维夫大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
AI总结 本文提出JUST-DUB-IT方法,利用轻量LoRA调整基础音频-视频扩散模型,实现视频到视频的高质量配音,提升视觉保真度和唇同步性能。
Comments Project webpage available at https://justdubit.github.io
异方差扩散用于多智能体轨迹建模
机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息学院,CSIC-UPC)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出U2Diffine模型,通过异方差不确定性估计提升多智能体轨迹补全与预测性能,结合Taylor近似和RankNN实现高效推理与误差概率评估,优于现有方法。
Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Extended version of arXiv:2503.18589 (CVPR 2025)
通过扩散框架实现逼真且高效的bokeh渲染
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo BlueImage实验室,vivo移动通信有限公司) ; Shenzhen University of Advanced Technology(深圳大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出MagicBokeh框架,通过替代训练策略和聚焦感知的掩码注意力机制,联合优化bokeh渲染与超分辨率,提升可控性和视觉保真度,并引入降质感知深度模块以提高低质量输入的深度估计准确性。
Comments Accepted by CVPR 2026
动态点云的扩散掩码预训练
机构 * Xi’an Jiaotong University(西安交通大学) ; School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; University of Western Australia(西澳大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出DiMP框架,通过引入扩散建模解决动态点云预训练中位置泄露和运动监督问题,提升下游任务性能。
COP-GEN:用于Copernicus地球观测数据的潜在扩散变换器
机构 * School of Engineering University of Edinburgh(工程学院爱丁堡大学) ; European Space Agency (ESA)(欧洲航天局) ; Asterisk Labs(Asterisk实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 COP-GEN通过建模异质地球观测模态的联合分布,实现了多模态潜在扩散变换器,支持灵活的任意到任意条件生成,包括无需重新训练的零样本模态翻译。
随机性的确定性:提示残差种子塑形用于扩散生成
机构 * USTC(中国科学技术大学) ; Li Auto Inc.(利亚自动化公司) ; Xi’an High-tech Research Institute(西安高新技术研究院) ; Wechat Vision(微信视觉) ; Cambridge University(剑桥大学) ; HUST(华中科技大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文研究了扩散生成中种子敏感性,提出无需训练的提示残差种子塑形方法,通过单个高噪声冷启动提示残差提升生成对齐和质量。
MFVLR:多领域细粒度视觉-语言重建用于通用扩散面部伪造检测与定位
机构 * Faculty of Computer Science and Technology, Qilu University of Technology (Shandong Academy of Sciences)(计算机科学与技术学院,齐鲁工业大学(山东省科学院)) ; School of Computing, National University of Singapore(国立新加坡大学计算机学院) ; Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences)(山东省人工智能研究院,齐鲁工业大学(山东省科学院)) ; Key Laboratory of Computer Vision and System, Ministry of Education, Tianjin University of Technology(教育部计算机视觉与系统重点实验室,天津工业大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出MFVLR模型,通过语言引导的面部伪造表示学习,实现通用的扩散合成面部伪造检测与定位,结合多领域视觉编码器和细粒度语言变压器提升模型泛化能力。
ConFixGS:基于置信度感知扩散先验的学习以修复馈送式3D高斯点溅射在驾驶场景中
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of Cambridge(剑桥大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出ConFixGS,通过置信度感知扩散先验学习修复馈送式3D高斯点溅射,提升稀疏视角驾驶场景中新型视角合成的鲁棒性,实验显示PSNR提升3.68dB,FID降低近一半。
Comments 28 pages, 12 figures
Forcing-KV:用于高效自回归视频扩散模型的混合KV缓存压缩
机构 * ZJU(浙江大学) ; Video Rebirth(视频重生) ; HKUST(香港科技大学) ; BJTU(北京理工大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出Forcing-KV方法,通过混合KV缓存压缩技术,提升自回归视频扩散模型的生成速度和内存效率,实现高达2.82倍的速度提升。
Comments 10 pages
任意到任意的3D扩散模型与知识转移:放射治疗计划研究
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; Siemens Healthineers(西门子医疗) ; University of Washington(华盛顿大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出DiffKT3D,一种利用预训练视频扩散模型知识的统一Any2Any 3D扩散框架,通过模态特定嵌入实现多临床模态灵活条件化,结合临床导向的强化学习机制,提升放射治疗计划中的剂量预测精度与图像质量。
Comments Accepted by CVPR 2026 main conference. Compare to CVPR version, minor updates here are included (e.g., combine main text and appendix; clarify the timing scenario in appendix)
具有鲁棒性的扩散求解器用于逆问题
机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) ; Yau Mathematical Sciences Center, Tsinghua University(清华大学尤太数学科学中心)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种鲁棒扩散求解器,通过噪声估计和Huber损失构建迭代加权最小二乘目标,以解决逆问题中的异常值问题,并在多个图像数据集上验证了其有效性。
Comments Accepted by CVPR 2026
跨模态语义增强的扩散框架用于糖尿病视网膜病变分级
机构 * School of Software Engineering Beijing Jiaotong University(软件工程学院 北京交通大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出CLIP引导语义扩散框架,通过整合视觉-语言预训练与扩散概率建模,解决糖尿病视网膜病变分级中的细粒度病变模式区分、分布差异和临床语义知识利用问题。
Comments 6 pages, 3 figures, 2 tables
GPO-V:通过全局概率优化实现扩散视觉语言模型的突破
机构 * ShanghaiTech University(上海科技大学) ; University of Warwick(沃里克大学) ; SUN YAT-SEN UNIVERSITY(中山大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出GPO-V,通过全局概率优化方法突破扩散视觉语言模型的安全防线,揭示了非顺序生成架构中的关键安全漏洞。
基于光谱引导的扩散噪声调度
机构 * Google Research(谷歌研究)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出基于图像光谱特性设计实例特定噪声调度的方法,通过理论界限优化噪声级别,提升单阶段像素扩散模型生成质量,尤其在低步数情况下表现更佳。
Comments Accepted to ICML'26
Nix 和 Fix:通过扩散模型实现 3D 高斯散射的 1000 倍压缩
机构 * 1 Chair of Media Technology, Munich Institute of Robotics ; Machine Intelligence School of Computation, Information ; Technology Technical University of Munich, 80333 Munich, Germany 2LTCI, T\'el\'ecom Paris, Institut Polytechnique de Paris, France
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出 NiFi 方法,通过扩散模型实现 3DGS 在极低速率下的高质量压缩,达到 1000 倍压缩率。
增强控制的自回归扩散用于数据同化
机构 * University of California, Irvine(加州大学洛杉矶分校)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种增强控制的自回归扩散模型,通过引入预训练模型与离线训练控制器,提升数据同化中混沌时空偏微分方程的稳定性和准确性。
TARO:利用扩散模型作为净化器的时序对抗修正优化
机构 * Department of Computer Science(计算机科学系) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 TARO通过构建时序引导的分数先验,结合多视角去噪,实现对抗样本的鲁棒修正与语义保留,提升零样本下的鲁棒性。
通过因果-扩散桥进行多模态情绪识别(Affect-Diff)
机构 * Department of Computer Science -- Data Science(计算机科学系——数据科学部) ; Fordham University(福特汉姆大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对CMU-MOSEI数据集中情绪类别不平衡问题,Affect-Diff通过因果图、正则化潜在压缩和扩散先验机制提升识别性能,验证了其在平衡准确率和少数类敏感性上的优势。
Comments 10 Pages, 12 Figures, 6 Tables
NoiseRater: 用于扩散模型训练的元学习噪声估值
机构 * Stanford University(斯坦福大学) ; UNSW(新南威尔士大学) ; UCL(伦敦大学学院) ; The University of Chicago(芝加哥大学) ; CUHK(香港中文大学) ; Nanjing University(南京大学) ; Brown University(布朗大学) ; Yale University(耶鲁大学) ; University of Notre Dame(Notre Dame 大学) ; University of Waterloo(滑铁卢大学) ; UCB(加州大学伯克利分校) ; Georgia Technology(佐治亚理工学院) ; Amazon(亚马逊)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出NoiseRater,通过元学习实现实例级噪声估值,提升扩散模型训练效率和生成质量。
自适应多视图图对比学习:通过分数阶神经扩散网络
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) ; University College London, London, U.K.(伦敦大学学院)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出一种无增强的多视图图对比学习框架,利用分数阶连续动力学生成连续视图谱,通过调整分数阶导数阶数α实现自适应扩散尺度,提升多尺度结构模式的表征能力。
Comments Machine learning, diffusion neural networks. arXiv admin note: text overlap with arXiv:2504.16748
从光度流中联合概率推断星系红移和本动光谱的潜在扩散模型
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出一种生成框架,通过光度流联合推断星系红移和本动光谱,利用预训练的光谱自动编码器和扩散模型,在光度数据中提取光谱信息。
Comments 12 pages, 10 figures
diffGHOST:基于扩散的生成模糊遗忘合成轨迹
机构 * Orange Research(Orange研究院) ; Orange Business(Orange公司)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出diffGHOST,一种基于潜在空间分割的条件扩散模型,旨在解决轨迹合成中隐私保护与实用性之间的平衡问题。
通过生成性Gibbs采样结合显式物理上下文组成扩散先验
机构 * Department of Chemistry(化学系) ; Courant Institute of Mathematical Sciences(数学科学学院) ; University of Chicago(芝加哥大学) ; New York University(纽约大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出GG-PA框架,通过生成性Gibbs采样结合显式物理上下文,实现扩散先验与物理上下文的联合分布推断,验证了在有限扩散时间下精确性,并通过实验展示其在双井系统、ϕ⁴晶格模型和原子肽系统中的有效性。
Comments 31 pages, 11 figures
指导扩散在结构化输入黑盒优化中的后悔分析
机构 * Lattice Lab(晶格实验室) ; Toyota Motor Corporation(丰田汽车公司) ; School of Mathematics(数学学院) ; University of Bristol(布里斯托大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出基于证书的期望简单后悔框架,用于指导扩散黑盒优化,避免最大信息增益和RKHS假设,通过质量提升度量解释收敛机制,并提供实用诊断和修正重采样构造。
Comments 48 pages, 12 figures
用于拍击去混响的冷扩散方法
机构 * Department of Music Technology(音乐技术系) ; Acoustics Hellenic Mediterranean University(声学希伯伦地中海大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出冷扩散框架用于去混响立体鼓声,将混响视为确定性退化过程,通过UNet和扩散Transformer实现,实验表明在感知和信号指标上优于基线方法。
Comments Accepted for the 2026 IEEE World Congress on Computational Intelligence, IJCNN Track, 21-26 June 2026, Maastricht, the Netherlands
相对分数策略优化用于扩散语言模型
机构 * University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Hong Kong(香港大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出RSPO方法,通过可验证奖励校准扩散语言模型中的噪声似然估计,提升推理能力,在规划任务中表现优异。
扩散语言模型中的层崩溃
机构 * Tübingen AI Center(图宾根人工智能中心) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 研究揭示扩散语言模型中层崩溃现象,其由过度训练导致,早期层存在冗余表示,压缩时表现优于自回归模型。
Comments 9 Pages, Preprint
SCORP:具有稳定在线强化学习后训练的场景一致多智能体扩散规划用于协作驾驶
机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) ; Middle East Technology University (METU)(中东技术大学) ; Robotics and Autonomous Systems Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) ; School of Computer Science and Technology, Qinghai University(青海大学计算机科学与技术学院)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 SCORP通过场景条件多智能体去噪架构和两层马尔可夫决策过程提升多智能体协作驾驶的场景一致性和效率,实验表明其在安全性和效率指标上优于现有基线方法。