HMARK: Radioactive Multi-Bit Semantic-Latent Watermarking for Diffusion Models
HMARK: 放射性多比特语义-潜在水印用于扩散模型
机构 * University of Toronto(多伦多大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 HMARK通过在扩散模型的语义-潜在空间中编码所有权信息,实现多比特水印,以检测和防止未经授权的数据训练。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
HMARK: 放射性多比特语义-潜在水印用于扩散模型
机构 * University of Toronto(多伦多大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 HMARK通过在扩散模型的语义-潜在空间中编码所有权信息,实现多比特水印,以检测和防止未经授权的数据训练。
基于扩散的合成明场显微镜图像用于增强单细胞检测
机构 * Synentec GmbH, Elmshorn, Germany(Synentec GmbH,埃尔姆霍恩,德国) ; Faculty of Computer Science and Digital Society(计算机科学与数字社会学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出利用扩散模型生成合成明场显微镜图像,通过实验表明合成数据可提升单细胞检测精度,减少人工标注依赖,提高模型鲁棒性。
DM$^3$T: 通过扩散和谐多模态以实现多目标跟踪
机构 * China Agricultural University(中国农业大学) ; Beijing Normal University(北京师范大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DM$^3$T通过扩散模型实现多模态特征对齐,提升多目标跟踪的准确性和鲁棒性。
可扩展的扩散变换器用于条件4D fMRI合成
机构 * Seoul National University(首尔国立大学) ; Brookhaven National Laboratory(布鲁赫斯旺国家实验室) ; Seoul National Laboratory(首尔国立实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种可扩展的扩散变换器,用于条件4D fMRI合成,通过结合3D VQ-GAN和CNN-Transformer结构,实现了高精度的任务条件生成。
Comments Accepted at NeurIPS 2025 Workshop: Foundation Models for the Brain and Body. 13 pages, 6 figures, 4 tables
MammoRGB: 基于去噪扩散概率模型的双视角乳腺X线合成
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 MammoRGB利用三通道DDPM生成双视角乳腺X线图像,通过不同通道编码提升图像保真度和跨视角一致性,为数据集增强提供新方法。
SARD: 通过区域约束扩散与判别掩码引导进行的分段感知异常合成
机构 * Global Institute of Future Technology(未来技术全球研究所) ; Shanghai Jiao Tong University(上海交通大学) ; Department of Intelligent Manufacturing(智能制造系) ; Contemporary Amperex Technology Co.,Ltd(当代电子技术有限公司)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 SARD通过区域约束扩散与判别掩码引导方法,提升工业异常检测系统的鲁棒性,实现更精确的像素级异常合成。
Comments Accepted by The 2025 International Conference on Machine Intelligence and Nature-InspireD Computing (MIND)
DiffFuSR:利用扩散模型实现所有Sentinel-2多光谱波段的超分辨率处理
机构 * Norwegian Computing Center(挪威计算中心) ; Department of Physics and Technology, UiT The Arctic University of Norway(物理与技术系,UiT 北极大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DiffFuSR通过扩散模型和融合策略实现Sentinel-2多光谱波段的超分辨率处理,提升反射率保真度和光谱一致性。
Comments Accepted for Publication at IEEE TRANSACTIONS ON GEOSCIENCE AND REMOTE SENSING (TGRS)
AI杀死了视频明星。用于表达性说话头生成的音频驱动扩散模型
机构 * Centre INRIA d’Université Côte d’Azur(INRIA中心,坎特伯雷大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 Dimitra++通过音频驱动的扩散模型生成具有真实嘴唇运动、面部表情和头部姿态的说话头,优于现有方法。
Comments arXiv admin note: text overlap with arXiv:2502.17198
ITS3D: 推理时缩放用于文本引导的3D扩散模型
机构 * ReLER, Zhejiang University(浙江大学ReLER实验室) ; National University of Singapore(新加坡国立大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 ITS3D通过优化问题和验证器引导搜索算法,提升文本引导的3D扩散模型生成质量。
Comments 25 pages, 11 figures
3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器
机构 * Zhejiang University(浙江大学) ; Huawei(华为) ; Nanyang Technological University(南洋理工大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM
AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。
学习插件式记忆以指导视频扩散模型
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; The University of Tokyo(东京大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出DiT-Mem,通过学习插件式记忆增强视频扩散模型的物理规则遵循和视频保真度。
一步扩散变换器用于可控的现实世界图像超分辨率
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xiaohongshu Inc(小红书公司)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 ODTSR通过噪声混合视觉流和保真度感知对抗训练,实现一步扩散变换器在现实世界图像超分辨率中的保真度与可控性平衡。
DiffusionFF: 一种基于扩散的联合人脸伪造检测与细粒度特征定位框架
机构 * MAIS, CASIA(CASIA人工智能研究所) ; SAI, UCAS(UCAS智能信息学院) ; CMFT(计算机视觉与模式识别技术研究所) ; IIE, CAS(中国科学院信息工程研究所) ; SCS, UCAS(UCAS安全学院) ; CAIR, HKISI, CAS(中国科学院自动化研究所) ; SCSE, FIE, M.U.S.T(慕苏尔科技大学安全与电子工程系)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DiffusionFF通过结合预训练的伪造检测器和去噪扩散模型,实现人脸伪造检测与细粒度特征定位,提升检测能力和可解释性。
通过残差压缩加速并行扩散模型服务
机构 * Southern University of Science and Technology(南方科技大学) ; Jiangnan University(江南大学) ; Shenzhen Technology University(深圳技术大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 CompactFusion通过残差压缩技术提升并行扩散模型服务效率,实现3倍加速并显著提高生成质量。
Comments Accepted by NeurIPS 2025
通过潜在聚类发现扩散基于的反事实概念方向
机构 * German Research Center for Artificial Intelligence GmbH (DFKI)(德国人工智能研究中心)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出CDLC方法,通过潜在聚类提取概念方向,减少存储需求并加速概念发现,适用于高风险领域和多样化数据模态。
Comments Accepted at Pattern Recognition Letters Journal (14 Pages)
Journal ref Special Section on the 27th International Conference on Pattern Recognition (ICPR 2024)
通过少量步骤的运动对抗性后训练提升视频扩散中的运动质量
机构 * Adobe(Adobe公司) ; Georgia Tech(佐治亚理工学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 MoGAN通过运动对抗性后训练提升视频扩散模型的运动质量,无需奖励模型或人类偏好数据,在多个基准测试中显著提高了运动真实感。
哪一层导致分布偏离?面向扩散和流模型的熵引导自适应剪枝
机构 * Stanford University(斯坦福大学) ; North China Electric Power University(华北电力大学) ; University of Technology Sydney(悉尼科技大学) ; Harvard University(哈佛大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出EntPruner,通过熵引导的自适应剪枝方法,有效减少扩散和流模型的参数冗余,提升推理速度并保持生成质量。
Comments Project page: https://github.com/changlin31/EntPruner
GFT-GCN:基于谱扩散的隐私保护3D人脸网格识别
机构 * The Graduate University for Advanced Studies, SOKENDAI(高级研究大学,SOKENDAI) ; National Institute of Informatics, NII(信息研究所) ; The University of Tokyo(东京大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 GFT-GCN通过结合谱图学习与扩散机制,实现隐私保护的3D人脸识别,兼顾高准确性和防攻击能力。
Comments 13 pages, 8 figures, WACV 2026
DiffSeg30k: 一种用于局部AIGC检测的多轮扩散编辑基准
机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) ; South China University of Technology(华南理工大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DiffSeg30k通过引入多轮扩散编辑基准,推动AIGC检测从二元分类到语义分割的转变,提升局部编辑定位和模型识别的可靠性。
Comments 16 pages, 10 figures; typos corrected, references added
基于扩散噪声优化的连续流序列适应视频预测
机构 * University of Bonn(波恩大学) ; Toyota Motor Europe(丰田欧洲公司) ; University of Wuerzburg(乌尔姆大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种基于扩散噪声优化的连续流序列适应视频预测方法,通过在推理过程中细化扩散噪声以提升视频预测性能。
解耦多流潜在扩散模型用于定量髓鞘图合成
机构 * Vanderbilt University(范德比大学) ; Vanderbilt University Medical Center(范德比大学医学中心) ; Barrow Neurological Institute(巴罗神经研究所)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DEMIST通过解耦多流潜在扩散模型,利用标准T1w和FLAIR图像生成高质量的PSR图,提升MS评估的定量准确性。
扩散去噪超光谱高斯点云
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出DD-HGS方法,通过引入波长敏感的球谐函数、光谱损失和扩散去噪器,实现超光谱场景的3D显式重建,提升3D高斯点云方法的性能。
Comments Accepted to 3DV 2026
Gen-3Diffusion:通过2D与3D扩散协同实现逼真图像到3D生成
机构 * University of Tübingen(图宾根大学) ; Tübingen AI Center(图宾根人工智能中心) ; Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰州信息校园)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 Gen-3Diffusion通过2D与3D扩散模型协同生成逼真3D物体和化身,提升多视图一致性和泛化能力。
Comments Accepted to Transaction on Pattern Analysis and Machine Intelligence (T-PAMI). Project Page: https://yuxuan-xue.com/gen-3diffusion. arXiv admin note: substantial text overlap with arXiv:2406.08475
FREE: 用于并行扩散变换器的不确定性感知自回归
机构 * Tsinghua University(清华大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 FREE通过引入不确定性感知的自回归方法,在并行扩散变换器中实现高效的无损加速,提升去噪效率的同时保持生成质量。
通过离散扩散分类建模推进图像分类
机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出DiDiCM框架,利用扩散过程建模类别标签的后验分布,以提升图像分类在高不确定性条件下的性能。
RoPECraft:基于轨迹引导的RoPE优化实现无需训练的运动迁移
机构 * Bilkent University(比尔肯大学) ; ETH Zurich(苏黎世联邦理工学院) ; Max Planck Institute(马克斯·普朗克研究所)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 RoPECraft通过轨迹引导的RoPE优化实现无需训练的视频运动迁移,有效编码运动并提升生成质量。
一种具有形态-骨骼控制的可用于模拟的冠状动脉解剖扩散模型
机构 * Institute of Medical Engineering, MIT(麻省理工学院医学工程研究所) ; Brigham and Women's Hospital, Harvard(哈佛大学布莱尔妇女医院) ; HeartFlow(HeartFlow公司) ; Showa University(昭和大学) ; OLV Aalst
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种基于潜在扩散模型的冠状动脉解剖生成方法,通过形态-骨骼控制实现可控的解剖合成,用于虚拟干预研究。
Comments Accepted to ECCV 2024
基于扩散重建的数据似然估计的核心集选择
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出基于扩散重建的数据似然估计方法,通过重建偏差作为评分标准,有效提升核心集选择性能。
Comments Accepted by AAAI 2026
超越奖励边际:通过视频生成重新思考和解决扩散模型中的似然位移
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出PG-DPO方法,通过结合ARS和IPR缓解扩散模型中的似然位移问题,提升视频生成任务的偏好对齐性能。
用于3D一致视频生成的视图一致扩散表示
机构 * University of Edinburgh(爱丁堡大学) ; University of Bristol(布里斯托大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 ViCoDR通过学习多视图一致的扩散表示,提升视频生成的3D一致性,适用于图像到视频、文本到视频和多视图生成任务。