arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70082 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2607.16300 2026-07-21 cs.CV 新提交 79%

FedDP-PALD: A Privacy-Preserving Federated Latent Diffusion Framework with Prototype Aggregation for Medical Data Synthesis

FedDP-PALD:一种用于医学数据合成的具有原型聚合的隐私保护联邦潜在扩散框架

Md. Sajeebul Islam Sk., Khan Enaet Hossain, Md. Mehedi Hasan Shawon

机构 * BRAC University(BRAC大学) York University(约克大学) University of Maryland(马里兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对医学数据合成中隐私保护及合成数据预测结构问题,提出FedDP-PALD框架,通过带掩码的门控多头注意力联合处理多模态数据,引入DP-PMA维持差分隐私,实验表明该框架能生成隐私合成表示,保持决策性能并抵抗成员推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13247 2026-07-21 cs.CV 版本更新 79%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15650 2026-07-20 cs.CV 新提交 79%

DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

DiTango:基于选择性注意力状态重用的经济高效并行扩散生成

Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) University of Science and Technology Beijing(北京科技大学) PJlab(PJ实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散变换器并行化技术在多节点环境下通信开销大的问题,提出DiTango框架,通过选择性注意力状态机制及锚点引导的状态选择规划器等,在多节点设置中实现加速并保持生成质量。

Journal ref The 35th International Symposium on High-Performance Parallel and Distributed Computing (HPDC'26), July 13--16, 2026, Cleveland, OH, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15585 2026-07-20 cs.MM 新提交 79%

SPEED: One-Step Pixel Diffusion for High-quality Video Frame Interpolation

SPEED:用于高质量视频帧插值的单步像素扩散

Zihao Zhang, Haoyu Zhao, Siqian Yang, Yidi Wu, Yudong Jiang, Zuxuan Wu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 研究针对视频帧插值中现有扩散模型的问题,提出SPEED单步像素扩散框架。采用渐进多阶段架构、仅噪声更新注意力机制和漂移感知时间步采样策略,实现高质量单步推理,在多个基准测试中性能超越现有方法。

Comments ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15527 2026-07-20 cs.CV 新提交 79%

Physics-aware Masked Diffusion-based Flood Simulation for Urban Fisheye Disaster Detection

基于物理感知的掩码扩散的洪水模拟用于城市鱼眼灾害检测

Sodtavilan Odonchimed, Tsogt Enkhbayar, Oyunzul Munkhtamga, Munkhjargal Gochoo

机构 * The University of Tokyo(东京大学) Mongolian University of Science and Technology(蒙古科技大学) United Arab Emirates University(阿联酋大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现实中洪水数据短缺及鱼眼图像失真致高精度洪水模拟难的问题,提出PhysFlood系统,利用扩散模型从单张鱼眼图像合成逼真洪水,可自由控制生成多样场景,实验证明其模拟图像有逼真度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05509 2026-07-20 cs.CV 版本更新 79%

Be Tangential to Manifold: Discovering Riemannian Metric for Diffusion Models

与流形相切:为扩散模型发现黎曼度量

Shinnosuke Saito, Takashi Matsubara

机构 * Hokkaido University(北海道大学) CyberAgent

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的黎曼度量,通过分数函数雅可比的谱结构区分流形切线与法线方向,从而在噪声空间中促进路径保持流形切线性,提升扩散模型的生成质量与文本-图像对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15128 2026-07-17 cs.CV 新提交 79%

DAPGNet: Dynamic Adaptive Physics-Guided Graph Diffusion Network for Hyperspectral Image Classification

DAPGNet:用于高光谱图像分类的动态自适应物理引导图扩散网络

Pengkun Wang, Weijia Cao, Ning Wang, Xiaofei Yang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) Guangzhou University(广州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对高光谱图像分类中像素关系建模问题,提出DAPGNet。该网络将物理先验融入图学习,经多步骤构建拓扑、进行图扩散等操作,通过跨尺度融合优化。实验表明其在多个数据集上性能最优,提升了分类准确率,验证了各模块的互补作用。

Comments 9 figures and 9 tables. Pengkun Wang and Weijia Cao contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15041 2026-07-17 cs.CV 新提交 79%

Weakly-Supervised RGB-D Salient Object Detection via SAM-driven Pseudo Annotation and State Space Interaction-based Diffusion

通过基于 SAM 的伪标注和基于状态空间交互的扩散进行弱监督 RGB-D 显著目标检测

Wenqi Si, Gongyang Li, Shixiang Shi, Weisi Lin

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究弱监督 RGB-D 显著目标检测,提出由 SAM-PAG 和 $S^2$Diff 组成的方法,前者扩展稀疏涂鸦为伪标注,后者在条件信息引导下细化显著图,二者合作使方法性能优异。

Comments 13 pages, 9 figures, accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14836 2026-07-17 cs.CV 新提交 79%

Physics-Informed Diffusion for Biomechanically Plausible 3D Sign Language Generation

用于生物力学合理的3D手语生成的物理信息扩散

Emanuele Colonna, Moises Diaz, Gennaro Vessio, Miguel Angel Ferrer, Giovanna Castellano

机构 * Department of Computer Science, University of Bari Aldo Moro(巴里阿尔多·莫罗大学计算机科学系) Institute for Technological Development and Innovation in Communications, University of Las Palmas de Gran Canaria(拉斯帕尔马斯大加那利大学通信技术发展与创新研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究手语生成问题,提出物理信息扩散模型PIDiffSign,将解剖学约束融入架构与训练目标,用Transformer编码器 - 解码器及可微几何模块训练,实验证明该模型能提升手语生成的运动真实感和语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09238 2026-07-17 cs.CV 版本更新 79%

Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method

知识嵌入与超网络引导的少样本变电站电表缺陷图像生成方法

Jackie Alex, Justin Petter

机构 * St. Petersburg College(斯波尔丁学院)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对变电站电表缺陷图像标注样本稀缺问题,提出将知识嵌入、超网络引导条件控制集成到稳定扩散管道的方法,能逼真可控合成缺陷图像,优于现有基线,提升下游检测器mAP等,为工业检测提供数据合成方案。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20153 2026-07-17 cs.CV 版本更新 79%

CoDi -- an exemplar-conditioned diffusion model for low-shot counting

CoDi——一种用于少样本计数的示例条件扩散模型

Grega Šuštar, Jer Pelhan, Alan Lukežič, Matej Kristan

机构 * Faculty of Computer and Information Science, University of Ljubljana(计算机与信息科学学院,卢布尔雅那大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究少样本目标计数问题,提出基于潜在扩散的CoDi模型,其核心是基于示例的条件模块,能生成高质量密度图。在FSC和MCAC基准测试中表现出色,分别在少样本等场景及整体上大幅超越现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10999 2026-07-17 cs.CV 版本更新 79%

Conditioning Residuals for Diffusion Models via Representation Feedback

通过表示反馈对扩散模型的残差进行条件设定

Weilai Xiang, Hongyu Yang, Di Huang, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型中能否利用固有路径路由内部推断语义,提出条件残差这一轻量级反馈机制,通过反馈紧凑特征摘要提供自适应指导,实验显示其提升了生成性能及下游任务表现,还揭示了训练动态和特征结构的改进。

Comments Substantially revised and retitled. Code available at https://github.com/FutureXiang/ddae_plus_plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16839 2026-07-17 cs.CV 版本更新 79%

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa:用于多模态理解的大型扩散语言模型

Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Adobe Research(Adobe研究) Salesforce Research(Salesforce研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13927 2026-07-16 cs.CV 新提交 79%

Cyclone: Diffusion Model for Cycle-Consistent Weather Editing from Unpaired Driving Data

Cyclone:基于未配对驱动数据的循环一致天气编辑扩散模型

Thang-Anh-Quan Nguyen, Moussab Bennehar, Luis Guillermo Roldao Jimenez, Nathan Piasco, Dzmitry Tsishkou, Laurent Caraffa, Jean-Philippe Tarel, Roland Brémond

机构 * Huawei Paris Research Center(华为巴黎研究中心) Gustave Eiffel University(古斯塔夫·埃菲尔大学) IGN-ENSG(法国国家地理信息与森林和环境信息研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对自动驾驶系统在不同天气条件下可靠感知的挑战,提出Cyclone框架,基于潜在扩散,利用循环一致约束和图像-文本模型知识,无需配对数据生成多种天气条件,实验表明其输出更优,还可提炼为视频扩散模型。

Comments Project page: https://ntaquan0125.github.io/weather-cyclone/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13563 2026-07-16 cs.CV 新提交 79%

Nexus: Native Mesh Generation with Diffusion

Nexus:基于扩散的原生网格生成

Hanxiao Wang, Ying-Tian Liu, Yuan-Chen Guo, Qi-Yuan Feng, Zi-Xin Zou, Ding Liang, Biao Zhang, Yan-Pei Cao

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VAST(无(暂未找到合适中文名,VAST可音译为“瓦斯特”,但这并非一个正式的中文机构名,所以保留英文)) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对高质量三角形网格生成问题,提出Nexus扩散方法,通过解耦顶点与拓扑生成实现整体网格生成,经实验验证其性能优于现有基线,有效克服顺序网格建模局限且获从业者青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13371 2026-07-16 cs.CV 新提交 79%

RoughNet: Mapping Arctic Sea Ice Roughness Using Diffusion-Based Super-Resolution of Satellite Imagery

RoughNet:利用基于扩散的卫星图像超分辨率绘制北极海冰粗糙度

Tessa Cannon, Michel Tsamados, Petru Manescu, Thomas Newman, Christian Haas, Veit Helm, Weibin Chen, Randall Scharien

机构 * University College London(伦敦大学学院) Alfred Wegener Institute Helmholtz Centre for Polar and Marine Research(阿尔弗雷德·韦格纳极地与海洋研究所亥姆霍兹中心) University of Victoria(维多利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究旨在准确估计北极海冰粗糙度,采用RoughNet方法,通过条件扩散框架从光学卫星图像重建海冰地形,经训练和评估,能在不同冰况下泛化,为高分辨率海冰测绘和粗糙度估计提供可扩展途径。

Comments Code available at https://github.com/tessacannon48/RoughNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13164 2026-07-16 cs.CL cs.CV cs.LG 新提交 79%

Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation

文本到手语:用于文本到手语视频生成的单 GPU 扩散基线

Ruize Xia

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究文本到手语视频生成,提出Text2Sign模型,结合冻结视觉语言文本编码器等技术,降低全视频注意力成本。在特定分割上有一定验证损失等结果,虽提示敏感性弱,但为单GPU研究提供了基线。

Journal ref IEEE Access, vol. 14, pp. 64003-64017, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12785 2026-07-16 cs.CV 版本更新 79%

ExtraGS: Enhancing Endoscopic View Extrapolation via Diffusion-Guided 3D Gaussian Splatting

ExtraGS:通过扩散引导的3D高斯点渲染增强内窥镜视图外推

Cheng-Tai Hsieh, Jiwei Shan, Han Fang, Jianshu Hu, Tao Ni, Lijun Han, Yutong Ban, Shing Shin Cheng, Hesheng Wang

机构 * The School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, and the Shanghai Key Laboratory of Navigation and Location-Based Services(上海交通大学自动化与智能感知学院以及上海市导航与位置服务重点实验室) Global College, Shanghai Jiao Tong University(上海交通大学密西根学院) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对传统内窥镜视野局限及神经渲染外推有伪影问题,提出ExtraGS框架,通过不确定性引导虚拟相机采样、扩散模型细化视图及置信加权微调策略,增强内窥镜视图外推,在新视图合成中达先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28419 2026-07-16 cs.CV cs.AI 版本更新 79%

MedDiffuseMix: Preserving Diagnostic Evidence with Saliency-Aware Diffusion Medical Image Data Augmentation

MedDiffuseMix: 通过显著性感知的扩散医学图像数据增强保留诊断证据

Teerath Kumar, Raja Vavekanand, Muhammad Turab

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MedDiffuseMix框架,利用分类器显著性图引导扩散混合,主要增强低显著性背景区域,保留诊断关键区域,在四个医学图像数据集上提升分类性能。

Comments Under review Signal Image and Video Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12937 2026-07-15 eess.IV cs.CV 新提交 79%

Exact and Calibrated Diffusion Reconstruction for Digital Breast Tomosynthesis

数字乳腺断层合成的精确校准扩散重建

Imade Bouftini

机构 * Imade Bouftini

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对有限角度数字乳腺断层合成,提出用精确欧几里得投影替换近端更新来确保数据一致性,通过等渗重新校准解决不确定性问题,修复投影仪伴随不匹配,实现首个数据一致、不确定性校准的学习重建,提高了重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13031 2026-07-15 cs.LG cs.CV 新提交 79%

The Seriality Gap in Video Diffusion Models

视频扩散模型中的序列性差距

Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, Yutong Bai

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究视频扩散模型在多球动力学实验中的表现,发现其存在序列性差距,即任务所需串行计算与模型去噪循环不匹配,增加有效串行计算的方法可提升性能,还证明去噪步骤在串行推理和模拟任务上有结构障碍。

Comments Jorge Diaz Chao and Konpat Preechakul contributed equally. 24 pages, 12 figures, and 5 tables. Project page: https://seriality-gap.jdiazchao.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12464 2026-07-15 cs.CV cs.LG 新提交 79%

Steering Diffusion Models via Class-Contrastive Influence for Few-Shot Medical Classification

通过类对比影响引导扩散模型进行少样本医学分类

Jeeyung Kim, Erfan Esmaeili, Qiang Qiu

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对少样本医学分类中标记数据稀缺,现有方法忽视样本对分类有用性衡量与优化的问题,提出类对比影响(C2I)准则,通过强化学习用C2I奖励微调扩散模型,引导生成类信息丰富样本,提高了下游准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11941 2026-07-15 cs.CV cs.LG 新提交 79%

GenDiff: A Dose and Anatomy Aware Diffusion Model with Structural Prior Refinement for Low-Dose CT Reconstruction and Generalization

GenDiff:一种具有结构先验细化的剂量和解剖感知扩散模型,用于低剂量CT重建和泛化

Md Imam Ahasan, Guangchao Yang, A F M Abdun Noor, Kah Ong Michael Goh, S. M. Hasan Mahmud, Md Mahfuzur Rahman

机构 * Faculty of Information Science & Technology, Multimedia University, Malaysia(马来西亚多媒体大学信息科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对低剂量CT重建中现有方法局限性,提出GenDiff框架,联合建模剂量与解剖信息,集成多种模块,经多数据集实验验证,该方法在不同条件下鲁棒性强且重建质量优,是低剂量CT成像的有前途方案。

Comments 20 pages, 8 figures, 4 tables. Under review at PeerJ Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20101 2026-07-15 cs.SD cs.AI cs.MM 版本更新 79%

RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers

基于整流流的混合扩散变压器用于指令引导音频编辑

Liting Gao, Yonggang Zhu, Yaru Chen, Dongyu Wang, Shubin Zhang, Zhenbo Li, Jean-Yves Guillemaut, Wenwu Wang

机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Fisheries College, Ocean University of China(中国海洋大学水产学院) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 提出混合两阶段扩散变压器架构,通过粗到细策略平衡全局语义对齐与局部细节编辑,在重叠音频事件和复杂指令任务上提升性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01841 2026-07-15 cs.CV 版本更新 79%

Leveraging Prior Knowledge of Diffusion Model for Person Search

利用扩散模型的先验知识进行行人搜索

Giyeol Kim, Sooyoung Yang, Jihyong Oh, Myungjoo Kang, Chanho Eom

机构 * GSAIM, Chung-Ang University(Chung-Ang大学图像信息研究所) IPAI, Seoul National University(首尔国立大学图像感知研究所) Department of Mathematical Sciences and RIMS, Seoul National University(首尔国立大学数学科学系和RIMS)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对行人搜索中现有方法的不足,提出DiffPS框架,利用预训练扩散模型,消除子任务优化冲突,通过分析扩散先验属性设计三个专门模块,在CUHK-SYSU和PRW数据集上取得新的最优成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09122 2026-07-15 cs.CV 版本更新 79%

LVMark: Robust Watermark for Latent Video Diffusion Models

LVMark:用于潜在视频扩散模型的鲁棒水印

Youngdong Jang, MinHyuk Jang, JaeHyeok Lee, Feng Yang, Gyeongrok Oh, Jongheon Jeong, Sangpil Kim

机构 * Department of Artificial Intelligence, Korea University, Seoul 02841, Republic of Korea(人工智能系,韩国大学,首尔02841,大韩民国) Google DeepMind, Mountain View, CA 94043, USA(谷歌DeepMind,山景城,加利福尼亚州94043,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型现有水印方法的局限,提出LVMark方法,通过学习相邻帧一致性设计新颖水印解码器,结合小波域低频分量与视频颜色特征确保解码准确,训练潜在解码器保持视觉保真,平衡视觉质量与比特精度,实现高容量鲁棒水印嵌入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10094 2026-07-15 cs.CV cs.LG 版本更新 79%

Beyond Perceptual Distance: Discrepancy Assessment on Deep Representation for Out-of-Distribution Detection with Diffusion Model

超越感知距离:基于扩散模型的分布外检测深度表示差异评估

Kun Fang, Zuopeng Yang, Haibo Hu, Xiaolin Huang, Jie Yang, Qinghua Tao

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) The Intsig Information Co., Ltd., Shanghai, China(上海Intsig信息有限公司) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究基于扩散模型的分布外检测差异评估,提出以分类器相关方式评估,利用其表示空间量化特征级和logit级差异,设计优化策略构成DDR框架,实验表明DDR在ImageNet-1K数据集上检测性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11578 2026-07-14 cs.LG cs.AI cs.CV eess.SP 新提交 79%

DiffEEG: A Self-Supervised Denoising Diffusion Model for Learning EEG Generic Representations

DiffEEG:用于学习脑电通用表示的自监督去噪扩散模型

Abdulkader Helwan, Lina Abou-Abbas, Hussein El Amouri, Belkacem Chikhaoui, Khadidja Henni

机构 * Lebanese American University(黎巴嫩美国大学) Institute of Applied Artificial Intelligence, TÉLUQ University(应用人工智能研究所,泰鲁克大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对基于脑电的癫痫检测面临的注释稀缺和类别不平衡问题,提出DiffEEG自监督基础模型,通过去噪扩散预训练和强化学习微调学习通用神经表示,在癫痫检测中取得较好效果,证明该方法能以最少标记数据实现临床可部署监测。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11533 2026-07-14 cs.CV cs.LG 新提交 79%

Adaptive Routing for Efficient Diffusion Transformer-Based PNI Prediction

基于高效扩散变压器的PNI预测的自适应路由

Youngung Han, Dohyun Kweon, Kyeonghun Kim, Hyunsu Go, Jina Jeong, Suah Park, Induk Um, Junga Kim, Anna Jung, Yului Jeong, Sungha Park, Jinyong Jun, Pa Hong, Woo Kyoung Jeong, Won Jae Lee, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) Kyung Hee University(庆熙大学) OUTTA Chung-Ang University(Chung-Ang 大学) Seoul National University School of Medicine(首尔国立大学医学院) Samsung Changwon Hospital(三星昌原医院) Samsung Medical Center(三星医疗中心) NVIDIA AI Technology Center(NVIDIA AI 技术中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对胆管癌PNI术前MRI预测难题,传统方法有局限。本文将PNI预测设为扩散分类问题,用基于Transformer的表示实现去噪网络,并引入自适应路由提高效率,实验取得了0.731的AUC及257.57 GFLOPs的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11081 2026-07-14 cs.CV cs.AI 新提交 79%

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

通过注意力头控制扩散变换器中的运动传递

Sunyoung Jung, Jiwoo Park, Yoonseok Choi, Kyobin Choo, Ming-Hsuan Yang, Seong Jae Hwang

机构 * Yonsei University(延世大学) LG Electronics(LG电子) University of California, Merced(加州大学默塞德分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究如何控制扩散变换器中的运动传递,通过在注意力头层面分析,提出无需参数更新的头感知可控运动传递框架,利用语义对应引导和选择性特征注入,实现精确运动传递并为可控视频生成提供可解释基础。

Comments Accepted to ECCV 2026, Project page: https://sunyj-hxppy.github.io/halo/

详情

展开后加载摘要…

URL PDF HTML 收藏