arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2509.26010 2026-04-21 cs.CV 79%

New Fourth-Order Grayscale Indicator-Based Telegraph Diffusion Model for Image Despeckling

新的第四阶灰度指标基于电报扩散模型用于图像去斑

Rajendra K. Ray, Manish Kumar

机构 * School of Mathematical and Statistical Sciences, Indian Institute of Technology Mandi(印度理工学院曼迪数学与统计科学学院) Department of Mathematics, Indian Institute of Technology Delhi(印度理工学院德里数学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种第四阶非线性PDE模型,结合扩散和波特性,以改善去斑效果,通过PSNR、MSSIM和SI指标验证其有效性,并扩展至彩色图像处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08013 2026-04-21 cs.CV cs.AI cs.LG 79%

StableMTL: Repurposing Latent Diffusion Models for Multi-Task Learning from Partially Annotated Synthetic Datasets

StableMTL: 利用潜在扩散模型重新利用多任务学习于部分标注的合成数据集

Anh-Quan Cao, Ivan Lopes, Raoul de Charette

机构 * Inria(法国国家科研机构)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出StableMTL,通过利用扩散模型的泛化能力,在部分标注的合成数据集上进行多任务学习,采用统一的潜在损失和多流模型促进任务间协同,优于基线模型。

Comments Accepted at CVPR 2026. Code is at https://github.com/astra-vision/StableMTL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17818 2026-04-21 cs.CV 79%

AnyLift: Scaling Motion Reconstruction from Internet Videos via 2D Diffusion

AnyLift: 通过2D扩散模型从互联网视频中扩展运动重建

Hongjie Li, Heng Yu, Jiaman Li, Hong-Xing Yu, Ehsan Adeli, C. Karen Liu, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AnyLift框架,利用2D扩散模型从互联网视频中重建3D人体运动和人-物交互,通过合成多视角2D运动数据和训练相机条件多视角2D运动扩散模型,提升动态摄像下运动重建的准确性和鲁棒性。

Comments CVPR 2026. Project website: https://awfuact.github.io/anylift/ The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03692 2026-04-21 cs.CV cs.AI 79%

Error as Signal: Stiffness-Aware Diffusion Sampling via Embedded Runge-Kutta Guidance

误差作为信号:通过嵌入式龙格-库塔引导的刚性感知扩散采样

Inho Kong, Sojin Lee, Youngjoon Hong, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) Korea Institute for Advanced Study(韩国高级研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出嵌入式龙格-库塔引导方法,通过识别刚性区域减少局部截断误差,提升扩散模型采样稳定性与质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20033 2026-04-21 cs.CV 79%

FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs

FlashLips: 100-FPS 无掩码的潜在唇部同步使用重建而非扩散或GANs

Andreas Zinonos, Michał Stypułkowski, Antoni Bigata, Stavros Petridis, Maja Pantic, Nikita Drobyshev

机构 * Imperial College London(帝国理工学院伦敦分校) Cantina Labs(Cantina实验室) NatWest AI Research(NatWest人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FlashLips是一种无掩码的唇部同步系统,通过重建而非扩散或GANs实现实时性能,其U-Net变体在单GPU上达100FPS,视觉质量媲美先进模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19979 2026-04-21 cs.CV 79%

CamPVG: Camera-Controlled Panoramic Video Generation with Epipolar-Aware Diffusion

CamPVG:基于视图控制的全景视频生成与视图感知扩散

Chenhao Ji, Chaohui Yu, Junyao Gao, Fan Wang, Cairong Zhao

机构 * Tongji University(同济大学) DAMO Academy, Alibaba Group(阿里达摩院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CamPVG,首个基于视图控制的全景视频生成框架,通过全景Plücker嵌入和视图感知模块提升生成视频的质量与一致性。

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14461 2026-04-21 cs.CV 79%

Ouroboros: Single-step Diffusion Models for Cycle-consistent Forward and Inverse Rendering

Ouroboros: 单步扩散模型用于循环一致的正向与反向渲染

Shanlin Sun, Yifan Wang, Hanwen Zhang, Yifeng Xiong, Qin Ren, Ruogu Fang, Xiaohui Xie, Chenyu You

机构 * University of California, Irvine(加州大学伊维特分校) Stony Brook University(石溪大学) Huazhong University of Science and Technology(华中科技大学) University of Florida(佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Ouroboros通过双单步扩散模型实现正反向渲染的互促,扩展了内在分解到室内外场景,并引入循环一致性机制,实验显示其在多样场景中表现优异且推理速度显著提升。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07826 2026-04-21 cs.CV cs.LG cs.RO 79%

R3D2: Realistic 3D Asset Insertion via Diffusion for Autonomous Driving Simulation

R3D2:通过扩散实现自动驾驶模拟中的真实3D资产插入

William Ljungbergh, Bernardo Taveira, Wenzhao Zheng, Adam Tonderski, Chensheng Peng, Fredrik Kahl, Christoffer Petersson, Michael Felsberg, Kurt Keutzer, Masayoshi Tomizuka, Wei Zhan

机构 * Zenseact Linköping University(林哈尔大学) Chalmers University(查尔姆斯理工大学) UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 R3D2是一种轻量级单步扩散模型,用于在现有场景中实时生成真实3D资产,通过训练学习真实集成,提升自动驾驶模拟的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16919 2026-04-21 cs.LG cs.AI cs.CV 79%

Noise-Adaptive Diffusion Sampling for Inverse Problems Without Task-Specific Tuning

具有任务无关调优的噪声自适应扩散采样用于逆问题

Yingzhi Xia, Setthakorn Tanomkiattikun, Liangli Zhen, Zaiwang Gu

机构 * Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,科技研究局,新加坡) Institute for Infocomm Research, Agency for Science, Technology and Research, Singapore(信息通信研究所,科技研究局,新加坡) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出噪声空间Hamilton蒙特卡洛方法,用于逆问题求解,避免局部极值并提升鲁棒性,通过噪声空间探索提升重建质量。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16841 2026-04-21 cs.CV cs.LG 79%

When Earth Foundation Models Meet Diffusion: An Application to Land Surface Temperature Super-Resolution

当地球基础模型遇见扩散:一种用于地表温度超分辨率的应用

Yiheng Chen, Zihui Ma, Peishi Jiang, Yilong Dai, Qikai Hu, Xinyue Ye, Lingyao Li, Rita Sousa, Runlong Yu

机构 * University of Alabama(阿拉巴马大学) Emory University(埃默里大学) University of Michigan(密歇根大学) University of South Florida(佛罗里达州立大学) New York University(纽约大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出EFDiff框架,利用地球基础模型指导扩散模型进行极端空间退化下的超分辨率重建,通过交叉注意力机制提升细尺度重建效果,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16479 2026-04-21 cs.CV cs.AI 79%

Latent-Compressed Variational Autoencoder for Video Diffusion Models

视频扩散模型的潜在压缩变分自编码器

Jiarui Guan, Wenshuai Zhao, Zhengtao Zou, Juho Kannala, Arno Solin

机构 * Aalto University(阿alto大学) ELLIS Institute Finland(ELLIS研究所芬兰) University of Oulu(奥卢大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种潜在压缩方法,通过去除视频潜在表示中的高频成分而非直接减少通道数,提升视频生成质量与压缩效率。

Comments Accepted to CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09721 2026-04-21 cs.CV 79%

FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation

FrameDiT:基于矩阵注意力的扩散变换器用于高效视频生成

Minh Khoa Le, Kien Do, Duc Thanh Nguyen, Truyen Tran

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德肯大学应用人工智能倡议,澳大利亚) FPT Smart Cloud, Vietnam(越南FPT智能云) Deakin University, Australia(德肯大学,澳大利亚)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Matrix Attention,通过将帧视为矩阵来处理视频生成中的时空动态,结合FrameDiT-G和FrameDiT-H模型,在保持效率的同时提升了视频质量和时间一致性。

Comments Code: https://github.com/minhkhoale/FrameDiT Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16135 2026-04-20 cs.CV 79%

Motion-Adapter: A Diffusion Model Adapter for Text-to-Motion Generation of Compound Actions

Motion-Adapter:一种用于复合动作文本到运动生成的扩散模型适配器

Yue Jiang, Mingyu Yang, Liuyuxin Yang, Yang Xu, Bingxin Yun, Yuhe Zhang

机构 * School of Computer Science, Northwest University(西北大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Motion-Adapter,通过计算解耦的交叉注意力图,解决文本到运动扩散模型中的时间信息处理和注意力崩溃问题,提升复合动作生成的准确性和连贯性。

Comments 12 pages, 12 figures, Under review for publication in IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16044 2026-04-20 cs.CV 79%

Elucidating the SNR-t Bias of Diffusion Probabilistic Models

阐明扩散概率模型的SNR-t偏差

Meng Yu, Lei Sun, Jianhao Zeng, Xiangxiang Chu, Kun Zhan

机构 * Lanzhou University(兰州大学) AMAP Alibaba Group(AMAP阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文揭示了扩散模型在推理阶段SNR与时间步的不匹配问题,提出差分校正方法提升生成质量,实验表明在多种模型和数据集上效果显著。

Comments Accepted to CVPR 2026, 19pages, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15923 2026-04-20 cs.SD cs.CV 79%

Hierarchical Codec Diffusion for Video-to-Speech Generation

层次编码扩散用于视频到语音生成

Jiaxin Ye, Gaoxiang Cong, Chenhui Wang, Xin-Cheng Wen, Zhaoyang Li, Boyuan Cao, Hongming Shan

机构 * Fudan University(复旦大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HiCoDiT,利用残差向量量化编码的层次结构,通过低层和高层块生成不同层级的语音令牌,以实现强音频视觉对齐,实验表明其在保真度和表达性上优于基线。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14560 2026-04-17 cs.CV 79%

DVFace: Spatio-Temporal Dual-Prior Diffusion for Video Face Restoration

DVFace:时空双先验扩散用于视频面部修复

Zheng Chen, Bowen Chai, Rongjun Gao, Mingtao Nie, Xi Li, Bingnan Duan, Jianping Fang, Xiaohong Liu, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DVFace,一种单步扩散框架,通过时空双代码本设计提取互补的空间和时间面部先验,提升视频面部修复的质量、时间一致性和身份保持。

Comments Code is available at: https://github.com/zhengchen1999/DVFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14379 2026-04-17 cs.LG cs.AI cs.CV 79%

Step-level Denoising-time Diffusion Alignment with Multiple Objectives

分步级去噪时间扩散对齐与多目标

Qi Zhang, Dawei Wang, Shaofeng Zou

机构 * School of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程学院,亚利桑那州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MSDDA框架,通过分步级强化学习对扩散模型进行多目标对齐,无需重新训练,实现闭式解的最优去噪分布,避免了现有方法的近似误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13763 2026-04-17 cs.LG cs.AI cs.CV stat.ML 79%

Diagnosing and Improving Diffusion Models by Estimating the Optimal Loss Value

通过估计最优损失值来诊断和改进扩散模型

Yixian Xu, Shengjie Luo, Liwei Wang, Di He, Chang Liu

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Zhongguancun Academy(中关村学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文通过估计扩散模型的最优损失值,提出了一种诊断和改进扩散模型的方法,开发了有效的估计器,并发现减去最优损失后,功率律更明显。

Comments 33 pages, 12 figures, 9 tables. ICLR 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09209 2026-04-17 cs.CV 79%

JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation

JoyVASA: 基于扩散模型的面部和动物图像动画:结合音频驱动的面部动态和头部运动生成

Xuyang Cao, Guoxin Wang, Sheng Shi, Jun Zhao, Yang Yao, Jintao Fei, Minyu Gao, Pei Xie

机构 * JD Health International Inc.(JD健康国际公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出JoyVASA,一种基于扩散模型的音频驱动面部动画方法,通过解耦面部表示和独立于角色身份的运动生成,实现更长视频和动物面部的无缝动画。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13994 2026-04-16 cs.CV 79%

Remote Sensing Image Super-Resolution for Imbalanced Textures: A Texture-Aware Diffusion Framework

遥感图像超分辨率中的不平衡纹理处理:一种纹理感知扩散框架

Enzhuo Zhang, Sijie Zhao, Dilxat Muhtar, Zhenshi Li, Xueliang Zhang, Pengfeng Xiao

机构 * Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TexADiff框架,通过估计相对纹理密度图来解决遥感图像中纹理不平衡问题,改进模型的空间感知能力,提升超分辨率的定量和定性性能。

Comments 10 pages, 5 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13906 2026-04-16 cs.CV 79%

Blind Bitstream-corrupted Video Recovery via Metadata-guided Diffusion Model

基于元数据引导扩散模型的盲视流损坏视频恢复

Shuyun Wang, Hu Zhang, Xin Shen, Dadong Wang, Xin Yu

机构 * The University of Queensland(昆士兰大学) Data61, CSIRO, Australia(澳大利亚CSIRO数据61实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出元数据引导扩散模型,用于在无预定义损坏区域掩码的情况下恢复损坏视频,通过双流元数据编码器提取运动向量和帧类型,结合交叉注意力机制与后处理模块提升恢复效果。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13509 2026-04-16 cs.CV 79%

DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer

DiT作为实时重绘器:基于自回归扩散变换器的流式视频风格化

Hengye Lyu, Zisu Li, Yue Hong, Yueting Weng, Jiaxin Shi, Hanwang Zhang, Chen Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) XMax.AI Ltd.(XMax人工智能有限公司) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出RTR-DiT框架,通过微调双向教师模型和知识蒸馏实现高效视频风格化,支持文本和参考图像引导,实现实时稳定处理长视频和风格切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13307 2026-04-16 cs.CV cs.LG 79%

Deep Spatially-Regularized and Superpixel-Based Diffusion Learning for Unsupervised Hyperspectral Image Clustering

深度空间正则化与超像素基于扩散学习的无监督超光谱图像聚类

Vutichart Buranasiri, James M. Murphy

机构 * Tufts University(塔夫茨大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种结合掩码深度表征学习与扩散聚类的无监督超光谱图像聚类框架,通过改进的空间正则化超像素扩散学习算法,提升聚类质量。

Comments To appear in IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12525 2026-04-16 cs.CV 79%

CoD-Lite: Real-Time Diffusion-Based Generative Image Compression

CoD-Lite:基于扩散的实时生成图像压缩

Zhaoyang Jia, Naifu Xue, Zihan Zheng, Jiahao Li, Bin Li, Xiaoyi Zhang, Zongyu Guo, Yuan Zhang, Houqiang Li, Yan Lu

机构 * University of Science(大学科学) Microsoft Research Asia(微软亚洲研究院) Communication University of China(通信大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出轻量级扩散编码器,通过分析预训练对模型的影响和Transformer的必要性,实现了60FPS编码和42FPS解码,降低比特率85%并接近MS-ILLM的FID性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09106 2026-04-16 cs.CV cs.LG 79%

Detecting Diffusion-generated Images via Dynamic Assembly Forests

通过动态装配森林检测扩散生成图像

Mengxin Fu, Yuezun Li

机构 * School of Computer Science and Technology, Ocean University of China(中国海洋大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出动态装配森林模型,用于检测扩散生成图像,相比传统深度学习模型,其参数更少、计算成本更低,可在无GPU环境下实现高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14566 2026-04-16 cs.CV 79%

DICE: Diffusion Consensus Equilibrium for Sparse-view CT Reconstruction

DICE:扩散共识均衡用于稀疏视角CT重建

Leon Suarez-Rodriguez, Roman Jacome, Romario Gualdron-Hurtado, Ana Mantilla-Dulcey, Henry Arguello

机构 * Department of Systems and Informatics Engineering(系统与信息工程系) Department of Electrical, Electronics, and Telecommunications Engineering(电气、电子与电信工程系) Department of Physics(物理系) Universidad Industrial de Santander(圣安德烈斯工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DICE框架通过整合双代理共识均衡,结合生成先验能力和测量一致性,有效提升稀疏视角CT重建质量,实验显示在15、30和60视角下优于现有方法。

Comments 8 pages, 4 figures, confenrence

Journal ref Proceedings of the 2025 IEEE 10th International Workshop on Computational Advances in Multi-Sensor Adaptive Processing (CAMSAP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12781 2026-04-15 cs.CV 79%

Fragile Reconstruction: Adversarial Vulnerability of Reconstruction-Based Detectors for Diffusion-Generated Images

脆弱的重建:基于重建的检测器在扩散生成图像中的对抗脆弱性

Haoyang Jiang, Mingyang Yi, Shaolei Zhang, Junxian Cai, Qingbin Liu, Xi Chen, Ju Fan

机构 * Renmin University of China(中国人民大学) Tencent Inc.(腾讯公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究发现基于重建的检测器在扩散生成图像检测中存在严重对抗脆弱性,通过微小对抗扰动可使检测准确率降至近零,揭示了现有检测策略的安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06424 2026-04-15 eess.IV cs.AI cs.CV eess.SP stat.ML 79%

Turbo-DDCM: Fast and Flexible Zero-Shot Diffusion-Based Image Compression

Turbo-DDCM:快速且灵活的零样本扩散图像压缩

Amit Vaisman, Guy Ohayon, Hila Manor, Michael Elad, Tomer Michaeli

机构 * Technion – Israel Institute of Technology(技术学院—以色列理工学院) Flatiron Institute, Simons Foundation(Flatiron研究所,Simons基金会)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Turbo-DDCM,一种快速且高效的零样本扩散图像压缩方法,通过优化噪声向量处理和编码协议,提升压缩效率并保持性能。

Comments ICLR 2026. Code is available at https://amitvaisman.github.io/turbo_ddcm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13793 2026-04-15 cs.CV cs.CR cs.LG 79%

NoisePrints: Distortion-Free Watermarks for Authorship in Private Diffusion Models

NoisePrints: 用于私有扩散模型作者身份验证的无损水印

Nir Goren, Oren Katzir, Abhinav Nakarmi, Eyal Ronen, Mahmood Sharif, Or Patashnik

机构 * Tel Aviv University(特拉维夫大学) University of Michigan(密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NoisePrints,一种轻量级水印方案,利用扩散过程的随机种子作为作者身份证明,通过哈希函数确保种子无法从内容中恢复,实现无损水印验证。

Comments code available at: https://github.com/nirgoren/NoisePrints

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11715 2026-04-15 cs.CV 79%

Point Prompting: Counterfactual Tracking with Video Diffusion Models

点提示:基于视频扩散模型的反事实跟踪

Ayush Shrivastava, Sanyam Mehta, Daniel Geng, Andrew Owens

机构 * University of Michigan(密歇根大学) Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型进行零样本点跟踪,通过提示模型在视频中标记移动点,实现反事实生成,实验表明其跟踪效果优于传统方法且能克服遮挡。

Comments ICLR 2026. Project link: https://point-prompting.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏