arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70082 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2608.00543 2026-08-04 cs.CR cs.AI cs.CV 新提交 79%

Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor

鲁棒水印与中毒模型相遇:通过隐秘后门规避扩散语义水印

Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出GhostVAE方法,通过在VAE编码器植入隐秘后门,可在良性图像上保持94.4%的平均水印真阳性率,同时实现94.6%的平均水印规避成功率,突破了现有语义水印的安全性。

Comments To appear in USENIX Security 2026, August 12-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00486 2026-08-04 cs.CV 新提交 79%

DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

DreamTraj:通过读取未渲染视频扩散隐变量生成6自由度物体轨迹

Tongsheng Ding, Zhen Luo, Yixuan Yang, Boyu Wang, Luyang Xie, Jinyu Yang, Feng Zheng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamTraj利用含细粒度指令的MOVE数据集,从单张RGB图像和任务指令读取冻结视频扩散模型中间表示,直接解码6自由度物体轨迹,性能优于传统方法且速度提升4.6倍。

Comments 17 pages, 8 figures, 11 tables. Project page: https://whathappen0.github.io/DreamTraj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25940 2026-08-04 eess.IV cs.CV 79%

How Accurate are Video Quality Models for Diffusion-Based Video Super-Resolution?

扩散模型视频超分辨率中的视频质量模型有多准确?

Benjamin Herb, Steve Göring, Alexander Raake, Rakesh Rao Ramachandra Rao

机构 * Institute for Communications Engineering, RWTH Aachen University, Germany(通讯工程研究所,亚琛工业大学,德国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究通过主观测试比较了六种扩散模型视频超分辨率方法,评估现有视频质量模型(尤其是全参考和无参考模型)在扩散VSR上的准确性,发现基于CNN的全参考模型相关性较高但均不足以替代主观测试。

Comments Accepted for the 18th International Conference on Quality of Multimedia Experience (QoMEX 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23179 2026-08-04 cs.CV 版本更新 79%

Gimbal360: Canonicalizing Planar Diffusion for Spherical Panorama Completion

Gimbal360: 可微自动水平校准用于标准化360度全景图像补全

Yuqin Lu, Haofeng Liu, Yang Zhou, Yihua Dai, Guiqing Li, Shengfeng He, Jun Liang

机构 * orange-3dv-team(orange-3dv团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Gimbal360通过引入标准化视角空间和可微自动水平校准模块,解决360度全景图像补全中的几何与拓扑不匹配问题,实现高精度补全。

Comments Project page: https://orange-3dv-team.github.io/Gimbal360

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06741 2026-08-04 cs.LG cs.AI cs.CV 版本更新 79%

Heterogeneous Decentralized Diffusion Models

异构去中心化扩散模型

Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

机构 * bagel.com(Bagel公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种异构去中心化训练框架,通过支持不同专家使用不同目标(DDPM和Flow Matching)并统一推理、预训练检查点转换以及高效架构,大幅降低计算和数据需求,使单GPU(24-48GB VRAM)即可参与训练。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07163 2026-08-04 cs.RO cs.CV 版本更新 79%

Mamba Policy: Towards Efficient 3D Diffusion Policy with Hybrid Selective State Models

Mamba Policy:基于混合选择性状态模型的高效3D扩散策略

Jiahang Cao, Qiang Zhang, Jingkai Sun, Jiaxu Wang, Hao Cheng, Yulin Li, Jun Ma, Kun Wu, Zhiyuan Xu, Yecheng Shao, Wen Zhao, Gang Han, Yijie Guo, Renjing Xu

机构 * Microelectronics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)微电子领域) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴交叉领域 division) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Center for X-Mechanics, Zhejiang University(浙江大学X力学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出Mamba Policy,以XMamba Block融合Mamba与注意力机制,参数量减超80%,在Adroit等数据集上性能优异且计算资源需求低,长 horizon 场景鲁棒性更强。

Comments Accepted to IROS 2025. Project Page: https://sagecao1125.github.io/mamba_policy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18164 2026-08-04 cs.CV 版本更新 79%

CDG-MAE: Cross-view Masked Modeling using Diffusion Generated Views

CDG-MAE:基于扩散生成视图的跨视图掩码建模

Varun Belagali, Pierre Marza, Srikar Yellapragada, Zilinghan Li, Tarak Nath Nandi, Ravi K Madduri, Joel Saltz, Stergios Christodoulidis, Maria Vakalopoulou, Dimitris Samaras

机构 * Stony Brook University(石溪大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎-萨克雷大学) Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学) Archimedes/Athena RC

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CDG-MAE是一种基于MAE的自监督方法,通过图像条件扩散模型生成多样化合成视图并采用多锚掩码策略,缩小了与基于视频的MAE方法的差距,同时保持仅图像MAE的数据优势。

Comments Accepted to TMLR 2026, Github link: https://github.com/cvlab-stonybrook/CDG-MAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29533 2026-08-03 cs.CV 新提交 79%

OSAGEN: Object-Aware Mask Priors and Multistage Decoupled Diffusion for Industrial Anomaly Generation

OSAGEN:面向工业异常生成的感知对象掩码先验与多阶段解耦扩散

Jinyi Xu, Peng Chen, Yunkang Cao, Chengliang Liu, Xinghui Dong, Chao Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OSAGEN结合感知对象掩码先验与多阶段解耦扩散,通过QBG、ISC及轻量物质化步骤生成工业异常,在MVTec AD和VisA上实现优异的异常定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29122 2026-08-03 cs.CV 新提交 79%

A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples

冻结的像素空间扩散模型可利用自身样本进行自引导

Zixuan Fu, Chong Wang, Lanqing Guo, Kailai Zhou, Jiahao Nie, Bihan Wen

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出合成自引导(SSG)策略,通过冻结预训练像素扩散模型主干、附加轻量预测头,利用模型自身样本训练头,以预测差异为自引导方向,大幅提升像素扩散模型生成效果且训练成本极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28936 2026-08-03 cs.CV cs.AI 新提交 79%

DiffAttack: Evasion Attacks Against Face Recognition via Latent Diffusion Models

DiffAttack:基于潜在扩散模型的人脸识别规避攻击

Omid Ahmadieh, Nima Karimian

机构 * University of South Florida(南佛罗里达大学) Bellini College of Artificial Intelligence, Cybersecurity and Computing(贝利尼人工智能、网络安全与计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对人脸识别系统易受对抗攻击的问题,提出DiffAttack框架,利用潜在扩散模型生成对抗人脸,在FFHQ、CelebA-HQ等基准上攻击成功率达84.86%,可迁移性优于现有方法。

Comments Accepted at IEEE International Joint Conference on Biometrics (IJCB) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17303 2026-08-03 cs.CV 版本更新 79%

EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance

EMAG: 无训练的自修正扩散采样与指数移动平均引导

Ankit Yadav, Ta Duc Huy, Lingqiao Liu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) The University of Adelaide(阿德莱德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EMAG通过无训练机制改进扩散模型的引导技术,生成更困难的负样本以提升生成质量和人类偏好分数。

Comments 63 pages (Accepted at ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20255 2026-08-03 cs.CV 版本更新 79%

AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models

AniCrafter:基于视频扩散模型中化身-背景条件的逼真以人为中心动画定制

Muyao Niu, Mingdeng Cao, Yifan Zhan, Qingtian Zhu, Weihang Ran, Yanhong Zeng, Xiao Sun, Zhihang Zhong, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出AniCrafter模型,通过在视频扩散模型中引入化身-背景条件机制,解决现有角色动画方法在开放域场景中效果受限的问题,其性能优于现有最先进方法,可生成通用且可感知遮挡的动画结果。

Comments Homepage: https://myniuuu.github.io/AniCrafter ; Codes: https://github.com/MyNiuuu/AniCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28611 2026-07-31 cs.CV 新提交 79%

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

Chimera:设计与遵循Chinchilla缩放规律的混合视觉扩散Transformer

Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen, Shaoteng Liu, Jing Shi, Yicong Hong, Zefan Cai, Hailin Jin, Hao Tan

机构 * Adobe Research(奥多比研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Chimera是一款混合视觉扩散骨干网络,结合KDA、MLA等模块与HeteroP缩放方案,训练出11B参数(2B激活)的模型,在计算效率、视频泛化等方面优于基线,为长上下文扩散架构设计提供基础。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28565 2026-07-31 cs.CV 新提交 79%

MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion

MIND:基于扩散Transformer的多模态意图驱动网络用于医学图像融合

Yunzhan Fu, Xiangyu Shen, Yifei Sun, Yuhan Chen, Jian Wu, Hongxia Xu

机构 * Transvascular Implantation Devices Research Institute, Zhejiang University(浙江大学血管内植入器械研究院) Zhejiang University(浙江大学) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对现有医学图像融合方法缺乏对诊断意图深度理解的问题,提出基于DiTs的MIND网络,通过BioMedGPT、多尺度潜在适配器和医学语义一致性损失优化,在多数据集上取得优异效果,可提升脑肿瘤分割精度并支持交互式融合。

Comments 14pages, 14 figures, accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28058 2026-07-31 cs.CV 新提交 79%

Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

基于回退误差的时间集中:文本到视频扩散的隐式偏好优化

Henglin Liu, Fangyuan Kong, Jing Wang, Yizhou Lin, Nisha Huang, Chang Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xiu Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Sun Yat-sen University(中山大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对文本到视频扩散模型的时间稀疏伪影问题,本文提出集中式隐式偏好优化(cIPO)框架,通过回退误差推导隐式偏好信号,将优化集中于高误差片段,有效提升了视频的真实性与时间连贯性。

Comments project page: https://henglin-liu.github.io/cIPO_vis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27842 2026-07-31 cs.CV cs.LG 新提交 79%

FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion Inference

FeatFix:通过局部精确特征校正重用已验证特征以实现更快的缓存扩散模型推理

Hanshuai Cui, Zhiqing Tang, Zhi Yao, Qianli Ma, Fanshuai Meng, Weijia Jia

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对扩散模型推理计算密集的问题,提出FeatFix方法,通过重用已验证的局部精确特征校正草稿,实现最高6.70倍的生成加速且保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27800 2026-07-31 cs.CV 新提交 79%

FDDWAN: A Frequency-Decoupled Diffusion Network for Watermarking Attack

FDDWAN:用于水印攻击的频率解耦扩散网络

Chunpeng Wang, Yuxin Li, Xiaoyu Wang, Jidong Yang, Suo Gao, Qi Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对现有水印去除方法的权衡缺陷,提出FDDWAN框架,经实验验证其在水印去除与视觉保真度间的表现优于传统及学习型攻击方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27537 2026-07-31 cs.CV 新提交 79%

ProgFormer: Hierarchical Voxel Diffusion Transformer for Longitudinal Brain MRI Prediction

ProgFormer:用于纵向脑部MRI预测的分层体素扩散Transformer

Dexuan Ding, Yuankai Qi, Luping Zhou, Jian Yang, Quan Z. Sheng, Ming-Hsuan Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProgFormer是一种分层体素扩散Transformer,通过粗-细通路结合条件流匹配,在ADNI等三个基准上实现了更优的纵向脑部MRI预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24731 2026-07-31 cs.CV cs.AI cs.LG 版本更新 79%

Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

重新思考策略性扩散蒸馏中的无分类器引导

Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴的通义千问业务部)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究策略性扩散蒸馏在无分类器引导下的表现,指出现有方法存在负分支不对称问题,引入正向匹配方法,通过分支感知分别约束正预测和条件方向,应用于视频控制实现更有效知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27075 2026-07-31 cs.CV 版本更新 79%

BeCARE: Budgeted Cache Refresh for Diffusion Transformer Acceleration

SoftCap: 扩散Transformer加速的软预算控制

Yuhang Zhang, Junxiang Qiu, Huixia Ben, Zhenhua Tang, Lin Liu, Shuo Wang, Yanbin Hao

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) Anhui University of Science and Technology(安徽理工大学) University of Macau(澳门大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种无需训练的软预算控制层SoftCap,通过轨迹漂移观测器和软预算PI控制器动态调整全步触发阈值,在保持计算预算软上限的同时提升图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18801 2026-07-31 cs.CV 版本更新 79%

PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion

PartDiffuser:通过离散扩散实现部件级3D网格生成

Yichen Yang, Hong Li, Haodong Zhu, Linin Yang, Guojun Lei, Sheng Xu, Baochang Zhang

机构 * Beihang University(北航) Communication University of China(中国通信大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PartDiffuser提出一种半自回归扩散框架,通过部件级方法生成高保真3D网格,有效平衡全局结构与局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11325 2026-07-31 cs.CV 版本更新 79%

ReDiff: Reliability-Guided Diffusion for Trustworthy Ultra-Low-Field to High-Field MRI Synthesis

迈向可信的选择性生成:用于超低场到高场MRI合成的可靠性引导扩散

Zhenxuan Zhang, Peiyuan Jing, Ruicheng Yuan, Liwei Hu, Anbang Wang, Fanwen Wang, Yinzhe Wu, Kh Tohidul Islam, Zhaolin Chen, Zi Wang, Peter Lally, Guang Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ReDiff框架,通过可靠性引导的采样策略和多候选选择方案,提升MRI合成的鲁棒性和解剖学一致性,减少伪影并提高结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26715 2026-07-30 cs.CV 新提交 79%

FreeShadow: Training-Free Shadow Removal via Illumination Transfer and Selective Content Preservation in Diffusion Models

FreeShadow:基于扩散模型的无需训练的光照迁移与选择性内容保留去阴影方法

Yinan Wang, Yan Huang, Yong Xu, Patrick Le Callet

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Pazhou Lab(琶洲实验室) Polytech Nantes, Université de Nantes(南特大学南特理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FreeShadow是基于预训练扩散模型的无需训练去阴影方法,通过光照迁移注意力等技术解决传统方法泛化差、易生伪影等问题,实验表明其泛化能力强且生成图像逼真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26706 2026-07-30 cs.CV 新提交 79%

TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models

TPD:用于文本到视频扩散模型的时间先验解耦

Taewon Kang, Matthias Zwicker

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对文本到视频扩散模型的时间先验抑制问题,提出无需训练的TPD框架,通过帧选择性下界约束恢复被抑制的后期片段信号,提升后期概念实现效果且与骨干无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26292 2026-07-30 cs.CV 新提交 79%

Eddeep: a deep-learning framework for fast eddy-current distortion correction in diffusion MRI

Eddeep:用于扩散MRI中快速涡流畸变校正的深度学习框架

Antoine Legouhy, Ross Callaghan, Yuchuan Qiao, Whitney Stee, Philippe Peigneux, Hojjat Azadbakht, Hui Zhang

机构 * Hawkes Institute(霍克斯研究所) University College London(伦敦大学学院) Institut Pasteur(巴斯德研究所) Université Paris Cité(巴黎西岱大学) AINOSTICS ltd.(AINOSTICS有限公司) Fudan University(复旦大学) Université Libre de Bruxelles (ULB)(布鲁塞尔自由大学) University of Liège (ULiège)(列日大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对dMRI中涡流畸变校正方法计算成本高的问题,提出深度学习框架Eddeep,其通过两阶段网络实现与FSL Eddy相当的校正质量,同时大幅缩短推理时间,为大规模研究和临床部署提供支持。

Comments Associated GitHub repo: https://github.com/CIG-UCL/eddeep

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26203 2026-07-30 cs.CV 新提交 79%

WildShadowRemover: In-the-Wild Video Shadow Removal via Detail-Preserving Video Diffusion Models

WildShadowRemover:基于细节保留视频扩散模型的野外视频阴影去除方法

Jiamin Xu, Cong Wang, Zheng Dong, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对野外视频阴影去除难题,提出WildShadowRemover框架,通过LoRA微调适配视频扩散模型,结合细节注入、频率分解调制及Depth Anything 3深度先验,构建对应数据集,在阴影去除质量与时间一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25503 2026-07-29 cs.CV 新提交 79%

Group Equivariant Diffusion for Anomaly Detection in Computational Cytology

用于计算细胞学异常检测的群等变扩散

Swarnadip Chatterjee, Ssharvien Kumar Sivakumar, Anirban Mukhopadhyay

机构 * Uppsala University(乌普萨拉大学) Technical University of Darmstadt(达姆施塔特工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 计算细胞学中恶性细胞检测难,现有方法有局限。本文提出D4等变扩散框架,通过结构和推理时的对称强制,实现变换一致的重建与稳定异常排名,在两个细胞学数据集上表现优于其他方法,降低分数方差。

Comments 11 pages, 2 figures, 1 table, 1 algorithm. Accepted for publication in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25092 2026-07-29 cs.CV 新提交 79%

MorphUNet: Alpha-Controlled Biometric Transport for Diffusion-Based Face Morphing Attacks

MorphUNet:基于扩散的人脸变形攻击的α控制生物特征传输

Taimoor Rizwan, Sara Atito, Zhenhua Feng, Muhammad Awais, Josef Kittler

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对人脸变形攻击威胁,提出MorphUNet框架,将双亲生成设为α控制生物特征传输,用可训练双亲分离双交叉注意力,经实验评估其在多个指标上表现出色,在变形攻击潜力等方面优于基线,且难被检测。

Comments 37 pages, 23 figures, 8 tables. Includes supplementary material (additional robustness analysis, CFD stress tests, and conditioning ablations) appended after the references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13656 2026-07-29 cs.CV 版本更新 79%

FreeLit: Paired-Free Indoor Relighting via Physics-Guided Diffusion

FreeLit:通过物理引导扩散实现无配对室内重光照

Chi-En Yen, Duy-Khanh Ngo, Wen-Wei Tang, Huu-Phu Do, Wen-Hsiao Peng, Ching-Chun Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对室内场景重光照难题,提出FreeLit无配对框架,利用物理引导光照先验及重光照引导的固有稳定策略,结合面向可控性的评估指标,实现稳定、物理一致且可控的重光照,提升低光照场景下的鲁棒性,无需配对监督。

Comments Updated to the ACM Multimedia 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24124 2026-07-28 cs.CV 新提交 79%

ViDS: Video Diffusion Shader using 3D Face Tracking

ViDS:使用3D面部跟踪的视频扩散着色器

Wenbo Ji, Davide Davoli, Zhe Chen, Liam Schoneveld, Matthias Nießner, Jiapeng Tang

机构 * Technical University of Munich(慕尼黑工业大学) Toyota Motor Europe NV/SA(丰田汽车欧洲股份公司) Woven by Toyota(丰田编织)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究利用3D面部跟踪实现肖像动画,先重建3DMM网格,再用驱动视频参数动画处理,借助视频扩散模型合成动画,引入自回归扩散采样过程,相比之前方法能更精细控制表情姿势,且保留身份外观,消融研究验证了有效性。

Comments 12 pages, 6 figures, and 8 tables. Project page: https://fusheng-ji.github.io/ViDS/

详情

展开后加载摘要…

URL PDF HTML 收藏