arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2512.01242 2026-05-14 cs.CV cs.AI cs.CL 79%

When Diffusion Breaks Constraints: Sequential Autoregressive Generation with RL and MCTS

当扩散模型失效约束:通过强化学习和MCTS的序列自回归生成

Zirui Zhao, Boye Niu, Harold Soh, David Hsu, Wee Sun Lee

机构 * Salesforce AI Research(Salesforce人工智能研究) University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散模型在约束生成任务中的失效模式,通过拼图生成和简化矩形组合任务,发现扩散模型难以满足约束,提出基于自回归序列生成的约束意识生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12587 2026-05-14 cs.CV 79%

TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking

TrackCraft3R:将视频扩散变换器重新用于密集3D跟踪

Jisu Nam, Jahyeok Koo, Soowon Son, Jaewoo Jung, Honggyu An, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Google DeepMind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TrackCraft3R,通过重新利用预训练的视频扩散变换器,实现了基于单目视频的密集3D跟踪,采用双潜表示和时间RoPE对齐设计,提升了跟踪性能和效率。

Comments Project page and code are available at https://cvlab-kaist.github.io/TrackCraft3r/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12480 2026-05-13 cs.CV cs.AI 79%

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

OmniNFT: 多模态联合音频视频生成的模态感知强化学习

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OmniNFT,通过模态感知强化学习框架解决多模态联合生成中的模态一致性、梯度不平衡和信用分配问题,提升音频视频感知质量与同步性能。

Comments Project page: https://zghhui.github.io/OmniNFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12431 2026-05-13 cs.CV 79%

GaitProtector: Impersonation-Driven Gait De-Identification via Training-Free Diffusion Latent Optimization

GaitProtector: 通过无训练扩散潜在优化实现基于伪装的步态去标识

Huiran Duan, Qian Zhou, Zhongliang Guo, Junhao Dong, Yuqi Li, Guoying Zhao, Yingli Tian

机构 * City University of New York(纽约城市大学) Wuhan University(武汉大学) University of Aberdeen(阿伯丁大学) Nanyang Technological University(南洋理工大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Oulu(奥卢大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GaitProtector框架,通过无训练扩散潜在优化实现基于伪装的步态去标识,通过伪装和伪装两个紧密耦合组件,在保持主导身体形状和运动动态的同时减少识别准确率。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12399 2026-05-13 cs.CV 79%

GeoQuery: Geometry-Query Diffusion for Sparse-View Reconstruction

GeoQuery: 用于稀疏视角重建的几何-查询扩散

Xiao Cao, Yuze Li, Youmin Zhang, Jiayu Song, Cheng Yan, Wen Li, Lixin Duan

机构 * University of Electronic Science Tianjin University Tianjin China Tianjin University

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GeoQuery,通过几何引导的扩散框架,在稀疏视角重建中有效减少渲染伪影。

Comments Accept to SIGGRAPH 2026 Conference Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12169 2026-05-13 cs.CV 79%

UniFixer: A Universal Reference-Guided Fixer for Diffusion-Based View Synthesis

UniFixer:一种通用参考引导的扩散基视图合成修复器

Sihan Chen, Xiang Zhang, Yang Zhang, Tunc Aydin, Christopher Schroers

机构 * ETH Zürich(苏黎世联邦理工学院) DisneyResearch|Studios(迪士尼研究实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UniFixer,通过粗到细策略修复扩散基视图合成中的多种退化问题,包括空间、时间及模型相关的退化,通过参考预对齐、全局结构锚定和局部细节注入模块实现高质量视图合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11898 2026-05-13 cs.CV 79%

Few-Shot Synthetic Data Generation with Diffusion Models for Downstream Vision Tasks

少样本合成数据生成与扩散模型用于下游视觉任务

Daniil Dushenev, Nazariy Karpov, Daniil Zinovjev, Alexander Gorin, Konstantin Kulikov

机构 * National University of Science and Technology MISIS(俄罗斯莫斯科国立研究型技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种轻量级合成数据增强方法,通过微调LoRA适配器和预训练扩散模型生成合成样本,提升罕见类别的召回率和F1分数,适用于不同视觉领域。

Comments 5 pages, 3 figures, 1 table. Accepted at SynData4CV Workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10916 2026-05-13 cs.CV cs.AI 79%

Confidence-Guided Diffusion Augmentation for Enhanced Bangla Compound Character Recognition

基于置信度引导的扩散增强法提升孟加拉语复合字符识别

Md. Sultan Al Rayhan

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种置信度引导的扩散增强框架,通过结合分类引导和改进的U-Net结构,提升低分辨率孟加拉语复合字符识别性能,实验表明在AIBangla数据集上多个模型的分类准确率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18152 2026-05-13 cs.CV cs.AI 79%

UnfoldLDM: Degradation-Aware Unfolding with Iterative Latent Diffusion Priors for Blind Image Restoration

UnfoldLDM: 基于迭代潜在扩散先验的退化感知展开网络用于盲图像恢复

Chunming He, Rihan Zhang, Zheng Chen, Bowen Yang, Chengyu Fang, Yunlong Lin, Yulun Zhang, Fengyang Xiao, Sina Farsiu

机构 * Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tsinghua University(清华大学) Xiamen University(厦门大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UnfoldLDM,结合深度展开网络与潜在扩散模型,解决盲图像恢复中的退化依赖和过平滑偏差问题,通过多粒度退化感知模块和退化抗性LDM提取先验,提升恢复质量与视觉效果。

Comments 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11758 2026-05-13 eess.IV cs.CV 79%

DiffSegLung: Diffusion Radiomic Distillation for Unsupervised Lung Pathology Segmentation

DiffSegLung: 基于扩散的放射组学蒸馏用于无监督肺部病理分割

Rezkellah Noureddine Khiati, Pierre-Yves Brillet, Catalin Fetita

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffSegLung,通过引入扩散放射组学蒸馏方法,利用手工制作的放射组学描述符作为物理基础的教师,引导3D扩散U-Net的瓶颈层,提升无监督肺部病理分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11628 2026-05-13 cs.CV 79%

Single-Shot HDR Recovery via a Video Diffusion Prior

单次曝光HDR恢复通过视频扩散先验

Chinmay Talegaonkar, Jinshi He, Christopher McKenna, Nicholas Antipa

机构 * University of California San Diego(加州大学圣地亚哥分校) Creare LLC(Creare公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过视频扩散模型生成曝光序列并融合生成HDR图像,提升单次曝光HDR重建的保真度和可解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11435 2026-05-13 cs.CV 79%

ZeroIDIR: Zero-Reference Illumination Degradation Image Restoration with Perturbed Consistency Diffusion Models

ZeroIDIR:基于扰动一致扩散模型的零参考照明退化图像恢复

Hai Jiang, Zhen Liu, Yinjie Lei, Songchen Han, Bing Zeng, Shuaicheng Liu

机构 * School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) University of Electronic Science and Technology of China(电子科技大学) College of Electronics and Information Engineering, Sichuan University(四川大学电子信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ZeroIDIR框架,通过自适应伽马校正模块和扰动一致性扩散模型,实现零参考照明退化图像恢复,提升恢复精度与稳定性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11424 2026-05-13 cs.CV 79%

VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors

VidSplat:基于几何引导视频扩散先验的高斯点云重建

Jimin Tang, Wenyuan Zhang, Junsheng Zhou, Zian Huang, Kanle Shi, Shenkun Xu, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University(清华大学软件学院) Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VidSplat通过几何引导的视频扩散先验,解决稀疏视图下3D场景重建问题,提出免训练生成框架,迭代合成新视角以恢复完整3D场景。

Comments Accepted by SIGGRAPH Conference 2026. Project Page: https://tangjm24.github.io/VidSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02043 2026-05-13 cs.CV cs.HC cs.LG 79%

Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers

基于扩散模型的零样本人体姿态估计

Sahil Bhandary Karnoor, Romit Roy Choudhury

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出InPose方法,通过预训练扩散模型和旋转测量条件,解决人体姿态估计中用户体型差异导致的泛化问题。

Comments Published as a Conference Paper at The Fourteenth International Conference on Learning Representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10717 2026-05-12 cs.LG cs.CV 79%

Heteroscedastic Diffusion for Multi-Agent Trajectory Modeling

异方差扩散用于多智能体轨迹建模

Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息学院,CSIC-UPC)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出U2Diffine模型,通过异方差不确定性估计提升多智能体轨迹补全与预测性能,结合Taylor近似和RankNN实现高效推理与误差概率评估,优于现有方法。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Extended version of arXiv:2503.18589 (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07429 2026-05-12 cs.CV 79%

Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework

通过扩散框架实现逼真且高效的bokeh渲染

Linxiao Shi, Siming Zheng, Zerong Wang, Hao Zhang, Jinwei Chen, Bo Li, Shifeng Chen, Peng-Tao Jiang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo BlueImage实验室,vivo移动通信有限公司) Shenzhen University of Advanced Technology(深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MagicBokeh框架,通过替代训练策略和聚焦感知的掩码注意力机制,联合优化bokeh渲染与超分辨率,提升可控性和视觉保真度,并引入降质感知深度模块以提高低质量输入的深度估计准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03639 2026-05-12 cs.CV 79%

Diffusion Masked Pretraining for Dynamic Point Cloud

动态点云的扩散掩码预训练

Zhuoyue Zhang, Jihua Zhu, Chaowei Fang, Jian Liu, Ajmal Saeed Mian

机构 * Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) University of Western Australia(西澳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiMP框架,通过引入扩散建模解决动态点云预训练中位置泄露和运动监督问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03239 2026-05-12 cs.CV 79%

COP-GEN: Latent Diffusion Transformer for Copernicus Earth Observation Data

COP-GEN:用于Copernicus地球观测数据的潜在扩散变换器

Miguel Espinosa, Eva Gmelich Meijling, Valerio Marsocci, Elliot J. Crowley, Mikolaj Czerkawski

机构 * School of Engineering University of Edinburgh(工程学院爱丁堡大学) European Space Agency (ESA)(欧洲航天局) Asterisk Labs(Asterisk实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 COP-GEN通过建模异质地球观测模态的联合分布,实现了多模态潜在扩散变换器,支持灵活的任意到任意条件生成,包括无需重新训练的零样本模态翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07756 2026-05-12 cs.CV 79%

Determinism of Randomness: Prompt-Residual Seed Shaping for Diffusion Generation

随机性的确定性:提示残差种子塑形用于扩散生成

Song Yan, Wei Zhai, Chenfeng Wang, Xinliang Bi, Jian Yang, Yancheng Cai, Yusen Zhang, Yunwei Lan, Tao Zhang, GuanYe Xiong, Min Li, Zheng-Jun Zha

机构 * USTC(中国科学技术大学) Li Auto Inc.(利亚自动化公司) Xi’an High-tech Research Institute(西安高新技术研究院) Wechat Vision(微信视觉) Cambridge University(剑桥大学) HUST(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散生成中种子敏感性,提出无需训练的提示残差种子塑形方法,通过单个高噪声冷启动提示残差提升生成对齐和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10071 2026-05-12 cs.CV 79%

MFVLR: Multi-domain Fine-grained Vision-Language Reconstruction for Generalizable Diffusion Face Forgery Detection and Localization

MFVLR:多领域细粒度视觉-语言重建用于通用扩散面部伪造检测与定位

Yaning Zhang, Tianyi Wang, Zan Gao, Yibo Zhao, Chunjie Ma, Meng Wang

机构 * Faculty of Computer Science and Technology, Qilu University of Technology (Shandong Academy of Sciences)(计算机科学与技术学院,齐鲁工业大学(山东省科学院)) School of Computing, National University of Singapore(国立新加坡大学计算机学院) Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences)(山东省人工智能研究院,齐鲁工业大学(山东省科学院)) Key Laboratory of Computer Vision and System, Ministry of Education, Tianjin University of Technology(教育部计算机视觉与系统重点实验室,天津工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MFVLR模型,通过语言引导的面部伪造表示学习,实现通用的扩散合成面部伪造检测与定位,结合多领域视觉编码器和细粒度语言变压器提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09688 2026-05-12 cs.CV 79%

ConFixGS: Learning to Fix Feedforward 3D Gaussian Splatting with Confidence-Aware Diffusion Priors in Driving Scenes

ConFixGS:基于置信度感知扩散先验的学习以修复馈送式3D高斯点溅射在驾驶场景中

Rui Song, Tianhui Cai, Markus Gross, Xingcheng Zhou, Zewei Zhou, Zhiyu Huang, Olaf Wysocki, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Cambridge(剑桥大学) Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ConFixGS,通过置信度感知扩散先验学习修复馈送式3D高斯点溅射,提升稀疏视角驾驶场景中新型视角合成的鲁棒性,实验显示PSNR提升3.68dB,FID降低近一半。

Comments 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09681 2026-05-12 cs.CV 79%

Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models

Forcing-KV:用于高效自回归视频扩散模型的混合KV缓存压缩

Yicheng Ji, Zhizhou Zhong, Jun Zhang, Qin Yang, XiTai Jin, Ying Qin, Wenhan Luo, Shuiyang Mao, Wei Liu, Huan Li

机构 * ZJU(浙江大学) Video Rebirth(视频重生) HKUST(香港科技大学) BJTU(北京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Forcing-KV方法,通过混合KV缓存压缩技术,提升自回归视频扩散模型的生成速度和内存效率,实现高达2.82倍的速度提升。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09622 2026-05-12 cs.CV cs.AI 79%

Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study

任意到任意的3D扩散模型与知识转移:放射治疗计划研究

Yuhan Wang, Zihan Li, Han Liu, Simon Arberet, Martin Kraus, Yuyin Zhou, Florin-Cristian Ghesu, Dorin Comaniciu, Ali Kamen, Riqiang Gao

机构 * UC Santa Cruz(加州大学圣克ruz分校) Siemens Healthineers(西门子医疗) University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffKT3D,一种利用预训练视频扩散模型知识的统一Any2Any 3D扩散框架,通过模态特定嵌入实现多临床模态灵活条件化,结合临床导向的强化学习机制,提升放射治疗计划中的剂量预测精度与图像质量。

Comments Accepted by CVPR 2026 main conference. Compare to CVPR version, minor updates here are included (e.g., combine main text and appendix; clarify the timing scenario in appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09242 2026-05-12 eess.IV cs.CV 79%

Cross-Modal Semantic-Enhanced Diffusion Framework for Diabetic Retinopathy Grading

跨模态语义增强的扩散框架用于糖尿病视网膜病变分级

Yiqun Wang

机构 * School of Software Engineering Beijing Jiaotong University(软件工程学院 北京交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CLIP引导语义扩散框架,通过整合视觉-语言预训练与扩散概率建模,解决糖尿病视网膜病变分级中的细粒度病变模式区分、分布差异和临床语义知识利用问题。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07399 2026-05-12 cs.CV 79%

GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization

GPO-V:通过全局概率优化实现扩散视觉语言模型的突破

Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) University of Warwick(沃里克大学) SUN YAT-SEN UNIVERSITY(中山大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GPO-V,通过全局概率优化方法突破扩散视觉语言模型的安全防线,揭示了非顺序生成架构中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19222 2026-05-12 cs.CV cs.LG 79%

Spectrally-Guided Diffusion Noise Schedules

基于光谱引导的扩散噪声调度

Carlos Esteves, Ameesh Makadia

机构 * Google Research(谷歌研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于图像光谱特性设计实例特定噪声调度的方法,通过理论界限优化噪声级别,提升单阶段像素扩散模型生成质量,尤其在低步数情况下表现更佳。

Comments Accepted to ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04549 2026-05-12 cs.CV 79%

Nix and Fix: Targeting 1000x Compression of 3D Gaussian Splatting with Diffusion Models

Nix 和 Fix:通过扩散模型实现 3D 高斯散射的 1000 倍压缩

Cem Eteke, Enzo Tartaglione

机构 * 1 Chair of Media Technology, Munich Institute of Robotics Machine Intelligence School of Computation, Information Technology Technical University of Munich, 80333 Munich, Germany 2LTCI, T\'el\'ecom Paris, Institut Polytechnique de Paris, France

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出 NiFi 方法,通过扩散模型实现 3DGS 在极低速率下的高质量压缩,达到 1000 倍压缩率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06637 2026-05-12 cs.LG cs.AI cs.CV 79%

Control-Augmented Autoregressive Diffusion for Data Assimilation

增强控制的自回归扩散用于数据同化

Prakhar Srivastava, Farrin Marouf Sofian, Francesco Immorlano, Kushagra Pandey, Stephan Mandt

机构 * University of California, Irvine(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种增强控制的自回归扩散模型,通过引入预训练模型与离线训练控制器,提升数据同化中混沌时空偏微分方程的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08440 2026-05-12 cs.LG cs.CV 79%

TARO: Temporal Adversarial Rectification Optimization Using Diffusion Models as Purifiers

TARO:利用扩散模型作为净化器的时序对抗修正优化

Daniel Wesego, Pedram Rooshenas

机构 * Department of Computer Science(计算机科学系) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TARO通过构建时序引导的分数先验,结合多视角去噪,实现对抗样本的鲁棒修正与语义保留,提升零样本下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08252 2026-05-12 cs.CV 79%

Multimodal Emotion Recognition via Causal-Diffusion Bridge (Affect-Diff)

通过因果-扩散桥进行多模态情绪识别(Affect-Diff)

Ankit Sanjyal

机构 * Department of Computer Science -- Data Science(计算机科学系——数据科学部) Fordham University(福特汉姆大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对CMU-MOSEI数据集中情绪类别不平衡问题,Affect-Diff通过因果图、正则化潜在压缩和扩散先验机制提升识别性能,验证了其在平衡准确率和少数类敏感性上的优势。

Comments 10 Pages, 12 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏