arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2607.24731 2026-07-31 cs.CV cs.AI cs.LG 版本更新 79%

Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

重新思考策略性扩散蒸馏中的无分类器引导

Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴的通义千问业务部)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究策略性扩散蒸馏在无分类器引导下的表现,指出现有方法存在负分支不对称问题,引入正向匹配方法,通过分支感知分别约束正预测和条件方向,应用于视频控制实现更有效知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27075 2026-07-31 cs.CV 版本更新 79%

BeCARE: Budgeted Cache Refresh for Diffusion Transformer Acceleration

SoftCap: 扩散Transformer加速的软预算控制

Yuhang Zhang, Junxiang Qiu, Huixia Ben, Zhenhua Tang, Lin Liu, Shuo Wang, Yanbin Hao

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) Anhui University of Science and Technology(安徽理工大学) University of Macau(澳门大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种无需训练的软预算控制层SoftCap,通过轨迹漂移观测器和软预算PI控制器动态调整全步触发阈值,在保持计算预算软上限的同时提升图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18801 2026-07-31 cs.CV 版本更新 79%

PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion

PartDiffuser:通过离散扩散实现部件级3D网格生成

Yichen Yang, Hong Li, Haodong Zhu, Linin Yang, Guojun Lei, Sheng Xu, Baochang Zhang

机构 * Beihang University(北航) Communication University of China(中国通信大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PartDiffuser提出一种半自回归扩散框架,通过部件级方法生成高保真3D网格,有效平衡全局结构与局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11325 2026-07-31 cs.CV 版本更新 79%

ReDiff: Reliability-Guided Diffusion for Trustworthy Ultra-Low-Field to High-Field MRI Synthesis

迈向可信的选择性生成:用于超低场到高场MRI合成的可靠性引导扩散

Zhenxuan Zhang, Peiyuan Jing, Ruicheng Yuan, Liwei Hu, Anbang Wang, Fanwen Wang, Yinzhe Wu, Kh Tohidul Islam, Zhaolin Chen, Zi Wang, Peter Lally, Guang Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ReDiff框架,通过可靠性引导的采样策略和多候选选择方案,提升MRI合成的鲁棒性和解剖学一致性,减少伪影并提高结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26715 2026-07-30 cs.CV 新提交 79%

FreeShadow: Training-Free Shadow Removal via Illumination Transfer and Selective Content Preservation in Diffusion Models

FreeShadow:基于扩散模型的无需训练的光照迁移与选择性内容保留去阴影方法

Yinan Wang, Yan Huang, Yong Xu, Patrick Le Callet

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Pazhou Lab(琶洲实验室) Polytech Nantes, Université de Nantes(南特大学南特理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FreeShadow是基于预训练扩散模型的无需训练去阴影方法,通过光照迁移注意力等技术解决传统方法泛化差、易生伪影等问题,实验表明其泛化能力强且生成图像逼真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26706 2026-07-30 cs.CV 新提交 79%

TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models

TPD:用于文本到视频扩散模型的时间先验解耦

Taewon Kang, Matthias Zwicker

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对文本到视频扩散模型的时间先验抑制问题,提出无需训练的TPD框架,通过帧选择性下界约束恢复被抑制的后期片段信号,提升后期概念实现效果且与骨干无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26292 2026-07-30 cs.CV 新提交 79%

Eddeep: a deep-learning framework for fast eddy-current distortion correction in diffusion MRI

Eddeep:用于扩散MRI中快速涡流畸变校正的深度学习框架

Antoine Legouhy, Ross Callaghan, Yuchuan Qiao, Whitney Stee, Philippe Peigneux, Hojjat Azadbakht, Hui Zhang

机构 * Hawkes Institute(霍克斯研究所) University College London(伦敦大学学院) Institut Pasteur(巴斯德研究所) Université Paris Cité(巴黎西岱大学) AINOSTICS ltd.(AINOSTICS有限公司) Fudan University(复旦大学) Université Libre de Bruxelles (ULB)(布鲁塞尔自由大学) University of Liège (ULiège)(列日大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对dMRI中涡流畸变校正方法计算成本高的问题,提出深度学习框架Eddeep,其通过两阶段网络实现与FSL Eddy相当的校正质量,同时大幅缩短推理时间,为大规模研究和临床部署提供支持。

Comments Associated GitHub repo: https://github.com/CIG-UCL/eddeep

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25503 2026-07-29 cs.CV 新提交 79%

Group Equivariant Diffusion for Anomaly Detection in Computational Cytology

用于计算细胞学异常检测的群等变扩散

Swarnadip Chatterjee, Ssharvien Kumar Sivakumar, Anirban Mukhopadhyay

机构 * Uppsala University(乌普萨拉大学) Technical University of Darmstadt(达姆施塔特工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 计算细胞学中恶性细胞检测难,现有方法有局限。本文提出D4等变扩散框架,通过结构和推理时的对称强制,实现变换一致的重建与稳定异常排名,在两个细胞学数据集上表现优于其他方法,降低分数方差。

Comments 11 pages, 2 figures, 1 table, 1 algorithm. Accepted for publication in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25092 2026-07-29 cs.CV 新提交 79%

MorphUNet: Alpha-Controlled Biometric Transport for Diffusion-Based Face Morphing Attacks

MorphUNet:基于扩散的人脸变形攻击的α控制生物特征传输

Taimoor Rizwan, Sara Atito, Zhenhua Feng, Muhammad Awais, Josef Kittler

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对人脸变形攻击威胁,提出MorphUNet框架,将双亲生成设为α控制生物特征传输,用可训练双亲分离双交叉注意力,经实验评估其在多个指标上表现出色,在变形攻击潜力等方面优于基线,且难被检测。

Comments 37 pages, 23 figures, 8 tables. Includes supplementary material (additional robustness analysis, CFD stress tests, and conditioning ablations) appended after the references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13656 2026-07-29 cs.CV 版本更新 79%

FreeLit: Paired-Free Indoor Relighting via Physics-Guided Diffusion

FreeLit:通过物理引导扩散实现无配对室内重光照

Chi-En Yen, Duy-Khanh Ngo, Wen-Wei Tang, Huu-Phu Do, Wen-Hsiao Peng, Ching-Chun Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对室内场景重光照难题,提出FreeLit无配对框架,利用物理引导光照先验及重光照引导的固有稳定策略,结合面向可控性的评估指标,实现稳定、物理一致且可控的重光照,提升低光照场景下的鲁棒性,无需配对监督。

Comments Updated to the ACM Multimedia 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24124 2026-07-28 cs.CV 新提交 79%

ViDS: Video Diffusion Shader using 3D Face Tracking

ViDS:使用3D面部跟踪的视频扩散着色器

Wenbo Ji, Davide Davoli, Zhe Chen, Liam Schoneveld, Matthias Nießner, Jiapeng Tang

机构 * Technical University of Munich(慕尼黑工业大学) Toyota Motor Europe NV/SA(丰田汽车欧洲股份公司) Woven by Toyota(丰田编织)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究利用3D面部跟踪实现肖像动画,先重建3DMM网格,再用驱动视频参数动画处理,借助视频扩散模型合成动画,引入自回归扩散采样过程,相比之前方法能更精细控制表情姿势,且保留身份外观,消融研究验证了有效性。

Comments 12 pages, 6 figures, and 8 tables. Project page: https://fusheng-ji.github.io/ViDS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23844 2026-07-28 cs.CV 新提交 79%

OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models

OmniCache:用于扩散模型的多维分层特征缓存

Zhaoyuan He, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对高分辨率图像和视频扩散模型推理成本高的问题,提出OmniCache框架,利用中间扩散特征冗余,通过多种缓存实现多维特征重用,减少推理延迟,在多模型上取得良好效果,且无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23680 2026-07-28 cs.CV 新提交 79%

Perturbation-Aware Diffusion-Guided Hybrid Segmentation for Robust and Annotation-Efficient Plant Stress Phenotyping

用于稳健且标注高效的植物胁迫表型分析的扰动感知扩散引导混合分割

Gurbhit Chaurakoti, Soumyashree Kar

机构 * National Institute of Technology Delhi(德里国家技术学院) Indian Institute of Technology Bombay(孟买印度理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对农业图像语义分割实际部署问题,提出扩散引导混合分割框架,通过多种实验评估,结果显示最佳模型标注效率高,适应后模型可转移,表明合理配对主干和细化器并结合扰动感知再训练可提升分割效果和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22719 2026-07-28 cs.CV 新提交 79%

$γ$-Bridge: A Look-Parametric Diffusion Bridge

γ-桥:一种外观参数化扩散桥

Xuran Hu, Yujie Zhu, Tengxi Wang, Jilong Li, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Macquarie University(麦考瑞大学) Ningxia University(宁夏大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对乘法伽马噪声在相干成像中的问题,提出γ-桥这一外观参数化扩散桥,通过特定调度连接噪声观测与干净极限,结合均匀补丁外观估计器,能处理多传感器数据,实现零样本恢复且结果领先,还提供可物理解释的控制。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22696 2026-07-28 cs.CV cs.AI 新提交 79%

MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion

MegaSlide-DiT:用于高效视频扩散的以内存为中心的自适应和可变形局部注意力

Jiacheng Liu, Jason Liu

机构 * Trendinsight Lab / UC San Diego(趋势洞察实验室/加州大学圣地亚哥分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对高分辨率视频扩散模型内存消耗大问题,提出MegaSlide-DiT,通过让GPU不持有模型状态及用3D-DSA取代全局注意力,降低内存和计算复杂度,实现105B DiT在单H200 GPU上的适配,为大规模视频扩散模型全参数适配提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22544 2026-07-28 cs.AI cs.CV 新提交 79%

Concept-based Visual Counterfactual Explanations with Diffusion Models

基于扩散模型的基于概念的视觉反事实解释

Yassine Oueslati, Daniil Kirilenko, Martin Gjoreski, Marc Langheinrich

机构 * Università della Svizzera italiana(瑞士意大利语区大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究视觉反事实解释问题,提出C-VCE框架,通过概念瓶颈层将分类器融入生成模型,由概念引导反事实解释,在采样时可切换概念,添加正则化器和掩码控制编辑,在基准测试中表现良好,是实用工具且为模型理解和使用提供新思路。

Comments Accepted at the 4th World Conference on eXplainable Artificial Intelligence (XAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06173 2026-07-28 cs.CV 版本更新 79%

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

MobileWan:弥合移动视频扩散的质量差距

Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibian

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究旨在弥合移动视频扩散质量差距,提出将5B参数视频扩散Transformer通过循环重公式化等方法高效部署在移动硬件上,经多种优化,成为首个可商用移动设备部署的该规模模型,取得新的端到端延迟和分数,建立移动视频生成新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21600 2026-07-28 cs.CV 79%

Locally Controlled Face Aging with Latent Diffusion Models

局部控制的面部老化与潜在扩散模型

Lais Isabelle Alves dos Santos, Julien Despois, Thibaut Chauffier, Sileye O. Ba, Giovanni Palma

机构 * L’Oréal AI Research(欧莱雅人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用潜在扩散模型实现局部控制的面部老化,通过细粒度控制提升生成结果的真实性和可控性。

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), 2025, pp. 6991-6999

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22386 2026-07-27 cs.CV cs.CR 新提交 79%

Correlation-Aware and Gaussianity-Preserving Robust Latent Angular Watermarking for Diffusion Models

用于扩散模型的相关感知和高斯性保持的鲁棒潜在角水印

Yebin Zheng, Haonan An, Guang Hua, Zhiping Lin, Yuguang Fang

机构 * Singapore Institute of Technology(新加坡理工学院) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型潜在域水印问题,提出潜在角水印(LAW)及变体LAW-M,通过对映角编码保持高斯性,解决现有方法易受攻击及相关性退化问题,理论上严格表征相关性退化并推导自相关结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22231 2026-07-27 cs.CV cs.AI 新提交 79%

TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution

TRaM-VSR:用于一步扩散视频超分辨率的重要性感知令牌路由与合并

Sicheng Gao, Zhuyun Zhou, Yixuan Liu, Tong Shen, Zongwei Wu, Radu Timofte

机构 * Advanced Micro Devices Inc.(超威半导体公司) Computer Vision Lab, CAIDAS & IFI, University of Würzburg(维尔茨堡大学CAIDAS与IFI计算机视觉实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对视频超分辨率中扩散模型计算成本高及现有方法存在问题,提出TRaM-VSR框架,通过融合线索估计令牌重要性,经离线规划器校准调整,在路由组内分处理关键与非关键令牌,实现加速推理且保持质量和一致性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22091 2026-07-27 cs.CV 新提交 79%

Spectral Prior for Reducing Exposure Bias in Diffusion Models

用于减少扩散模型中曝光偏差的频谱先验

Yuya Kobayashi, Masato Ishii, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散模型曝光偏差问题,提出频谱对齐(SPA)方法,通过离线拟合参数频谱模型及推理时基于快速傅里叶变换的梯度计算引导,减少计算开销且与CFG互补,在多种架构上实现一致改进。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13826 2026-07-27 eess.IV cs.CV 版本更新 79%

Latent Interpolation Learning Using Diffusion Models for Cardiac Volume Reconstruction

使用扩散模型进行心脏容积重建的潜在插值学习

Niklas Bubeck, Suprosanna Shit, Chen Chen, Can Zhao, Pengfei Guo, Dong Yang, Georg Zitzlsberger, Daguang Xu, Bernhard Kainz, Daniel Rueckert, Jiazhen Pan

机构 * School of Computation, Information and Technology, Technical University Munich(技术大学慕尼黑计算信息学院) Munich Center for Machine Learning(慕尼黑机器学习中心) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(牛津大学生物医学工程研究所) Imperial College London(伦敦帝国学院) University of Sheffield(谢菲尔德大学) NVIDIA(英伟达) Department of Computing, Imperial College London(伦敦帝国学院计算机系) Department AIBE of Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡大学AIBE系) School of Medicine, Klinikum Rechts der Isar, Technical University of Munich(慕尼黑技术大学医学院,莱纳特医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对心脏磁共振成像二维切片采集稀疏致容积信息不完整、现有重建方法有局限的问题,提出CaLID框架,创新采用基于扩散模型的插值方案、潜在空间高效计算法,仅用稀疏二维图像输入达SOTA,扩展到二维加时间数据,提升了重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20302 2026-07-27 cs.CV 版本更新 79%

TDiR: Transformer based Diffusion for Image Restoration Tasks

TDiR:基于Transformer的扩散用于图像恢复任务

Abbas Anwar, Ibrahim Radwan, Ali Arshad Nasir, Mudassir Masood, Saeed Anwar

机构 * Department of Computer Vision(计算机视觉系) FutureDataMinds Electrical Engineering Dept(电气工程系) King Fahd University of Petroleum and Minerals(国王法赫德石油和矿产大学) Department of Computer Science and Software Engineering(计算机科学与软件工程系) University of Western Australia(西澳大学) School of Computing(计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对图像在复杂环境下的退化问题,开发基于Transformer的扩散模型用于图像恢复。该模型在水下增强、去噪、去雨三项任务中经五个基准测试,并与18种先进技术对比,结果显示其性能优越,有效提升了退化图像质量,拓宽了相关下游任务应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21594 2026-07-24 cs.CV 新提交 79%

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

具有世界状态寄存器的流式多智能体自回归扩散模型

Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究多智能体交互世界模型共享状态维护难题,提出WorldWeaver模型,利用跨智能体世界状态寄存器及混合变压器设计,经双智能体我的世界视频生成实验验证,该模型能提升逻辑一致性与生成质量。

Comments Project page: https://vail-ucla.github.io/worldweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21545 2026-07-24 cs.CV 新提交 79%

Towards Robust Iris Recognition Through Occlusion Identification and Conditional Diffusion-Based Reconstruction

通过遮挡识别和基于条件扩散的重建实现鲁棒虹膜识别

Kamrul Hasan, Mylene C. Q. Farias, Oleg V. Komogortsev

机构 * Texas State University(德克萨斯州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对虹膜纹理被遮挡时识别性能下降的问题,提出含遮挡类型识别、基于扩散重建及深度学习识别三个模块的框架,通过确定遮挡类别、重建受损区域并提取特征,提升了在CASIA-Iris-Thousand数据集上的虹膜识别性能。

Comments Accepted by IEEE International Joint Conference on Biometrics (IJCB) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21504 2026-07-24 cs.CV 新提交 79%

Texture++: Elevating 3D Asset Texture Resolution with a Region-Aware Diffusion Model

Texture++:使用区域感知扩散模型提升3D资产纹理分辨率

Shuaiwei Wang, Shi Li, Jieting Xu, Yuchi Huo, Qi Wang, Wenting Zheng, Rengan Xie

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) North China Electric Power University(华北电力大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对3D资产纹理分辨率低问题,提出Texture++框架,通过在UV空间重新表述超分辨率任务,采用自适应视图选择、四叉树纹理区域组织及基于扩散的超分辨率模型,提升纹理分辨率,相比现有方法显著改进了纹理细节与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21239 2026-07-24 cs.CV 新提交 79%

Stokes-Informed Diffusion for Robust Linear Polarization Estimation

用于稳健线性偏振估计的斯托克斯信息扩散

Yidong Luo, Chenggong Li, Yuchao Feng, Boxin Shi, Junchao Zhang, Xin Yuan

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工学院) School of Automation, Central South University(中南大学自动化学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究从单张RGB图像估计线性偏振问题,提出基于穆勒形式主义的GenPolar框架,通过预测斯托克斯分量并结合可观测性感知损失监督偏振角,采用两阶段训练策略,在多数据集实验中性能达先进水平,提升下游应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21174 2026-07-24 cs.CV 新提交 79%

Decoupling Cross-Modality Manifold Discrepancy: Leveraging Visible Diffusion Priors for Infrared Super-Resolution

解耦跨模态流形差异:利用可见光扩散先验实现红外超分辨率

Yunpeng Hua, Hongwei Yu, Jiawei Li, Qiankun Liu, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对红外图像超分辨率问题,提出双路径基于扩散的Shift-IISR框架,通过开发GRM模块提取特定模态信息、引入LSR模块关注结构信息,有效提高了分布和结构一致性,保持了超分辨率性能。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026). Code: https://github.com/Assassink8/Shift-IISR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20545 2026-07-24 cs.AI cs.CV cs.SE 新提交 79%

StrideDiffusion: Accelerating Diffusion Models for Time-series Generation

StrideDiffusion:加速用于时间序列生成的扩散模型

Du Yin, Estrid He, Julián Jerónimo Bañuelos, Yang Yang, Feng Hu, Yuchen Luo, Hao Xue, Stephan Sigg, Flora Salim

机构 * UNSW(新南威尔士大学) RMIT(皇家墨尔本理工大学) Aalto University(阿尔托大学) HKUST(GZ)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散模型推理时去噪步骤多限制实际应用的问题,提出StrideDiffusion采样器,依据频带活动自适应选步长,经实验验证该方法能大幅加速时间序列生成,保持或提升质量,为快速采样提供实用信号。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11658 2026-07-24 cs.CV 版本更新 79%

EmoSpace: Immersive Affective Image Generation Guided by Fine-Grained Emotion Prototypes

EmoSpace: 细粒度情绪原型学习用于沉浸式情感内容生成

Bingyuan Wang, Xingbei Chen, Zongyang Qiu, Lin-Ping Yuan, Zeyu Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 EmoSpace通过视觉-语言对齐学习动态情绪原型,实现沉浸式情感内容生成的细粒度控制与多样化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏