arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-01 至 2026-01-01 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 图像修复 5 篇

2512.23986 2026-01-01 cs.CV physics.geo-ph 79%

Anomaly detection in satellite imagery through temporal inpainting

通过时间修复在卫星图像中进行异常检测

Bertrand Rouet-Leduc, Claudia Hulbert

机构 * Disaster Prevention Research Institute, Kyoto University(京都大学灾害预防研究所) Geolabe

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 本研究提出了一种基于时间修复的深度学习方法,通过卫星时间序列的冗余性检测地表变化,实现了更高的灵敏度和特异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01519 2026-01-01 cs.CV 79%

DiffIR2VR-Zero: Zero-Shot Video Restoration with Diffusion-based Image Restoration Models

DiffIR2VR-Zero: 无需额外训练的扩散图像修复模型用于视频修复

Chang-Han Yeh, Hau-Shiang Shiu, Chin-Yang Lin, Zhixiang Wang, Chi-Wei Hsiao, Ting-Hsuan Chen, Yu-Lun Liu

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffIR2VR-Zero通过层次化潜在扭曲和混合token合并机制,实现无需额外训练的视频修复,提升时间一致性与修复质量。

Comments Project page: https://jimmycv07.github.io/DiffIR2VR_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23983 2026-01-01 cs.CV 57%

DriveExplorer: Images-Only Decoupled 4D Reconstruction with Progressive Restoration for Driving View Extrapolation

DriveExplorer: 基于图像的解耦4D重建与渐进修复用于驾驶视角外推

Yuang Jia, Jinlong Wang, Jiayi Zhao, Chunlam Li, Shunzhou Wang, Wei Gao

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省级超高清沉浸媒体技术重点实验室) School of Electronic and Computer Engineering(电子与计算机工程学院) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 DriveExplorer通过图像解耦和渐进修复实现驾驶视角外推,利用4D高斯框架和扩散模型提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03913 2026-01-01 cs.SD eess.AS 50%

STSR: High-Fidelity Speech Super-Resolution via Spectral-Transient Context Modeling

STSR:通过频谱-瞬态上下文建模实现高质量语音超分辨率

Jiajun Yuan, Xiaochen Wang, Yuhang Xiao, Yulin Wu, Chenhao Hu, Xueyang Lv

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science(多媒体软件国家工程研究中心,计算机科学学院) School of Artificial Intelligence(人工智能学院)

专题命中 图像修复 :diffusion(abstract)

AI总结 STSR通过频谱-瞬态上下文建模实现高质量语音超分辨率,结合MDCT域的统一端到端框架,提升谐波一致性和瞬态锐利度,优于现有基线。

Comments 5 pages Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17609 2026-01-01 cs.SD cs.LG 50%

Audio Super-Resolution with Latent Bridge Models

基于潜在桥模型的音频超分辨率

Chang Li, Zehua Chen, Liyuan Wang, Jun Zhu

机构 * Department of CST, Tsinghua University, Beijing, China(计算机科学与技术系,清华大学,北京,中国) Shengshu AI, Beijing, China(盛舒人工智能,北京,中国) USTC, Hefei, China(中国科学技术大学,合肥,中国)

专题命中 图像修复 :diffusion(abstract)

AI总结 本文提出基于潜在桥模型的音频超分辨率方法,通过压缩音频到潜在空间并设计桥模型,实现高质量的任意到48kHz和192kHz音频上采样。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏