arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2607.20293 2026-07-23 cs.CV 新提交 79%

Evolving Cache Schedules for Fast Diffusion Policy Inference

用于快速扩散策略推理的演进缓存调度

Siying Wang, Kangye Ji, Di Wang, Fei Cheng

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学通信工程学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散策略实时部署计算需求大的问题,提出演进缓存调度(EVO)框架,通过进化搜索全局调度缓存刷新,引入冗余感知初始化和目标条件早期停止,大幅减少计算量并保留性能,实现动作生成加速和FLOPs降低。

Comments 15 pages, 3 figures, supplementary material included. Accepted by PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20048 2026-07-23 cs.CV 新提交 79%

Importance-Aware OBS Pruning for Diffusion Models

用于扩散模型的重要性感知OBS剪枝

Ba-Thinh Lam, Srijan Das, Hieu Le

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散模型提出重要性感知剪枝框架,通过纳入空间重要性映射到剪枝目标,在MS-COCO数据集上高压缩率下保持主题保真度和结构正确性,证明内容感知目标对生成模型感知忠实压缩很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19943 2026-07-23 cs.CV 新提交 79%

SIINR: Structurally Informed Implicit Neural Representations for super-resolution with uncertainty quantification of clinical quality diffusion MRI datasets

SIINR:用于临床质量扩散MRI数据集超分辨率及不确定性量化的结构信息隐式神经表示

Tom Hendriks, William Consagra, Anna Vilanova, Yogesh Rathi, Maxime Chamberland

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of South Carolina(南卡罗来纳大学) Brigham and Women’s Hospital, Harvard Medical School(布莱根妇女医院,哈佛医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对临床dMRI数据集平面外分辨率低的问题,提出SIINR框架,利用监督3D U-net和自监督INR结合,实现超分辨率及不确定性量化,在多数据集和临床病例实验中表现优异,为临床dMRI增强及指标解释提供方法。

Comments 27 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19886 2026-07-23 cs.CV 新提交 79%

MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation

MTVDiff:用于增强热红外到可见光面部翻译的多模态条件潜扩散

Zhiyuan Xia, Haojie Li, Jingyu Lin, Yiguo Qiao, Cunjian Chen

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(新一代人工智能技术及其交叉应用重点实验室(东南大学)) Monash University(莫纳什大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对热红外到可见光面部翻译的挑战,提出MTVDiff框架,通过双分支交叉注意力融合等三个核心技术,整合深度和文本信息,在多指标上优于现有方法,提升图像质量和面部验证性能,推动跨光谱面部图像翻译发展。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19701 2026-07-23 cs.CV 新提交 79%

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving

SafeGen:基于视觉语言模型的自动驾驶安全关键场景的目标条件视频扩散

Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Chery Automobile Co., Ltd.(奇瑞汽车股份有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对VLM在自动驾驶系统中的应用,提出SafeGen框架,将场景生成设为目标条件扩散过程,引入上下文接地最终状态推理和最终状态条件下的视频演化,实验表明该框架能提升评判得分,微调后可提高真实驾驶场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19522 2026-07-23 cs.LG cs.CV 新提交 79%

Geospatial Diffusion-based Evolution Synthesis (GeoDES) for Storm-Centered Weather Augmentation

基于地理空间扩散的风暴中心天气增强演化合成(GeoDES)

Sonia Cromp, Satya Sai Srinath Namburi GNVV, Youran Wang, Grace Kisslinger, Frederic Sala, James Booth, Allegra LeGrande

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对机器学习天气模型预测风暴结构难题,提出基于地理空间扩散的演化合成(GeoDES)模型,该模型能合成高保真天气事件,经评估在关键指标上优于先前方法,可用于测试预测模型和扩展气象数据集。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19459 2026-07-23 astro-ph.IM astro-ph.CO cs.CV stat.ML 新提交 79%

Strong Gravitational Lensing Posterior Sampling in Pixel-Space Using Diffusion Models and Recurrent Inference Machines

使用扩散模型和循环推理机在像素空间中进行强引力透镜后验采样

Guillaume Payeur, Laurence Perreault-Levasseur, Gabriel Missael Barco, Yashar Hezaveh

机构 * Department of Physics, Universit\'e de Montr\'eal, Montreal QC, Canada Mila - Quebec AI Institute, Montreal QC, Canada Ciela Institute, Institute for Astrophysics Trottier Space Institute, McGill University, Montreal QC, Canada Center for Computational Astrophysics, Flatiron Institute, New York, USA Perimeter Institute for Theoretical Physics, Waterloo ON, Canada

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究星系-星系强引力透镜问题,提出结合扩散生成建模与循环推理机的方法,能生成源星系和前景质量分布的联合后验样本作为像素化图像,可对含背景和前景星系的真实引力透镜模拟建模至噪声水平。

Comments 31 pages, 34 figures, Extension of an article accepted at the ICML 2026 Workshop on AI for Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17612 2026-07-23 cs.CV 版本更新 79%

Rarity-Aware Discrete Diffusion with Spatially Consistent Decoding for Photo-Realistic Image Super-Resolution

用于逼真图像超分辨率的稀有感知离散扩散与空间一致解码

Ao Li, Yapeng Du, Yi Xin, Lei Zhu, Le Zhang, Guangtao Zhai, Ce Zhu, Xiaohong Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对图像超分辨率,提出DiMOO-SR框架。训练时用逆频率采样处理稀有令牌,推理时用空间一致性排名提高结构连贯性。实验表明该框架仅需少量并行解码步骤就能实现有竞争力的感知质量,凸显离散扩散在图像超分辨率中的潜力。

Comments 5 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18539 2026-07-22 cs.CV 新提交 79%

AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation

AniGS:弥合3D场景动画的渲染与扩散先验

Yen-Chi Cheng, Chen Gao, Chuhan Chen, Tuotuo Li, Rajvi Shah, Ayush Saraf, Changil Kim, Liangyan Gui, Alexander Schwing, Johannes Kopf, Hung-Yu Tseng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Waymo(Waymo公司) Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 AniGS旨在为3DGS重建的大型场景添加动画,用规范3DGS表示场景,借时间条件变形场建模运动,利用预训练视频扩散模型及迭代更新策略,防止静态区域运动伪影,实验证明该方法能产生自然动态和高质量新视图视频。

Comments Preprint. Project page: https://yccyenchicheng.github.io/AniGS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17411 2026-07-21 cs.GR cs.LG 新提交 79%

Feature-Guided Diffusion for Non-Differentiable Inverse Rendering

用于不可微逆渲染的特征引导扩散

Andrei-Timotei Ardelean, Michael Fischer, Tim Weyrich, Tomáš Iser

机构 * Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 研究逆渲染问题,提出完全黑箱框架FIDE,通过特征引导,利用视觉Transformer提取特征训练扩散模型,结合CMA进化策略优化,在多种逆问题上验证,显著提升收敛速度并逃离局部最小值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16656 2026-07-21 cs.CV 新提交 79%

DORS: Dynamic Attention Routing for Diffusion-based Object Removal in Dense Scenes

DORS:用于密集场景中基于扩散的目标移除的动态注意力路由

Haitong Tang, Haipeng Liu, Yang Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对密集场景目标移除中因语义干扰致移除不完整的问题,提出基于动态注意力路由机制的DORS框架,含实例过滤注意力和上下文引导路由组件,经实验验证其性能优于现有方法。

Comments 16 pages, 10 figures, to appear in ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16300 2026-07-21 cs.CV 新提交 79%

FedDP-PALD: A Privacy-Preserving Federated Latent Diffusion Framework with Prototype Aggregation for Medical Data Synthesis

FedDP-PALD:一种用于医学数据合成的具有原型聚合的隐私保护联邦潜在扩散框架

Md. Sajeebul Islam Sk., Khan Enaet Hossain, Md. Mehedi Hasan Shawon

机构 * BRAC University(BRAC大学) York University(约克大学) University of Maryland(马里兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对医学数据合成中隐私保护及合成数据预测结构问题,提出FedDP-PALD框架,通过带掩码的门控多头注意力联合处理多模态数据,引入DP-PMA维持差分隐私,实验表明该框架能生成隐私合成表示,保持决策性能并抵抗成员推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13247 2026-07-21 cs.CV 版本更新 79%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15650 2026-07-20 cs.CV 新提交 79%

DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

DiTango:基于选择性注意力状态重用的经济高效并行扩散生成

Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) University of Science and Technology Beijing(北京科技大学) PJlab(PJ实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散变换器并行化技术在多节点环境下通信开销大的问题,提出DiTango框架,通过选择性注意力状态机制及锚点引导的状态选择规划器等,在多节点设置中实现加速并保持生成质量。

Journal ref The 35th International Symposium on High-Performance Parallel and Distributed Computing (HPDC'26), July 13--16, 2026, Cleveland, OH, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15585 2026-07-20 cs.MM 新提交 79%

SPEED: One-Step Pixel Diffusion for High-quality Video Frame Interpolation

SPEED:用于高质量视频帧插值的单步像素扩散

Zihao Zhang, Haoyu Zhao, Siqian Yang, Yidi Wu, Yudong Jiang, Zuxuan Wu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 研究针对视频帧插值中现有扩散模型的问题,提出SPEED单步像素扩散框架。采用渐进多阶段架构、仅噪声更新注意力机制和漂移感知时间步采样策略,实现高质量单步推理,在多个基准测试中性能超越现有方法。

Comments ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15527 2026-07-20 cs.CV 新提交 79%

Physics-aware Masked Diffusion-based Flood Simulation for Urban Fisheye Disaster Detection

基于物理感知的掩码扩散的洪水模拟用于城市鱼眼灾害检测

Sodtavilan Odonchimed, Tsogt Enkhbayar, Oyunzul Munkhtamga, Munkhjargal Gochoo

机构 * The University of Tokyo(东京大学) Mongolian University of Science and Technology(蒙古科技大学) United Arab Emirates University(阿联酋大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现实中洪水数据短缺及鱼眼图像失真致高精度洪水模拟难的问题,提出PhysFlood系统,利用扩散模型从单张鱼眼图像合成逼真洪水,可自由控制生成多样场景,实验证明其模拟图像有逼真度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05509 2026-07-20 cs.CV 版本更新 79%

Be Tangential to Manifold: Discovering Riemannian Metric for Diffusion Models

与流形相切:为扩散模型发现黎曼度量

Shinnosuke Saito, Takashi Matsubara

机构 * Hokkaido University(北海道大学) CyberAgent

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的黎曼度量,通过分数函数雅可比的谱结构区分流形切线与法线方向,从而在噪声空间中促进路径保持流形切线性,提升扩散模型的生成质量与文本-图像对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15128 2026-07-17 cs.CV 新提交 79%

DAPGNet: Dynamic Adaptive Physics-Guided Graph Diffusion Network for Hyperspectral Image Classification

DAPGNet:用于高光谱图像分类的动态自适应物理引导图扩散网络

Pengkun Wang, Weijia Cao, Ning Wang, Xiaofei Yang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) Guangzhou University(广州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对高光谱图像分类中像素关系建模问题,提出DAPGNet。该网络将物理先验融入图学习,经多步骤构建拓扑、进行图扩散等操作,通过跨尺度融合优化。实验表明其在多个数据集上性能最优,提升了分类准确率,验证了各模块的互补作用。

Comments 9 figures and 9 tables. Pengkun Wang and Weijia Cao contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15041 2026-07-17 cs.CV 新提交 79%

Weakly-Supervised RGB-D Salient Object Detection via SAM-driven Pseudo Annotation and State Space Interaction-based Diffusion

通过基于 SAM 的伪标注和基于状态空间交互的扩散进行弱监督 RGB-D 显著目标检测

Wenqi Si, Gongyang Li, Shixiang Shi, Weisi Lin

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究弱监督 RGB-D 显著目标检测,提出由 SAM-PAG 和 $S^2$Diff 组成的方法,前者扩展稀疏涂鸦为伪标注,后者在条件信息引导下细化显著图,二者合作使方法性能优异。

Comments 13 pages, 9 figures, accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14836 2026-07-17 cs.CV 新提交 79%

Physics-Informed Diffusion for Biomechanically Plausible 3D Sign Language Generation

用于生物力学合理的3D手语生成的物理信息扩散

Emanuele Colonna, Moises Diaz, Gennaro Vessio, Miguel Angel Ferrer, Giovanna Castellano

机构 * Department of Computer Science, University of Bari Aldo Moro(巴里阿尔多·莫罗大学计算机科学系) Institute for Technological Development and Innovation in Communications, University of Las Palmas de Gran Canaria(拉斯帕尔马斯大加那利大学通信技术发展与创新研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究手语生成问题,提出物理信息扩散模型PIDiffSign,将解剖学约束融入架构与训练目标,用Transformer编码器 - 解码器及可微几何模块训练,实验证明该模型能提升手语生成的运动真实感和语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09238 2026-07-17 cs.CV 版本更新 79%

Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method

知识嵌入与超网络引导的少样本变电站电表缺陷图像生成方法

Jackie Alex, Justin Petter

机构 * St. Petersburg College(斯波尔丁学院)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对变电站电表缺陷图像标注样本稀缺问题,提出将知识嵌入、超网络引导条件控制集成到稳定扩散管道的方法,能逼真可控合成缺陷图像,优于现有基线,提升下游检测器mAP等,为工业检测提供数据合成方案。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20153 2026-07-17 cs.CV 版本更新 79%

CoDi -- an exemplar-conditioned diffusion model for low-shot counting

CoDi——一种用于少样本计数的示例条件扩散模型

Grega Šuštar, Jer Pelhan, Alan Lukežič, Matej Kristan

机构 * Faculty of Computer and Information Science, University of Ljubljana(计算机与信息科学学院,卢布尔雅那大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究少样本目标计数问题,提出基于潜在扩散的CoDi模型,其核心是基于示例的条件模块,能生成高质量密度图。在FSC和MCAC基准测试中表现出色,分别在少样本等场景及整体上大幅超越现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10999 2026-07-17 cs.CV 版本更新 79%

Conditioning Residuals for Diffusion Models via Representation Feedback

通过表示反馈对扩散模型的残差进行条件设定

Weilai Xiang, Hongyu Yang, Di Huang, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型中能否利用固有路径路由内部推断语义,提出条件残差这一轻量级反馈机制,通过反馈紧凑特征摘要提供自适应指导,实验显示其提升了生成性能及下游任务表现,还揭示了训练动态和特征结构的改进。

Comments Substantially revised and retitled. Code available at https://github.com/FutureXiang/ddae_plus_plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16839 2026-07-17 cs.CV 版本更新 79%

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa:用于多模态理解的大型扩散语言模型

Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Adobe Research(Adobe研究) Salesforce Research(Salesforce研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13927 2026-07-16 cs.CV 新提交 79%

Cyclone: Diffusion Model for Cycle-Consistent Weather Editing from Unpaired Driving Data

Cyclone:基于未配对驱动数据的循环一致天气编辑扩散模型

Thang-Anh-Quan Nguyen, Moussab Bennehar, Luis Guillermo Roldao Jimenez, Nathan Piasco, Dzmitry Tsishkou, Laurent Caraffa, Jean-Philippe Tarel, Roland Brémond

机构 * Huawei Paris Research Center(华为巴黎研究中心) Gustave Eiffel University(古斯塔夫·埃菲尔大学) IGN-ENSG(法国国家地理信息与森林和环境信息研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对自动驾驶系统在不同天气条件下可靠感知的挑战,提出Cyclone框架,基于潜在扩散,利用循环一致约束和图像-文本模型知识,无需配对数据生成多种天气条件,实验表明其输出更优,还可提炼为视频扩散模型。

Comments Project page: https://ntaquan0125.github.io/weather-cyclone/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13563 2026-07-16 cs.CV 新提交 79%

Nexus: Native Mesh Generation with Diffusion

Nexus:基于扩散的原生网格生成

Hanxiao Wang, Ying-Tian Liu, Yuan-Chen Guo, Qi-Yuan Feng, Zi-Xin Zou, Ding Liang, Biao Zhang, Yan-Pei Cao

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VAST(无(暂未找到合适中文名,VAST可音译为“瓦斯特”,但这并非一个正式的中文机构名,所以保留英文)) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对高质量三角形网格生成问题,提出Nexus扩散方法,通过解耦顶点与拓扑生成实现整体网格生成,经实验验证其性能优于现有基线,有效克服顺序网格建模局限且获从业者青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13371 2026-07-16 cs.CV 新提交 79%

RoughNet: Mapping Arctic Sea Ice Roughness Using Diffusion-Based Super-Resolution of Satellite Imagery

RoughNet:利用基于扩散的卫星图像超分辨率绘制北极海冰粗糙度

Tessa Cannon, Michel Tsamados, Petru Manescu, Thomas Newman, Christian Haas, Veit Helm, Weibin Chen, Randall Scharien

机构 * University College London(伦敦大学学院) Alfred Wegener Institute Helmholtz Centre for Polar and Marine Research(阿尔弗雷德·韦格纳极地与海洋研究所亥姆霍兹中心) University of Victoria(维多利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究旨在准确估计北极海冰粗糙度,采用RoughNet方法,通过条件扩散框架从光学卫星图像重建海冰地形,经训练和评估,能在不同冰况下泛化,为高分辨率海冰测绘和粗糙度估计提供可扩展途径。

Comments Code available at https://github.com/tessacannon48/RoughNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13164 2026-07-16 cs.CL cs.CV cs.LG 新提交 79%

Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation

文本到手语:用于文本到手语视频生成的单 GPU 扩散基线

Ruize Xia

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究文本到手语视频生成,提出Text2Sign模型,结合冻结视觉语言文本编码器等技术,降低全视频注意力成本。在特定分割上有一定验证损失等结果,虽提示敏感性弱,但为单GPU研究提供了基线。

Journal ref IEEE Access, vol. 14, pp. 64003-64017, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12785 2026-07-16 cs.CV 版本更新 79%

ExtraGS: Enhancing Endoscopic View Extrapolation via Diffusion-Guided 3D Gaussian Splatting

ExtraGS:通过扩散引导的3D高斯点渲染增强内窥镜视图外推

Cheng-Tai Hsieh, Jiwei Shan, Han Fang, Jianshu Hu, Tao Ni, Lijun Han, Yutong Ban, Shing Shin Cheng, Hesheng Wang

机构 * The School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, and the Shanghai Key Laboratory of Navigation and Location-Based Services(上海交通大学自动化与智能感知学院以及上海市导航与位置服务重点实验室) Global College, Shanghai Jiao Tong University(上海交通大学密西根学院) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对传统内窥镜视野局限及神经渲染外推有伪影问题,提出ExtraGS框架,通过不确定性引导虚拟相机采样、扩散模型细化视图及置信加权微调策略,增强内窥镜视图外推,在新视图合成中达先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28419 2026-07-16 cs.CV cs.AI 版本更新 79%

MedDiffuseMix: Preserving Diagnostic Evidence with Saliency-Aware Diffusion Medical Image Data Augmentation

MedDiffuseMix: 通过显著性感知的扩散医学图像数据增强保留诊断证据

Teerath Kumar, Raja Vavekanand, Muhammad Turab

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MedDiffuseMix框架,利用分类器显著性图引导扩散混合,主要增强低显著性背景区域,保留诊断关键区域,在四个医学图像数据集上提升分类性能。

Comments Under review Signal Image and Video Processing

详情

展开后加载摘要…

URL PDF HTML 收藏