arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1384 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1384 篇

2510.05509 2026-07-20 cs.CV 版本更新 79%

Be Tangential to Manifold: Discovering Riemannian Metric for Diffusion Models

与流形相切:为扩散模型发现黎曼度量

Shinnosuke Saito, Takashi Matsubara

机构 * Hokkaido University(北海道大学) CyberAgent

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的黎曼度量,通过分数函数雅可比的谱结构区分流形切线与法线方向,从而在噪声空间中促进路径保持流形切线性,提升扩散模型的生成质量与文本-图像对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09238 2026-07-17 cs.CV 版本更新 79%

Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method

知识嵌入与超网络引导的少样本变电站电表缺陷图像生成方法

Jackie Alex, Justin Petter

机构 * St. Petersburg College(斯波尔丁学院)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对变电站电表缺陷图像标注样本稀缺问题,提出将知识嵌入、超网络引导条件控制集成到稳定扩散管道的方法,能逼真可控合成缺陷图像,优于现有基线,提升下游检测器mAP等,为工业检测提供数据合成方案。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20153 2026-07-17 cs.CV 版本更新 79%

CoDi -- an exemplar-conditioned diffusion model for low-shot counting

CoDi——一种用于少样本计数的示例条件扩散模型

Grega Šuštar, Jer Pelhan, Alan Lukežič, Matej Kristan

机构 * Faculty of Computer and Information Science, University of Ljubljana(计算机与信息科学学院,卢布尔雅那大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究少样本目标计数问题,提出基于潜在扩散的CoDi模型,其核心是基于示例的条件模块,能生成高质量密度图。在FSC和MCAC基准测试中表现出色,分别在少样本等场景及整体上大幅超越现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10999 2026-07-17 cs.CV 版本更新 79%

Conditioning Residuals for Diffusion Models via Representation Feedback

通过表示反馈对扩散模型的残差进行条件设定

Weilai Xiang, Hongyu Yang, Di Huang, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型中能否利用固有路径路由内部推断语义,提出条件残差这一轻量级反馈机制,通过反馈紧凑特征摘要提供自适应指导,实验显示其提升了生成性能及下游任务表现,还揭示了训练动态和特征结构的改进。

Comments Substantially revised and retitled. Code available at https://github.com/FutureXiang/ddae_plus_plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16839 2026-07-17 cs.CV 版本更新 79%

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa:用于多模态理解的大型扩散语言模型

Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Adobe Research(Adobe研究) Salesforce Research(Salesforce研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12785 2026-07-16 cs.CV 版本更新 79%

ExtraGS: Enhancing Endoscopic View Extrapolation via Diffusion-Guided 3D Gaussian Splatting

ExtraGS:通过扩散引导的3D高斯点渲染增强内窥镜视图外推

Cheng-Tai Hsieh, Jiwei Shan, Han Fang, Jianshu Hu, Tao Ni, Lijun Han, Yutong Ban, Shing Shin Cheng, Hesheng Wang

机构 * The School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, and the Shanghai Key Laboratory of Navigation and Location-Based Services(上海交通大学自动化与智能感知学院以及上海市导航与位置服务重点实验室) Global College, Shanghai Jiao Tong University(上海交通大学密西根学院) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对传统内窥镜视野局限及神经渲染外推有伪影问题,提出ExtraGS框架,通过不确定性引导虚拟相机采样、扩散模型细化视图及置信加权微调策略,增强内窥镜视图外推,在新视图合成中达先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28419 2026-07-16 cs.CV cs.AI 版本更新 79%

MedDiffuseMix: Preserving Diagnostic Evidence with Saliency-Aware Diffusion Medical Image Data Augmentation

MedDiffuseMix: 通过显著性感知的扩散医学图像数据增强保留诊断证据

Teerath Kumar, Raja Vavekanand, Muhammad Turab

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MedDiffuseMix框架,利用分类器显著性图引导扩散混合,主要增强低显著性背景区域,保留诊断关键区域,在四个医学图像数据集上提升分类性能。

Comments Under review Signal Image and Video Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20101 2026-07-15 cs.SD cs.AI cs.MM 版本更新 79%

RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers

基于整流流的混合扩散变压器用于指令引导音频编辑

Liting Gao, Yonggang Zhu, Yaru Chen, Dongyu Wang, Shubin Zhang, Zhenbo Li, Jean-Yves Guillemaut, Wenwu Wang

机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Fisheries College, Ocean University of China(中国海洋大学水产学院) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 提出混合两阶段扩散变压器架构,通过粗到细策略平衡全局语义对齐与局部细节编辑,在重叠音频事件和复杂指令任务上提升性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01841 2026-07-15 cs.CV 版本更新 79%

Leveraging Prior Knowledge of Diffusion Model for Person Search

利用扩散模型的先验知识进行行人搜索

Giyeol Kim, Sooyoung Yang, Jihyong Oh, Myungjoo Kang, Chanho Eom

机构 * GSAIM, Chung-Ang University(Chung-Ang大学图像信息研究所) IPAI, Seoul National University(首尔国立大学图像感知研究所) Department of Mathematical Sciences and RIMS, Seoul National University(首尔国立大学数学科学系和RIMS)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对行人搜索中现有方法的不足,提出DiffPS框架,利用预训练扩散模型,消除子任务优化冲突,通过分析扩散先验属性设计三个专门模块,在CUHK-SYSU和PRW数据集上取得新的最优成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09122 2026-07-15 cs.CV 版本更新 79%

LVMark: Robust Watermark for Latent Video Diffusion Models

LVMark:用于潜在视频扩散模型的鲁棒水印

Youngdong Jang, MinHyuk Jang, JaeHyeok Lee, Feng Yang, Gyeongrok Oh, Jongheon Jeong, Sangpil Kim

机构 * Department of Artificial Intelligence, Korea University, Seoul 02841, Republic of Korea(人工智能系,韩国大学,首尔02841,大韩民国) Google DeepMind, Mountain View, CA 94043, USA(谷歌DeepMind,山景城,加利福尼亚州94043,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型现有水印方法的局限,提出LVMark方法,通过学习相邻帧一致性设计新颖水印解码器,结合小波域低频分量与视频颜色特征确保解码准确,训练潜在解码器保持视觉保真,平衡视觉质量与比特精度,实现高容量鲁棒水印嵌入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10094 2026-07-15 cs.CV cs.LG 版本更新 79%

Beyond Perceptual Distance: Discrepancy Assessment on Deep Representation for Out-of-Distribution Detection with Diffusion Model

超越感知距离:基于扩散模型的分布外检测深度表示差异评估

Kun Fang, Zuopeng Yang, Haibo Hu, Xiaolin Huang, Jie Yang, Qinghua Tao

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) The Intsig Information Co., Ltd., Shanghai, China(上海Intsig信息有限公司) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究基于扩散模型的分布外检测差异评估,提出以分类器相关方式评估,利用其表示空间量化特征级和logit级差异,设计优化策略构成DDR框架,实验表明DDR在ImageNet-1K数据集上检测性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22036 2026-07-14 cs.LG cs.MM 版本更新 79%

Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion

基于双蒸馏的超模态插补扩散嵌入用于联邦多模态知识图谱补全

Ying Zhang, Yu Zhao, Xuhui Sui, Baohang Zhou, Xiangrui Cai, Li Shen, Xiaojie Yuan, Dacheng Tao

机构 * College of Computer Science, VCIP, DISSec, Nankai University(计算机学院、VCIP、DISSec、南开大学) School of Software, Tiangong University(软件学院、天津工业大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院、南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 针对多模态知识图谱分散问题,提出FedMKGC任务及MMFeD3-HidE框架,客户端内用超模态插补扩散嵌入模型,客户端间用多模态联邦双蒸馏传输知识,通过FedMKGC基准验证了该框架的有效性、语义一致性和收敛鲁棒性。

Comments Published in IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00786 2026-07-14 cs.CV 版本更新 79%

Zero-Shot Paragraph-level Handwriting Imitation with Latent Diffusion Models

基于潜在扩散模型的零样本段落级手写模仿

Martin Mayr, Marcel Dreier, Florian Kordon, Mathias Seuret, Jochen Zöllner, Fei Wu, Andreas Maier, Vincent Christlein

机构 * Planet AI GmbH

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于潜在扩散模型的零样本段落级手写模仿方法,通过改进模型、增强注意力机制等,能处理未见风格,提高手写生成真实感,在综合评估中表现优异,还公开代码支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新 79%

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14584 2026-07-10 cs.CV 版本更新 79%

Anatomically Guided Latent Diffusion for Brain MRI Progression Modeling

用于脑 MRI 进展建模的解剖学引导潜在扩散

Cheng Wan, Bahram Jafrasteh, Ehsan Adeli, Miaomiao Zhang, Qingyu Zhao

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔医学院) Stanford University(斯坦福大学) University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究旨在准确建模脑 MRI 进展,提出解剖学引导潜在扩散模型 AG-LDM,通过融合多因素简化训练流程,经实验验证其在图像质量、误差降低及特征捕捉等方面表现优异,是可靠的脑 MRI 进展建模框架。

Comments 24 pages, 7 figures, 7 tables. Code available at https://github.com/JornyWan/AG-LDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17077 2026-07-09 cs.LG cs.AI cs.CV 版本更新 79%

ContrastiveCFG: Guiding Diffusion Sampling by Contrasting Positive and Negative Concepts

对比CFG:通过对比正负概念引导扩散采样

Jinho Chang, Changsun Lee, Hyungjin Chung, Jong Chul Ye

机构 * EverEx

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究在条件扩散模型采样中,针对简单否定CFG引导存在的问题,提出用对比损失实现对给定条件引导的新方法,能在多样场景下有效注入或去除给定概念并保持样本质量。

Comments 20 pages, 11 figures. Poster in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16147 2026-07-08 cs.CV 版本更新 79%

Registers Matter for Pixel-Space Diffusion Transformers

注册信息对像素空间扩散变换器的重要性

Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy, Artem Babenko, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究发现扩散变换器与视觉变换器在处理像素空间时存在差异,注册令牌显著提升了生成质量,通过分析中间表示发现其在高噪声水平下产生更清晰的特征图,进而提出了一种高效的双流架构以提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10439 2026-07-08 cs.CV 版本更新 79%

Filtering Memorization from Parameter-Space in Diffusion Models

从参数空间过滤记忆化在扩散模型中

Yu Zhe, Yang Jiayan, Wei Junhao, Yu-Lin Tsai, Wang Chen

机构 * RIKEN AIP(理化学研究所Advanced Institute for Peripheral Research) Science of Tokyo(东京科学大学) University of California, Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出BAF框架,通过分解LoRA更新并测量其与预训练骨干的主子空间对齐度,实现训练后记忆抑制,减少生成内容中的版权或敏感内容复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15932 2026-07-08 cs.CV 版本更新 79%

NAMD: Virtual Follow-up Computed Tomography Synthesis via Nodule-Aligned Multimodal Diffusion Models for Early Lung Cancer Diagnosis

基于LLM驱动多模态扩散的结节对齐潜在空间学习:用于肺结节进展预测

James Song, Yifan Wang, Chuan Zhou, Liyue Shen

机构 * Department of EECS, University of Michigan(电子工程与计算机科学系,密歇根大学) University of Michigan Medical School(密歇根大学医学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NAMD框架,通过生成1年随访CT图像预测肺结节进展,利用结节对齐潜在空间和LLM驱动控制机制,在NLST数据集上实现优于基线和现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04024 2026-07-08 cs.CV cs.AI 版本更新 79%

Volumetric Directional Diffusion: Anchoring Uncertainty Quantification in Anatomical Consensus for Ambiguous Medical Image Segmentation

体积方向扩散:在模糊医学图像分割的解剖学共识中锚定不确定性量化

Chao Wu, Mahesh Bhosale, Kangxian Xie, Pouya Karimian, David Doermann, Mingchen Gao

机构 * Department of Computer Science and Engineering University at Buffalo, SUNY Buffalo, NY, USA(计算机科学与工程系,布法罗大学,纽约州,布法罗,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对模糊医学图像分割中不同专家边界描绘有差异的问题,提出体积方向扩散(VDD)框架,以粗略共识预测为锚点,学习方向扩散过程生成边界变化,实验表明该方法能在保持精度和结构一致性时改善不确定性分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00001 2026-07-08 cs.CV cs.AI cs.CY 版本更新 79%

Replication in Visual Diffusion Models: A Survey and Outlook

视觉扩散模型中的复制:一项综述与展望

Wenhao Wang, Yifan Sun, Zongxin Yang, Zhengdong Hu, Zhentao Tan, Yi Yang

机构 * Australian Artificial Intelligence Institute, University of Technology Sydney(澳大利亚人工智能研究所,悉尼技术大学) Baidu Inc.(百度公司) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文综述视觉扩散模型中的复制现象,将现有研究分类为揭示、理解和缓解该现象的方法,还回顾其现实影响,讨论了检测和基准测试复制的挑战及未来方向,助力研究人员和从业者理解AI技术与社会公益交叉点。

Comments Accepted by TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20294 2026-07-07 cs.CV 版本更新 79%

Ctrl-Z Sampling: Scaling Diffusion Sampling with Controlled Random Zigzag Explorations

Ctrl-Z Sampling:通过受控随机zigzag探索扩展扩散采样

Shunqi Mao, Wei Guo, Chaoyi Zhang, Jieting Long, Ke Xie, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Ctrl-Z采样方法,通过检测质量景观中的高原并进行受控探索,提升扩散模型生成质量,在不同NFE预算下均表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16357 2026-07-07 cs.CV 版本更新 79%

GMODiff: One-Step Gain Map Refinement with Diffusion Priors for HDR Reconstruction

GMODiff:基于扩散先验的单步增益图优化用于高动态范围重建

Tao Hu, Weiyu Zhou, Yanjie Tu, Peng Wu, Wei Dong, Qingsen Yan, Yanning Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GMODiff,通过单步扩散框架优化增益图,提升多曝光HDR重建的动态范围和效率,实验表明其性能优于现有方法且速度提升100倍。

Comments This paper is accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04795 2026-07-07 cs.CV cs.AI 版本更新 79%

LAW & ORDER: Adaptive Spatial Weighting for Medical Diffusion and Segmentation

法律与秩序:医学扩散与分割的自适应空间加权

Anugunj Naman, Ayushman Singh, Gaibo Zhang, Yaguang Zhang

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫尔电气与计算机工程学院) Purdue University(普渡大学) Sesame AI Department of Computer Science(计算机科学系) Department of Agricultural and Biological Engineering (ABE)(农业与生物工程系) Department of Agricultural Sciences Education and Communication (ASEC)(农业科学教育与交流系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究医学图像分析中自适应空间加权,通过两个适配器实现。LAW为掩码条件扩散学习像素损失权重,ORDER通过选择性双向跳跃注意力改进分割,在多个数据集上取得良好效果,证明该方法对医学扩散和分割的有效性。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10099 2026-07-07 cs.LG cs.CV 版本更新 79%

Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders

流形上的学习:通过表示编码器解锁标准扩散变压器

Amandeep Kumar, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究利用表示编码器进行生成建模时标准扩散变压器收敛失败的问题,指出根本原因是几何干扰,提出黎曼流匹配与雅可比正则化方法,使标准扩散变压器无需宽度缩放就能收敛。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05305 2026-07-07 cs.CV cs.AI cs.CL 版本更新 79%

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

FlashBlock:用于高效长上下文块扩散的注意力缓存

Zhuokun Chen, Jianfei Cai, Bohan Zhuang

机构 * Monash University(墨尔本大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究长内容生成中块扩散在长上下文设置下的注意力计算开销问题,提出FlashBlock机制,利用块外注意力输出稳定性复用注意力,减少计算与缓存访问,提升效率且不影响质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02908 2026-07-07 cs.LG cs.AI cs.CV stat.ML 版本更新 79%

A Random Matrix Theory Perspective on the Consistency of Diffusion Models

扩散模型一致性的随机矩阵理论视角

Binxu Wang, Jacob Zavatone-Veth, Cengiz Pehlevan

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型在不同数据集子集训练时输出相似的原因,用随机矩阵理论框架量化有限数据集对去噪器和采样映射期望及方差的影响,揭示交叉分割不一致的因素并验证对模型行为的预测。

Comments 58 pages, 45 figures. Accepted as an Oral Presentation at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15829 2026-07-07 cs.CV 版本更新 79%

Towards Realistic Remote Sensing Dataset Distillation with Discriminative Prototype-guided Diffusion

基于判别原型引导扩散的逼真遥感数据集蒸馏研究

Yonghao Xu, Pedram Ghamisi, Qihao Weng

机构 * Computer Vision and Learning Systems, Department of Electrical Engineering, Linköping University(计算机视觉与学习系统,电气工程系,利厄普大学) Helmholtz-Zentrum Dresden-Rossendorf, Responsible AI Group(海姆霍尔茨·德累斯顿-罗斯托克研究中心,负责任人工智能小组) University of Iceland, Faculty of Electrical and Computer Engineering(冰岛大学,电气与计算机工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对遥感图像解释依赖大量训练数据带来的高成本问题,提出判别原型引导扩散框架,通过提取原型、构建语义锚及筛选候选样本,将大规模数据集浓缩成有代表性的蒸馏数据集用于下游模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14788 2026-07-07 cs.CV 版本更新 79%

Reconstruction-Anchored Diffusion Model for Text-to-Motion Generation

用于文本到运动生成的重建锚定扩散模型

Yifei Liu, Changxing Ding, Ling Guo, Huaiguang Jiang, Qiong Cao

机构 * South China University of Technology(华南理工大学) Joy Future Academy(京东探索研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对文本驱动人体运动生成中预训练文本编码器存在表征差距及迭代去噪过程中误差传播问题,提出重建锚定扩散模型,利用运动潜在空间监督,采用自正则化等目标函数训练,还提出重建误差引导机制,实验表明性能显著提升。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11797 2026-07-07 cs.RO cs.CV 版本更新 79%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏