arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2601.20260 2026-01-29 cs.CV 83%

Reversible Efficient Diffusion for Image Fusion

可逆高效扩散用于图像融合

Xingxin Xu, Bing Cao, DongDong Li, Qinghua Hu, Pengfei Zhu

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) School of Artificial Intelligence, Tianjin University(人工智能学院,天津大学) Low-Altitude Intelligence Laboratory, Xiong’an National Innovation Center(低空智能实验室,雄安国家创新中心) Xiong’an Guochuang Lantian Technology Co., Ltd.(雄安国创蓝天科技有限公司) National University of Defense Technology(国防科技大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出可逆高效扩散模型,通过显式监督提升图像融合的生成能力,解决传统扩散模型在融合任务中的细节损失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16324 2026-01-29 cs.CV 83%

From Prediction to Perfection: Introducing Refinement to Autoregressive Image Generation

从预测到完美:引入精修到自回归图像生成

Cheng Cheng, Lin Song, Di An, Yicheng Xiao, Xuchong Zhang, Hongbin Sun, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 TensorAR通过引入张量预测机制,改进自回归图像生成的质量和性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17124 2026-01-28 cs.CV 83%

iFSQ: Improving FSQ for Image Generation with 1 Line of Code

iFSQ:通过一行代码改进图像生成的FSQ

Bin Lin, Zongjian Li, Yuwei Niu, Kaixiong Gong, Yunyang Ge, Yunlong Lin, Mingzhe Zheng, JianWei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Li Yuan

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯文言)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 iFSQ通过一行代码改进图像生成的FSQ,解决了重建保真度与信息效率的平衡问题,并揭示了离散与连续表示的最佳平衡点及AR与扩散模型的性能差异。

Comments Technical Report; Fixed eq.7 & 8 and corresponding content

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11194 2026-01-28 cs.LG cs.CV 83%

Beyond Memorization: Selective Learning for Copyright-Safe Diffusion Model Training

超越记忆:面向版权安全的扩散模型训练中的选择性学习

Divya Kothandaraman, Jaclyn Pytlarz

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种基于梯度投影的选择性学习方法,用于在扩散模型训练中有效控制记忆化,以保障版权安全和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10495 2026-01-28 cs.CR cs.AI cs.CV cs.LG 83%

SWA-LDM: Toward Stealthy Watermarks for Latent Diffusion Models

SWA-LDM:迈向潜在扩散模型的隐蔽水印

Zhonghao Yang, Linye Lyu, Xuanhang Chang, Daojing He, YU LI

机构 * Software Engineering Institute, East China Normal University(华东师范大学软件工程学院) School of Computer Science and Technology, Harbin Institute of Technology (Shen Zhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) College of Integrated Circuits, Zhejiang University(浙江大学集成电路学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 SWA-LDM通过动态随机化潜在噪声中的水印,提升潜在扩散模型的隐蔽性,实现更安全的水印部署。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14738 2026-01-22 cs.CV 83%

Safeguarding Facial Identity against Diffusion-based Face Swapping via Cascading Pathway Disruption

通过级联路径破坏保障面部身份免受基于扩散的面部交换攻击

Liqin Wang, Qianyue Hu, Wei Lu, Xiangyang Luo

机构 * MoE Key Laboratory of Information Technology, Sun Yat-sen University, Guangzhou, China(信息科技教育部重点实验室,中山大学,广州,中国) State Key Laboratory of Mathematical Engineering and Advanced Computing, Zhengzhou, China(数学工程与先进计算国家重点实验室,郑州,中国)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 VoidFace通过级联路径破坏技术,有效防御基于扩散模型的面部交换攻击,提升身份安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13416 2026-01-21 cs.CV 83%

Diffusion Representations for Fine-Grained Image Classification: A Marine Plankton Case Study

扩散表示用于细粒度图像分类:一个海洋浮游生物案例研究

A. Nieto Juscafresa, Á. Mazcuñán Herreros, J. Sullivan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出利用冻结的扩散模型作为特征编码器,通过多层特征和时间步探测提升细粒度图像分类性能,在浮游生物监测中验证了其有效性。

Comments 21 pages, 6 figures, CVPR format

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11689 2026-01-21 eess.IV cs.CV 83%

Bridging Modalities: Joint Synthesis and Registration Framework for Aligning Diffusion MRI with T1-Weighted Images

弥合模态:联合合成与配准框架用于对齐扩散磁共振成像与T1加权图像

Xiaofan Wang, Junyi Wang, Yuqian Chen, Lauren J. O' Donnell, Fan Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Brigham and Women’s Hospital(布里奇沃特医院) Harvard Medical School(哈佛医学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种基于生成配准网络的无监督框架,通过图像合成和变形场学习,提升扩散MRI与T1加权图像的配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11085 2026-01-19 eess.IV cs.CV physics.med-ph 83%

Generation of Chest CT pulmonary Nodule Images by Latent Diffusion Models using the LIDC-IDRI Dataset

利用LIDC-IDRI数据集通过潜在扩散模型生成胸部CT肺结节图像

Kaito Urata, Maiko Nagao, Atsushi Teramoto, Kazuyoshi Imaizumi, Masashi Kondo, Hiroshi Fujita

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出利用潜在扩散模型生成胸部CT肺结节图像,通过LIDC-IDRI数据集验证,生成图像质量与真实图像相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09213 2026-01-15 cs.CV cs.AI 83%

SpikeVAEDiff: Neural Spike-based Natural Visual Scene Reconstruction via VD-VAE and Versatile Diffusion

SpikeVAEDiff: 通过VD-VAE和多功能扩散实现神经尖峰基于的自然视觉场景重建

Jialu Li, Taiyan Zhou

机构 * HKUST Clear Water Bay(香港科技大学清水湾分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 SpikeVAEDiff通过VD-VAE和多功能扩散模型,利用神经尖峰数据实现高分辨率自然视觉场景重建,提升时间与空间分辨率,验证了特定脑区对重建质量的关键作用。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07530 2026-01-15 cs.CV 83%

Universal Few-Shot Spatial Control for Diffusion Models

通用少样本空间控制用于扩散模型

Kiet T. Nguyen, Chanhyuk Lee, Donggyun Kim, Dong Hoon Lee, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 UFC通过通用少样本控制适配器实现对扩散模型的通用空间控制,能够在少量示例下实现与全监督基线相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08095 2026-01-14 cs.CV 83%

From Prompts to Deployment: Auto-Curated Domain-Specific Dataset Generation via Diffusion Models

从提示到部署:通过扩散模型实现自动定制的领域特定数据集生成

Dongsik Yoon, Jongeun Kim

机构 * HDC LABS(HDC实验室)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过扩散模型生成领域特定合成数据集的方法,解决预训练模型与现实部署间的分布偏移问题,通过三阶段框架高效构建高质量可部署数据集。

Comments To appear in the Workshop on Synthetic & Adversarial ForEnsics (SAFE), WACV 2026 (oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23130 2026-01-14 cs.CV cs.AI 83%

PathoSyn: Imaging-Pathology MRI Synthesis via Disentangled Deviation Diffusion

PathoSyn: 通过解耦偏差扩散实现影像-病理MRI合成

Jian Wang, Sixing Rong, Jiarui Xing, Yuling Xu, Weide Liu

机构 * Department of Radiology, Boston Children’s Hospital, Harvard Medical School(放射科,波士顿儿童医院,哈佛医学院) College of Science, Northeastern University(科学学院,东北大学) School of Medicine, Yale University(医学院,耶鲁大学) Department of Cardiac Surgery, The Second Affiliated Hospital of Jiangxi Medical College, Nanchang University(心脏外科科,江西医学院第二附属医院,南昌大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 PathoSyn通过解耦偏差扩散模型生成高保真MRI合成数据,提升低数据环境下诊断算法的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09644 2026-01-14 cs.CV cs.AI 83%

DGAE: Diffusion-Guided Autoencoder for Efficient Latent Representation Learning

DGAE:基于扩散的自编码器用于高效潜在表示学习

Dongxu Liu, Jiahui Zhu, Yuang Peng, Haomiao Tang, Yuwei Chen, Chunrui Han, Zheng Ge, Daxin Jiang, Mingxue Liao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DGAE通过结合扩散模型提升解码器表达能力,实现高效潜在表示学习,在高压缩率下提升性能并减少潜在空间维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07273 2026-01-13 cs.CV 83%

GenDet: Painting Colored Bounding Boxes on Images via Diffusion Model for Object Detection

GenDet:通过扩散模型在图像上绘制彩色边界框以实现目标检测

Chen Min, Chengyang Li, Fanjie Kong, Qi Zhu, Dawei Zhao, Liang Xiao

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 GenDet通过扩散模型将目标检测转化为图像生成任务,实现精确的边界框生成与语义标注,提升检测精度与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08635 2026-01-12 cs.CV 83%

Latent Diffusion Autoencoders: Toward Efficient and Meaningful Unsupervised Representation Learning in Medical Imaging

潜在扩散自编码器:迈向医学影像中高效且有意义的无监督表示学习

Gabriele Lozupone, Alessandro Bria, Francesco Fontanella, Frederick J. A. Meijer, Claudio De Stefano, Henkjan Huisman

机构 * Department of Electrical and Information Engineering (DIEI), University of Cassino and Southern Lazio(电气与信息工程系(DIEI),卡斯诺和南部拉齐亚大学) Diagnostic Image Analysis Group, Radboud University Medical Center(影像诊断分析组,拉德堡德大学医学中心) Department of Medical Imaging, Radboud University Medical Center(医学成像系,拉德堡德大学医学中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LDAE通过在潜在空间中应用扩散过程,实现了高效且有意义的医学影像无监督学习,展示了在AD诊断和年龄预测中的高准确性及重建质量。

Comments 15 pages, 9 figures, 7 tables

Journal ref Medical Image Analysis (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18719 2026-01-08 cs.CV 83%

Boosting Resolution Generalization of Diffusion Transformers with Randomized Positional Encodings

通过随机化位置编码提升扩散变换器的分辨率泛化能力

Liang Hou, Cong Liu, Mingwu Zheng, Xin Tao, Pengfei Wan, Di Zhang, Kun Gai

机构 * Kling Team, Kuaishou Technology(快手科技 Kling Team)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出RPE-2D,通过随机化位置编码提升扩散变换器的分辨率泛化能力,实现高分辨率和低分辨率图像生成的无缝过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07960 2026-01-08 cs.CV 83%

VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning

VisualCloze: 一种通过视觉上下文学习实现通用图像生成的框架

Zhong-Yu Li, Ruoyi Du, Juncheng Yan, Le Zhuo, Qilong Wu, Zhen Li, Peng Gao, Zhanyu Ma, Ming-Ming Cheng

机构 * VCIP, CS, Nankai University(VCIP、计算机科学、南开大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 VisualCloze通过视觉上下文学习实现通用图像生成,支持多种任务泛化与反向生成,利用图结构数据集提升任务密度和知识迁移。

Comments Accepted at ICCV 2025. Project page: https://visualcloze.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02036 2026-01-06 cs.LG cs.CV 83%

GDRO: Group-level Reward Post-training Suitable for Diffusion Models

GDRO:适用于扩散模型的组级奖励后训练

Yiyang Wang, Xi Chen, Xiaogang Xu, Yu Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 GDRO通过组级奖励后训练优化,提升扩散模型奖励分数并增强抗奖励黑客能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23239 2026-01-06 cs.CV 83%

RS-Prune: Training-Free Data Pruning at High Ratios for Efficient Remote Sensing Diffusion Foundation Models

RS-Prune: 无需训练的数据裁剪以高比例提升高效遥感扩散基础模型

Fan Wei, Runmin Dong, Yushan Lai, Yixiang Yang, Zhaoyang Luo, Jinxiao Zhang, Miao Yang, Shuai Yuan, Jiyao Zhao, Bin Luo, Haohuan Fu

机构 * Department of Earth System Science, Tsinghua University(清华大学地球系统科学系) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院) Department of Geography, The University of Hong Kong(香港大学地理系) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 RS-Prune提出一种无需训练的高比例数据裁剪方法,通过局部信息与全局多样性结合,提升遥感扩散模型的收敛性和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01487 2026-01-06 cs.CV cs.AI 83%

DeepInv: A Novel Self-supervised Learning Approach for Fast and Accurate Diffusion Inversion

DeepInv: 一种用于快速准确扩散逆向的新型自监督学习方法

Ziyue Zhang, Luxi Lin, Xiaolin Hu, Chao Chang, HuaiXi Wang, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学) National University of Defense Technology(国防科技大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 DeepInv通过自监督学习和数据增强策略,实现快速准确的扩散逆向,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00546 2026-01-06 cs.CV 83%

Seal2Real: Prompt Prior Learning on Diffusion Model for Unsupervised Document Seal Data Generation and Realisation

Seal2Real: 基于扩散模型的提示先验学习用于无监督文档印章数据生成与实现

Mingfu Yan, Jiancheng Huang, Shifeng Chen

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Shenzhen University of Advanced Technology(深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 Seal2Real通过基于预训练扩散模型的提示先验学习,生成大规模标注的文档印章数据,提升真实数据中印章相关任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00535 2026-01-05 cs.CV 83%

FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection

FreeText: 通过注意力定位和频谱字形注入实现免训练的文本渲染

Ruiqiang Zhang, Hengyi Wang, Chang Liu, Guanjie Wang, Zehua Ma, Weiming Zhang

机构 * Anhui Province Key Laboratory of Digital Security, University of Science and Technology of China(安徽省数字安全重点实验室,中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 FreeText通过注意力定位和频谱字形注入技术,无需训练即可提升文本渲染的准确性和美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24195 2026-01-01 cs.CV 83%

CorGi: Contribution-Guided Block-Wise Interval Caching for Training-Free Acceleration of Diffusion Transformers

CorGi:基于贡献的块级区间缓存用于无训练加速扩散变换器

Yonglak Son, Suhyeok Kim, Seungryong Kim, Young Geun Kim

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 CorGi通过块级区间缓存减少DiT去噪过程中的冗余计算,提升推理速度并保持生成质量,CorGi+进一步优化了文本到图像任务中的注意力更新。

Comments 16 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24138 2026-01-01 cs.LG cs.AI cs.CV 83%

GARDO: Reinforcing Diffusion Models without Reward Hacking

GARDO:无需奖励黑客的扩散模型强化

Haoran He, Yuxiao Ye, Jie Liu, Jiajun Liang, Zhiyong Wang, Ziyang Yuan, Xintao Wang, Hangyu Mao, Pengfei Wan, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技) CUHK MMLab(港中文大学MMLab) The University of Edinburgh(爱丁堡大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 GARDO通过自适应正则化和多样性增强,有效缓解扩散模型中的奖励黑客问题,提升生成多样性与样本效率。

Comments 17 pages. Project: https://tinnerhrhe.github.io/gardo_project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15560 2025-12-30 cs.CV 83%

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17951 2025-12-30 cs.CV cs.AI 83%

Robust Polyp Detection and Diagnosis through Compositional Prompt-Guided Diffusion Models

通过组成提示引导的扩散模型实现鲁棒的息肉检测与诊断

Jia Yu, Yan Zhu, Peiyao Fu, Tianyi Chen, Junbo Huang, Quanlin Li, Pinghong Zhou, Zhihua Wang, Fei Wu, Shuo Wang, Xian Yang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study of Zhejiang University(浙江大学上海高等研究院) Endoscopy Center, Zhongshan Hospital, Fudan University(复旦大学中山医院内窥镜中心) Shanghai Collaborative Innovation Center of Endoscopy(上海内窥镜协同创新中心) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医疗研究中心) Shanghai Key Laboratory of MICCAI(上海MICCAI重点实验室) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟商学院) Data Science Institute, Imperial College London(伦敦帝国学院数据科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出PSDM模型,通过整合多种临床注释生成合成图像,提升息肉检测、分类和分割的鲁棒性和泛化能力。

Journal ref IEEE Trans. Med. Imaging, vol. 44, no. 12, pp. 5245-5257, Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22626 2025-12-30 cs.CV 83%

Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion

Envision:通过目标图像视频扩散进行具身视觉规划

Yuming Gu, Yizhi Wang, Yining Hong, Yipeng Gao, Hao Jiang, Angtian Wang, Bo Liu, Nathaniel S. Dennler, Zhengfei Kuang, Hao Li, Gordon Wetzstein, Chongyang Ma

机构 * University of Southern California(南加州大学) ByteDance(字节跳动) Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) MBZUAI

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 Envision 通过目标图像视频扩散模型实现具身视觉规划,提升目标对齐和空间一致性,支持下游机器人任务。

Comments Page: https://envision-paper.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22323 2025-12-30 cs.CV cs.AI 83%

SpotEdit: Selective Region Editing in Diffusion Transformers

SpotEdit: 差分变换器中的选择性区域编辑

Zhibin Qin, Zhenxiong Tan, Zeqing Wang, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 SpotEdit提出了一种无需训练的差分编辑框架,通过选择性更新修改区域,实现高效且精确的图像编辑。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21593 2025-12-29 stat.ML cs.AI cs.CV cs.LG 83%

Residual Prior Diffusion: A Probabilistic Framework Integrating Coarse Latent Priors with Diffusion Models

残差先验扩散:整合粗粒度潜在先验与扩散模型的概率框架

Takuro Kutsuna

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 残差先验扩散通过整合粗粒度潜在先验与扩散模型,有效捕捉数据分布的细粒度细节并保持大型结构,提升生成质量。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏