arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-02 至 2025-12-02 共收录 100 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 100 篇

2412.13059 2025-12-02 eess.IV cs.CV 88%

3D MedDiffusion: A 3D Medical Latent Diffusion Model for Controllable and High-quality Medical Image Generation

3D MedDiffusion:一种用于可控和高质量医学图像生成的3D医学潜在扩散模型

Haoshen Wang, Zhentao Liu, Kaicong Sun, Xiaodong Wang, Dinggang Shen, Zhiming Cui

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 3D MedDiffusion通过高效补丁-体积自编码器和新型噪声估计器,实现可控且高质量的3D医学图像生成,适用于多种医学下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00557 2025-12-02 cs.CV cs.AI cs.LG 88%

Blind Inverse Problem Solving Made Easy by Text-to-Image Latent Diffusion

通过文本到图像潜在扩散模型简化盲逆问题求解

Michail Dontas, Yutong He, Naoki Murata, Yuki Mitsufuji, J. Zico Kolter, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团) Bosch Center for AI(博世人工智能中心)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 LADiBI通过文本到图像潜在扩散模型无需训练解决多种盲逆问题,利用贝叶斯框架和新型后验采样算法实现灵活且高效的图像恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11253 2025-12-02 cs.CV 85%

CountSteer: Steering Attention for Object Counting in Diffusion Models

CountSteer:在扩散模型中通过引导注意力实现物体计数

Hyemin Boo, Hyoryung Kim, Myungjin Lee, Seunghyeon Lee, Jiyoung Lee, Jang-Hwan Choi, Hyunsoo Cho

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 CountSteer通过引导扩散模型的注意力机制,提升指定物体数量的生成精度,实现更可控的图像生成。

Comments Accepted to AAAI 2026 Workshop on Shaping Responsible Synthetic Data in the Era of Foundation Models (RSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01426 2025-12-02 cs.CV 83%

ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers

ResDiT: 在扩散变换器中激发内在分辨率可扩展性

Yiyang Ma, Feng Zhou, Xuedan Yin, Pu Cao, Yonghao Dang, Jianqin Yin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 ResDiT通过改进位置嵌入和局部增强机制,实现了无需训练的高分辨率图像生成,有效解决空间布局崩溃和纹理保真度下降问题。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00532 2025-12-02 cs.CV cs.RO 83%

Image Generation as a Visual Planner for Robotic Manipulation

图像生成作为机器人操作的视觉规划器

Ye Pang

机构 * Southern China University of Technology(华南理工大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出利用图像生成模型作为机器人视觉规划器,通过轻度微调实现时间连贯的机器人操作视频生成。

Comments 11 pages 9 figures Under review at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13625 2025-12-02 cs.CV cs.CR 83%

DiffProtect: Generate Adversarial Examples with Diffusion Models for Facial Privacy Protection

DiffProtect: 用扩散模型生成对抗示例以保护面部隐私

Jiang Liu, Chun Pong Lau, Zhongliang Guo, Yuxiang Guo, Zhaoyang Wang, Rama Chellappa

机构 * Johns Hopkins University(约翰霍普金斯大学) City University of Hong Kong(香港城市大学) University of St Andrews(圣安德鲁大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DiffProtect利用扩散模型生成高质量对抗示例,提升面部隐私保护的视觉质量和攻击成功率

Comments Code is at https://github.com/joellliu/DiffProtect/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00369 2025-12-02 cs.CV 83%

POLARIS: Projection-Orthogonal Least Squares for Robust and Adaptive Inversion in Diffusion Models

POLARIS:用于扩散模型中鲁棒和自适应逆向的投影正交最小二乘法

Wenshuo Chen, Haosen Li, Shaofeng Liang, Lei Wang, Haozhe Jia, Kaishen Yuan, Jieming Wu, Bowen Tian, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Griffith University(格里菲斯大学) Data61/CSIRO Project(Data61/CSIRO项目)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 POLARIS通过将逆向问题转化为误差来源问题,以单行代码提升扩散模型逆向的鲁棒性和适应性,显著减少噪声近似误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00084 2025-12-02 cs.CV cs.LG 83%

A Fast and Efficient Modern BERT based Text-Conditioned Diffusion Model for Medical Image Segmentation

一种快速且高效的基于现代BERT的文本条件扩散模型用于医学图像分割

Venkata Siddharth Dhara, Pawan Kumar

机构 * International Institute of Information Technology, Hyderabad, 500032, India(国际信息科技学院,海得拉巴)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出FastTextDiff,利用ModernBERT提升医学图像分割的效率和准确性,通过整合文本注释和多模态注意力机制改进传统扩散模型。

Comments 15 pages, 3 figures, Accepted in Slide 3 10th International Conference on Computer Vision & Image Processing (CVIP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10918 2025-12-02 cs.LG cs.AI 82%

ToMA: Token Merge with Attention for Diffusion Models

ToMA: 通过注意力机制的令牌合并用于扩散模型

Wenbo Lu, Shaoyi Zheng, Yuxuan Xia, Shengjie Wang

机构 * Department of Computer Science, New York University(纽约大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 ToMA通过重新设计令牌合并方法,提升扩散模型的GPU效率,减少生成延迟并优化实际性能。

Comments In proceedings of the 42nd International Conference on Machine Learning (ICML 2025). Code available at https://github.com/wenboluu/ToMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01975 2025-12-02 cs.CV 79%

SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning

SGDiff: 基于场景图引导的扩散模型用于图像协作分割与描述

Xu Zhang, Jin Yuan, Hanwang Zhang, Guojin Zhong, Yongsheng Zang, Jiacheng Lin, Zhiyong Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SGDiff通过基于场景图引导的扩散模型,实现从简单提示到多样化描述与掩码对的图像协作分割与描述任务,提升语义对齐与灵活结果选择能力。

Comments Accept by AAAI-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01533 2025-12-02 cs.CV cs.AI 79%

Diffusion Fuzzy System: Fuzzy Rule Guided Latent Multi-Path Diffusion Modeling

扩散模糊系统:基于模糊规则的潜在多路径扩散建模

Hailong Yang, Te Zhang, Kup-sze Choi, Zhaohong Deng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出扩散模糊系统,通过模糊规则引导的多路径扩散建模,提升图像生成的稳定性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23127 2025-12-02 cs.CV 79%

DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation

DualCamCtrl: 基于双分支扩散模型的几何感知摄像机控制视频生成

Hongfei Zhang, Kanghao Chen, Zixin Zhang, Harold Haodong Chen, Yuanhuiyi Lyu, Yuqi Zhang, Shuai Yang, Kun Zhou, Yingcong Chen

机构 * HKUST (GZ)(香港科技大学) HKUST(香港科技大学) Fudan University(复旦大学) Shenzhen University(深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DualCamCtrl通过双分支扩散模型实现几何感知的摄像机控制视频生成,有效提升视频生成的一致性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08711 2025-12-02 cs.CV 79%

Harnessing Diffusion-Generated Synthetic Images for Fair Image Classification

利用扩散生成的合成图像实现公平的图像分类

Abhipsa Basu, Aviral Gupta, Abhijnya Bhat, R. Venkatesh Babu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用扩散模型微调技术生成组平衡数据,以提升图像分类的公平性,实验表明其在去偏效果上优于现有方法。

Comments Accepted to AAAI AISI Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00412 2025-12-02 cs.CV cs.LG 79%

CraftSVG: Multi-Object Text-to-SVG Synthesis via Layout Guided Diffusion

CraftSVG: 通过布局引导扩散实现多对象文本到SVG合成

Ayan Banerjee, Nityanand Mathur, Josep Llados, Umapada Pal, Anjan Dutta

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心) Smallest AI Indian Statistical Institute, Kolkata(印度统计研究所) Institute for People Centred Artificial Intelligence, University of Surrey(以人为中心的人工智能研究所,萨里大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SVGCraft通过布局引导扩散模型实现多对象文本到SVG合成,提升场景生成的抽象性、可识别性和细节表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01481 2025-12-02 cs.CV 79%

ChronosObserver: Taming 4D World with Hyperspace Diffusion Sampling

ChronosObserver: 用超空间扩散采样驯服4D世界

Qisen Wang, Yifan Zhao, Peisen Shen, Jialu Li, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ChronosObserver通过超空间表示和引导采样,实现无需训练的高质量多视角时间同步视频生成,解决4D世界生成难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01422 2025-12-02 cs.CV 79%

MDiff4STR: Mask Diffusion Model for Scene Text Recognition

MDiff4STR:用于场景文本识别的掩码扩散模型

Yongkun Du, Miaomiao Zhao, Songlin Fan, Zhineng Chen, Caiyan Jia, Yu-Gang Jiang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MDiff4STR通过改进的掩码扩散模型在场景文本识别中实现更高的准确性和快速推断。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01252 2025-12-02 cs.LG cs.CV 79%

Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe

扩散混合专家模型的高效训练:一种实用配方

Yahui Liu, Yang Yue, Jingyuan Zhang, Chenxi Sun, Yang Zhou, Wencong Zeng, Ruiming Tang, Guorui Zhou

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种高效训练扩散混合专家模型的方法,通过优化架构配置提升模型性能,提供实用且高效的训练方案。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00909 2025-12-02 cs.CV 79%

TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion Model

TalkingPose: 基于反馈引导扩散模型的高效人脸与手势动画

Alireza Javanmardi, Pragati Jaiswal, Tewodros Amberbir Habtegebrial, Christen Millerdurai, Shaoxiang Wang, Alain Pagani, Didier Stricker

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) RPTU(鲁尔大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TalkingPose通过反馈引导扩散模型实现高效的人体上半身动画生成,支持无限持续时间的连贯动画创作。

Comments WACV 2026, Project page available at https://dfki-av.github.io/TalkingPose

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00677 2025-12-02 cs.CV cs.AI 79%

Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer

Dynamic-eDiTor: 基于文本的无训练4D场景编辑与多模态扩散变换器

Dong In Lee, Hyungjun Doh, Seunggeun Chi, Runlin Duan, Sangpil Kim, Karthik Ramani

机构 * Purdue University(普渡大学) Korea University(韩国大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Dynamic-eDiTor通过多模态扩散变换器和4DGS实现无训练文本驱动的4D场景编辑,提升多视图和时间一致性。

Comments 4D Scene Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12547 2025-12-02 cs.CV 79%

HiGFA: Hierarchical Guidance for Fine-grained Data Augmentation with Diffusion Models

HiGFA: 基于扩散模型的细粒度数据增强的分层引导

Zhiguang Lu, Qianqian Xu, Peisong Wen, Siran Dai, Qingming Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HiGFA通过分层引导和动态置信度调节,提升细粒度数据增强的合成图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10209 2025-12-02 cs.CV 79%

LiNeXt: Revisiting LiDAR Completion with Efficient Non-Diffusion Architectures

LiNeXt:重新审视基于高效非扩散架构的LiDAR补全

Wenzhe He, Xiaojun Chen, Ruiqi Wang, Ruihui Li, Huilong Pi, Jiapeng Zhang, Zhuo Tang, Kenli Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LiNeXt通过高效非扩散架构实现快速准确的LiDAR点云补全,提升实时性能并减少计算开销。

Comments 18 pages, 13 figures, Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08819 2025-12-02 eess.IV cs.CV 79%

Boosting Diffusion Guidance via Learning Degradation-Aware Models for Blind Super Resolution

通过学习降质感知模型提升扩散引导:用于盲超分辨率

Shao-Hao Lu, Ren Wang, Ching-Chun Huang, Wei-Chen Chiu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DADiff,通过学习降质感知模型提升扩散引导,解决盲超分辨率中的降质核依赖问题,实现高保真结果。

Comments To appear in WACV 2025. Code is available at: https://github.com/ryanlu2240/DADiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00350 2025-12-02 eess.IV cs.AI cs.CV cs.LG 79%

MedCondDiff: Lightweight, Robust, Semantically Guided Diffusion for Medical Image Segmentation

MedCondDiff: 轻量、稳健、语义引导的扩散模型用于医学图像分割

Ruirui Huang, Jiacheng Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MedCondDiff通过语义引导的扩散模型实现高效、稳健的多器官医学图像分割,适用于多种成像模态和解剖区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00261 2025-12-02 cs.CV 79%

UniDiff: Parameter-Efficient Adaptation of Diffusion Models for Land Cover Classification with Multi-Modal Remotely Sensed Imagery and Sparse Annotations

UniDiff: 用于多模态遥感影像和稀疏标注的土地覆盖分类的扩散模型参数高效适应

Yuzhen Hu, Saurabh Prasad

机构 * University of Houston(休斯敦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniDiff通过参数高效的方法适应扩散模型,实现多模态遥感数据在稀疏标注下的有效分类与融合。

Comments Camera-ready for WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00094 2025-12-02 cs.CR cs.CV 79%

HMARK: Radioactive Multi-Bit Semantic-Latent Watermarking for Diffusion Models

HMARK: 放射性多比特语义-潜在水印用于扩散模型

Kexin Li, Guozhen Ding, Ilya Grishchenko, David Lie

机构 * University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HMARK通过在扩散模型的语义-潜在空间中编码所有权信息,实现多比特水印,以检测和防止未经授权的数据训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00078 2025-12-02 cs.CV cs.AI 79%

Diffusion-Based Synthetic Brightfield Microscopy Images for Enhanced Single Cell Detection

基于扩散的合成明场显微镜图像用于增强单细胞检测

Mario de Jesus da Graca, Jörg Dahlkemper, Peer Stelldinger

机构 * Synentec GmbH, Elmshorn, Germany(Synentec GmbH,埃尔姆霍恩,德国) Faculty of Computer Science and Digital Society(计算机科学与数字社会学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用扩散模型生成合成明场显微镜图像,通过实验表明合成数据可提升单细胞检测精度,减少人工标注依赖,提高模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01981 2025-12-02 cond-mat.soft physics.bio-ph 78%

Orientational lineage memory and mechanical ordering during diffusion-limited growth

取向族系记忆与机械有序性在扩散受限生长中的作用

Ilias-Marios Sarris, Ramin Golestianian, Philip Bittihn

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究揭示了在扩散受限生长中,取向族系记忆与机械有序性如何通过细胞扩展和机械相互作用共同塑造集体组织。

Comments 12 pages, 4 figures, 1 supplementary figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01828 2025-12-02 math.PR 78%

Heterogeneous diffusion process with power-law nonlinearity

具有幂律非线性的异质扩散过程

Jorge E. Cardona, Ilya Pavlyukevich

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了具有幂律非线性的异质扩散过程,通过非线性变换将解表示为斜贝塞尔过程。

Comments 23 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01820 2025-12-02 stat.ML cs.LG math.PR math.ST stat.TH 78%

Dimension-free error estimate for diffusion model and optimal scheduling

扩散模型的无维误差估计与最优调度

Valentin de Bortoli, Romuald Elie, Anna Kazeykina, Zhenjie Ren, Jiacheng Zhang

机构 * Google DeepMind(谷歌DeepMind) Université Paris Saclay(巴黎萨克雷大学) Université Evry - Paris Saclay(埃夫里-巴黎萨克雷大学) Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种无维误差界,用于评估扩散模型生成与真实数据分布的差异,并通过变分问题推导出最优时间调度策略以减少离散化误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09913 2025-12-02 math.NA cs.NA 78%

A streamline upwind/Petrov-Galerkin method for the magnetic advection-diffusion problem

一种用于磁流体输运-扩散问题的流线迎风/佩罗夫-加勒金方法

Haochen Li, Yangfan Luo, Jindong Wang, Shuonan Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种用于磁流体输运-扩散问题的SUPG方法,通过引入提升算子和离散磁流体输运算子,建立了稳定化项并推导了最优误差估计。

详情

展开后加载摘要…

URL PDF HTML 收藏