arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70196 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70196 篇

2512.04385 2025-12-05 cs.LG cs.AI cs.CV 79%

STeP-Diff: Spatio-Temporal Physics-Informed Diffusion Models for Mobile Fine-Grained Pollution Forecasting

STeP-Diff:用于移动细粒污染预报的时空物理指导扩散模型

Nan Zhou, Weijie Hong, Huandong Wang, Jianfeng Zheng, Qiuhua Wang, Yali Song, Xiao-Ping Zhang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Department of Electronic Engineering, Beijing National Research Center for Information Science and Tech- nology (BNRist), Tsinghua University, China(电子工程系,北京信息科学与技术国家研究中心(BNRist),清华大学) Shenzhen Smartcity Communication, Shenzhen, China(深圳智慧城市通信) College of Soil and Water Conservation, Southwest Forestry University, China(水土保持学院,西南林业大学) College of Civil Engineering, Southwest Forestry University, China(土木工程学院,西南林业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 STeP-Diff通过结合DeepONet和PDE指导的扩散模型,有效提升移动细粒污染预报的精度与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22622 2025-12-05 cs.CV 79%

Zero4D: Training-Free 4D Video Generation From Single Video Using Off-the-Shelf Video Diffusion

Zero4D: 无需训练的单视频生成4D视频

Jangho Park, Taesung Kwon, Jong Chul Ye

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Zero4D通过无需训练的视频扩散模型,将单视频扩展为多视角4D视频,保持空间时间一致性。

Comments project page: https://zero4dvid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03673 2025-12-04 cs.CV 79%

ConvRot: Rotation-Based Plug-and-Play 4-bit Quantization for Diffusion Transformers

ConvRot:基于旋转的插拔式4位量化用于扩散变换器

Feice Huang, Zuliang Han, Xing Zhou, Yihuang Chen, Lifei Zhu, Haoqian Wang

机构 * SIGS, Tsinghua University(清华大学信号与信息系) Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ConvRot提出基于旋转的4位量化方法,通过正则Hadamard变换抑制异常值,实现扩散变换器的插拔式W4A4推理,提升速度和内存效率同时保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19499 2025-12-04 cs.CV cs.AI 79%

Sat2Flow: A Structure-Aware Diffusion Framework for Human Flow Generation from Satellite Imagery

Sat2Flow: 一种结构感知的扩散框架,用于从卫星图像生成人类流量

Xiangxu Wang, Tianhong Zhao, Wei Tu, Bowen Zhang, Guanzhou Chen, Jinzhou Cao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Sat2Flow通过结构感知的扩散框架,利用卫星图像生成结构一致的OD流量,解决了现有方法对辅助数据依赖和空间拓扑变化敏感的问题。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14430 2025-12-04 cs.CV cs.AI cs.PF 79%

PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference

PipeFusion: 基于扩散变换器推理的片级流水线并行

Jiarui Fang, Jinzhe Pan, Aoyu Li, Xibo Sun, Jiannan Wang

机构 * ByteDance(字节跳动) HUST(华中科技大学) Tencent(腾讯) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PipeFusion通过片级流水线并行方法,提高扩散变换器推理的效率和性能,适用于大模型如Flux.1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03451 2025-12-04 cs.CV cs.AI cs.LG 79%

GalaxyDiT: Efficient Video Generation with Guidance Alignment and Adaptive Proxy in Diffusion Transformers

GalaxyDiT:通过引导对齐和自适应代理实现高效的视频生成

Zhiye Song, Steve Dai, Ben Keller, Brucek Khailany

机构 * Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GalaxyDiT通过引导对齐和自适应代理选择,提升视频生成效率,实现高达2.37倍的速度提升并保持高质量输出

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03450 2025-12-04 cs.CV cs.LG 79%

KeyPointDiffuser: Unsupervised 3D Keypoint Learning via Latent Diffusion Models

KeyPointDiffuser: 通过潜在扩散模型实现无监督的3D关键点学习

Rhys Newbury, Juyan Zhang, Tin Tran, Hanna Kurniawati, Dana Kulić

机构 * Monash University(蒙纳士大学) Australian National University(澳大利亚国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 KeyPointDiffuser通过潜在扩散模型实现无监督3D关键点学习,提升关键点一致性6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03430 2025-12-04 cs.CV 79%

Label-Efficient Hyperspectral Image Classification via Spectral FiLM Modulation of Low-Level Pretrained Diffusion Features

通过低级预训练扩散特征的光谱FiLM调制实现标签高效的超光谱图像分类

Yuzhen Hu, Biplab Banerjee, Saurabh Prasad

机构 * University of Houston, Texas, USA(德克萨斯大学) Indian Institute of Technology Bombay, Mumbai, India(印度班加罗尔理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于预训练扩散模型的标签高效超光谱图像分类方法,通过光谱FiLM调制融合空间和光谱信息,提升分类性能。

Comments Accepted to the ICML 2025 TerraBytes Workshop (June 9, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03317 2025-12-04 cs.CV cs.AI cs.LG cs.RO 79%

NavMapFusion: Diffusion-based Fusion of Navigation Maps for Online Vectorized HD Map Construction

NavMapFusion: 基于扩散的导航地图融合用于在线向量化的高精度地图构建

Thomas Monninger, Zihan Zhang, Steffen Staab, Sihao Ding

机构 * Mercedes-Benz Research & Development North America, USA(梅赛德斯-奔驰北美研究与开发) University of Stuttgart, Germany(斯图加特大学) University of California, San Diego, USA(加州大学圣地亚哥分校) University of Southampton, United Kingdom(南安普顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 NavMapFusion通过结合低保真先验与高保真传感器数据,利用扩散模型实现在线高精度地图构建,提升环境表示的准确性和实时性。

Comments Accepted to 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03045 2025-12-03 cs.CV 79%

CAMEO: Correspondence-Attention Alignment for Multi-View Diffusion Models

CAMEO:多视图扩散模型中的对应-注意力对齐

Minkyung Kwon, Jinhyeok Choi, Jiho Park, Seonghu Jeon, Jinhyuk Jang, Junyoung Seo, Minseop Kwak, Jin-Hwa Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) NAVER AI Lab(NAVER人工智能实验室) SNU AIIS(延世大学人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CAMEO通过几何对应监督注意力图,提升多视图扩散模型的训练效率和生成质量。

Comments Project page: https://cvlab-kaist.github.io/CAMEO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02681 2025-12-03 cs.CV 79%

PGP-DiffSR: Phase-Guided Progressive Pruning for Efficient Diffusion-based Image Super-Resolution

PGP-DiffSR: 基于相位引导的渐进剪枝用于高效的扩散式图像超分辨率

Zhongbao Yang, Jiangxin Dong, Yazhou Yao, Jinhui Tang, Jinshan Pan

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PGP-DiffSR通过基于相位信息的渐进剪枝和相位交换适配器模块,实现高效的扩散式图像超分辨率,减少计算和内存消耗同时保持高质量恢复。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02536 2025-12-03 cs.CV 79%

WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

WeMMU: 通过噪声查询标记增强视觉-语言模型与扩散模型的桥梁

Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) ZheJiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WeMMU通过噪声查询标记和VAE分支,提升视觉-语言模型与扩散模型的连接效率,缓解泛化崩溃问题,实现稳定持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02339 2025-12-03 cs.CV cs.AI 79%

Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision

视频扩散模型在无监督情况下能有效追踪相似外观的对象

Chenshuang Zhang, Kang Zhang, Joon Son Chung, In So Kweon, Junmo Kim, Chengzhi Mao

机构 * KAIST(韩国科学技术院) Rutgers University(罗格斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用预训练视频扩散模型的运动表示能力,实现无监督环境下对视觉相似对象的高效追踪,提升了追踪性能并克服了现有方法的局限。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02088 2025-12-03 eess.IV cs.AI cs.CV cs.LG 79%

Comparing Baseline and Day-1 Diffusion MRI Using Multimodal Deep Embeddings for Stroke Outcome Prediction

比较基线和第1天扩散磁共振成像用于中风预后预测的多模态深度嵌入

Sina Raeisadigh, Myles Joshua Toledo Tan, Henning Müller, Abderrahmane Hedjoudje

机构 * 1 Department of Computer Science, University of Geneva, Switzerland 2 Department of Electrical \& Computer Engineering, University of Florida, FL, USA 3 Service of Medical Informatics, University Hospital of Geneva, Switzerland 4 Department of Imaging Medical Informatics, University of Geneva, Switzerland

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究通过多模态深度嵌入方法,利用基线和治疗后1天的扩散MRI数据,结合临床特征和病变体积,预测急性缺血性中风患者3个月的功能预后。

Comments 5 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04979 2025-12-03 cs.CV 79%

Steering One-Step Diffusion Model with Fidelity-Rich Decoder for Fast Image Compression

通过高保真解码器引导单步扩散模型实现快速图像压缩

Zheng Chen, Mingde Zhou, Jinpei Guo, Jiale Yuan, Yifei Ji, Yulun Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SODEC通过单步扩散模型和高保真解码器实现快速图像压缩,显著提升压缩效率和保真度

Comments Accepted to AAAI 2026. Code is available at: https://github.com/zhengchen1999/SODEC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01975 2025-12-02 cs.CV 79%

SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning

SGDiff: 基于场景图引导的扩散模型用于图像协作分割与描述

Xu Zhang, Jin Yuan, Hanwang Zhang, Guojin Zhong, Yongsheng Zang, Jiacheng Lin, Zhiyong Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SGDiff通过基于场景图引导的扩散模型,实现从简单提示到多样化描述与掩码对的图像协作分割与描述任务,提升语义对齐与灵活结果选择能力。

Comments Accept by AAAI-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01533 2025-12-02 cs.CV cs.AI 79%

Diffusion Fuzzy System: Fuzzy Rule Guided Latent Multi-Path Diffusion Modeling

扩散模糊系统:基于模糊规则的潜在多路径扩散建模

Hailong Yang, Te Zhang, Kup-sze Choi, Zhaohong Deng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出扩散模糊系统,通过模糊规则引导的多路径扩散建模,提升图像生成的稳定性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23127 2025-12-02 cs.CV 79%

DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation

DualCamCtrl: 基于双分支扩散模型的几何感知摄像机控制视频生成

Hongfei Zhang, Kanghao Chen, Zixin Zhang, Harold Haodong Chen, Yuanhuiyi Lyu, Yuqi Zhang, Shuai Yang, Kun Zhou, Yingcong Chen

机构 * HKUST (GZ)(香港科技大学) HKUST(香港科技大学) Fudan University(复旦大学) Shenzhen University(深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DualCamCtrl通过双分支扩散模型实现几何感知的摄像机控制视频生成,有效提升视频生成的一致性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08711 2025-12-02 cs.CV 79%

Harnessing Diffusion-Generated Synthetic Images for Fair Image Classification

利用扩散生成的合成图像实现公平的图像分类

Abhipsa Basu, Aviral Gupta, Abhijnya Bhat, R. Venkatesh Babu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用扩散模型微调技术生成组平衡数据,以提升图像分类的公平性,实验表明其在去偏效果上优于现有方法。

Comments Accepted to AAAI AISI Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00412 2025-12-02 cs.CV cs.LG 79%

CraftSVG: Multi-Object Text-to-SVG Synthesis via Layout Guided Diffusion

CraftSVG: 通过布局引导扩散实现多对象文本到SVG合成

Ayan Banerjee, Nityanand Mathur, Josep Llados, Umapada Pal, Anjan Dutta

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心) Smallest AI Indian Statistical Institute, Kolkata(印度统计研究所) Institute for People Centred Artificial Intelligence, University of Surrey(以人为中心的人工智能研究所,萨里大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SVGCraft通过布局引导扩散模型实现多对象文本到SVG合成,提升场景生成的抽象性、可识别性和细节表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01481 2025-12-02 cs.CV 79%

ChronosObserver: Taming 4D World with Hyperspace Diffusion Sampling

ChronosObserver: 用超空间扩散采样驯服4D世界

Qisen Wang, Yifan Zhao, Peisen Shen, Jialu Li, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ChronosObserver通过超空间表示和引导采样,实现无需训练的高质量多视角时间同步视频生成,解决4D世界生成难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01422 2025-12-02 cs.CV 79%

MDiff4STR: Mask Diffusion Model for Scene Text Recognition

MDiff4STR:用于场景文本识别的掩码扩散模型

Yongkun Du, Miaomiao Zhao, Songlin Fan, Zhineng Chen, Caiyan Jia, Yu-Gang Jiang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MDiff4STR通过改进的掩码扩散模型在场景文本识别中实现更高的准确性和快速推断。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01252 2025-12-02 cs.LG cs.CV 79%

Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe

扩散混合专家模型的高效训练:一种实用配方

Yahui Liu, Yang Yue, Jingyuan Zhang, Chenxi Sun, Yang Zhou, Wencong Zeng, Ruiming Tang, Guorui Zhou

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种高效训练扩散混合专家模型的方法,通过优化架构配置提升模型性能,提供实用且高效的训练方案。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00909 2025-12-02 cs.CV 79%

TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion Model

TalkingPose: 基于反馈引导扩散模型的高效人脸与手势动画

Alireza Javanmardi, Pragati Jaiswal, Tewodros Amberbir Habtegebrial, Christen Millerdurai, Shaoxiang Wang, Alain Pagani, Didier Stricker

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) RPTU(鲁尔大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TalkingPose通过反馈引导扩散模型实现高效的人体上半身动画生成,支持无限持续时间的连贯动画创作。

Comments WACV 2026, Project page available at https://dfki-av.github.io/TalkingPose

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00677 2025-12-02 cs.CV cs.AI 79%

Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer

Dynamic-eDiTor: 基于文本的无训练4D场景编辑与多模态扩散变换器

Dong In Lee, Hyungjun Doh, Seunggeun Chi, Runlin Duan, Sangpil Kim, Karthik Ramani

机构 * Purdue University(普渡大学) Korea University(韩国大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Dynamic-eDiTor通过多模态扩散变换器和4DGS实现无训练文本驱动的4D场景编辑,提升多视图和时间一致性。

Comments 4D Scene Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12547 2025-12-02 cs.CV 79%

HiGFA: Hierarchical Guidance for Fine-grained Data Augmentation with Diffusion Models

HiGFA: 基于扩散模型的细粒度数据增强的分层引导

Zhiguang Lu, Qianqian Xu, Peisong Wen, Siran Dai, Qingming Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HiGFA通过分层引导和动态置信度调节,提升细粒度数据增强的合成图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10209 2025-12-02 cs.CV 79%

LiNeXt: Revisiting LiDAR Completion with Efficient Non-Diffusion Architectures

LiNeXt:重新审视基于高效非扩散架构的LiDAR补全

Wenzhe He, Xiaojun Chen, Ruiqi Wang, Ruihui Li, Huilong Pi, Jiapeng Zhang, Zhuo Tang, Kenli Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LiNeXt通过高效非扩散架构实现快速准确的LiDAR点云补全,提升实时性能并减少计算开销。

Comments 18 pages, 13 figures, Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08819 2025-12-02 eess.IV cs.CV 79%

Boosting Diffusion Guidance via Learning Degradation-Aware Models for Blind Super Resolution

通过学习降质感知模型提升扩散引导:用于盲超分辨率

Shao-Hao Lu, Ren Wang, Ching-Chun Huang, Wei-Chen Chiu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DADiff,通过学习降质感知模型提升扩散引导,解决盲超分辨率中的降质核依赖问题,实现高保真结果。

Comments To appear in WACV 2025. Code is available at: https://github.com/ryanlu2240/DADiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00350 2025-12-02 eess.IV cs.AI cs.CV cs.LG 79%

MedCondDiff: Lightweight, Robust, Semantically Guided Diffusion for Medical Image Segmentation

MedCondDiff: 轻量、稳健、语义引导的扩散模型用于医学图像分割

Ruirui Huang, Jiacheng Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MedCondDiff通过语义引导的扩散模型实现高效、稳健的多器官医学图像分割,适用于多种成像模态和解剖区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00261 2025-12-02 cs.CV 79%

UniDiff: Parameter-Efficient Adaptation of Diffusion Models for Land Cover Classification with Multi-Modal Remotely Sensed Imagery and Sparse Annotations

UniDiff: 用于多模态遥感影像和稀疏标注的土地覆盖分类的扩散模型参数高效适应

Yuzhen Hu, Saurabh Prasad

机构 * University of Houston(休斯敦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniDiff通过参数高效的方法适应扩散模型,实现多模态遥感数据在稀疏标注下的有效分类与融合。

Comments Camera-ready for WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏