arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2512.23232 2025-12-30 cs.CV 79%

SURE Guided Posterior Sampling: Trajectory Correction for Diffusion-Based Inverse Problems

SURE引导的后验采样:基于扩散模型的逆问题轨迹校正

Minwoo Kim, Hongki Lim

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SURE引导的后验采样通过减少误差累积提升扩散模型在逆问题中的重建质量,实现更高效的样本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22881 2025-12-30 cs.CV 79%

Guided Path Sampling: Steering Diffusion Models Back on Track with Principled Path Guidance

引导路径采样:通过原理性路径引导将扩散模型重新引导到正确轨道

Haosen Li, Wenshuo Chen, Shaofeng Liang, Lei Wang, Haozhe Jia, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Griffith University\&Data61/CSIRO(格里菲斯大学与Data61/CSIRO)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 引导路径采样通过原理性路径引导提升扩散模型的稳定性和生成质量,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21734 2025-12-30 cs.CV 79%

Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animation

结绳强制:驯服自回归视频扩散模型以实现实时无限交互肖像动画

Steven Xiao, Xindi Zhang, Dechao Meng, Qi Wang, Peng Zhang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Knot Forcing通过分块生成、时间结模块和提前运行机制,解决实时肖像动画中的时间一致性、误差累积和长期一致性问题,实现高保真、低延迟的无限交互动画。

Comments Project Page: https://humanaigc.github.io/knot_forcing_demo_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19823 2025-12-30 cs.CV 79%

Learning to Refocus with Video Diffusion Models

利用视频扩散模型学习重聚焦

SaiKiran Tedla, Zhoutong Zhang, Xuaner Zhang, Shumian Xin

机构 * Adobe, USA \& York University Canada Adobe USA Adobe, USA \& York University Adobe

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型实现拍摄后重聚焦,生成感知准确的焦点堆栈,提升日常摄影的聚焦编辑能力。

Comments Code and data are available at https://learn2refocus.github.io . SIGGRAPH Asia 2025, Dec. 2025

Journal ref Proceedings of the SIGGRAPH Asia 2025, pp. 1-11, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00019 2025-12-30 eess.IV cs.CV cs.LG 79%

Diffusion MRI with Machine Learning

利用机器学习的扩散磁共振成像

Davood Karimi, Simon K. Warfield

机构 * Harvard Medical School and Boston Children’s Hospital(哈佛医学院和波士顿儿童医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文探讨了机器学习在扩散磁共振成像分析中的应用,评估了现有方法的优缺点,并提出了未来研究的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22324 2025-12-30 cs.CV 79%

DeMoGen: Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models

DeMoGen:基于能量扩散模型的分解式人类动作生成

Jianrong Zhang, Hehe Fan, Yi Yang

机构 * ReLER, AAII, University of Technology Sydney(技术悉尼大学) CCAI, Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DeMoGen通过能量扩散模型实现动作分解生成,提出三种训练变体以促进动作分解学习,并构建文本分解数据集支持组合训练。

Comments Project page: https://jiro-zhang.github.io/DeMoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22288 2025-12-30 cs.LG cs.AI cs.CV 79%

Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model

Co-GRPO:针对掩码扩散模型的协同优化组相对策略优化

Renping Zhou, Zanlin Ni, Tianyi Chen, Zeyu Liu, Yang Yue, Yulin Wang, Yuxuan Wang, Jingshu Liu, Gao Huang

机构 * Leap Lab, Tsinghua University(清华大学 leap 实验室) Anyverse Dynamics

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Co-GRPO通过协同优化模型和调度参数提升掩码扩散模型的生成质量。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22237 2025-12-30 cs.CV cs.AI 79%

Meta-information Guided Cross-domain Synergistic Diffusion Model for Low-dose PET Reconstruction

元信息引导的跨领域协同扩散模型用于低剂量PET重建

Mengxiao Geng, Ran Hong, Xiaoling Xu, Bingxuan Li, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出元信息引导的跨领域协同扩散模型,通过整合跨模态先验知识提升低剂量PET重建质量与生理细节保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22209 2025-12-30 eess.IV cs.AI cs.CV 79%

Super-Resolution Enhancement of Medical Images Based on Diffusion Model: An Optimization Scheme for Low-Resolution Gastric Images

基于扩散模型的医学图像超分辨率增强:一种用于低分辨率胃部图像的优化方案

Haozhe Jia

机构 * Boston University(波士顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的超分辨率增强方法,用于提升低分辨率胃部图像的质量,通过SR3框架实现更稳定的训练和更高的结构保真度。

Comments 19 pages, 16 figures. Undergraduate final year project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22175 2025-12-30 cs.CV cs.AI eess.IV 79%

Characterizing Motion Encoding in Video Diffusion Timesteps

视频扩散时间步中的运动编码表征

Vatsal Baherwani, Yixuan Ren, Abhinav Shrivastava

机构 * University of Maryland(马里兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文通过分析视频扩散模型中时间步的运动与外观编码特性,发现早期时间步主导运动,后期主导外观,并提出受限于运动主导阶段的运动定制方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07984 2025-12-30 cs.CV 79%

View Selection for 3D Captioning via Diffusion Ranking

通过扩散排名进行3D描述生成的视图选择

Tiange Luo, Justin Johnson, Honglak Lee

机构 * University of Michigan LG AI Research(密歇根大学LG人工智能研究)

专题命中 扩散模型 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DiffuRank方法,通过评估3D物体与2D视图的对齐度,提升3D描述生成的准确性与细节,同时扩展数据集规模并优于CLIP模型。

Comments Dataset link: https://huggingface.co/datasets/tiange/Cap3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21905 2025-12-29 cs.CV 79%

High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer

高保真长时长人类图像动画

Shen Zheng, Jiaran Cai, Yuansheng Guan, Shenneng Huang, Xingpei Ma, Junjie Cao, Hanfeng Zhao, Qiang Zhang, Shunsi Zhang, Xiao-Ping Zhang

机构 * Guangzhou Quwan Network Technology(广州 quirwan 网络技术公司) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散变压器的框架,通过混合引导信号和位置移适应模块,实现高保真长时长人类图像动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21797 2025-12-29 cs.CV 79%

Diffusion Posterior Sampling for Super-Resolution under Gaussian Measurement Noise

在高斯测量噪声下用于超分辨率的扩散后验采样

Abu Hanif Muhammad Syarubany

机构 * Korea Advanced Institute of Science \& Technology (KAIST) Daejeon, South Korea

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种在高斯噪声下通过扩散后验采样实现超分辨率的方法,通过优化指导尺度和噪声水平提升重建质量,平衡先验与梯度强度以获得稳定高质量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21514 2025-12-29 cs.CV cs.AI 79%

DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO

DiverseGRPO: 通过多样性感知的GRPO缓解图像生成中的模式崩溃

Henglin Liu, Huijuan Huang, Jing Wang, Chang Liu, Xiu Li, Xiangyang Ji

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 扩散模型 :image generation(title,abstract);分类 cs.CV

AI总结 DiverseGRPO通过引入分布性创造力奖励和结构感知正则化,提升图像生成的多样性与质量平衡。

Comments Project Page: https://henglin-liu.github.io/DiverseGRPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21118 2025-12-25 cs.LG cs.AI cs.CV 79%

STLDM: Spatio-Temporal Latent Diffusion Model for Precipitation Nowcasting

STLDM:用于降水现在预测的时空潜在扩散模型

Shi Quan Foo, Chi-Ho Wong, Zhihan Gao, Dit-Yan Yeung, Ka-Hing Wong, Wai-Kin Wong

机构 * The Hong Kong University of Science and Technology(香港科技大学) Hong Kong Observatory(香港天文台)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 STLDM通过结合变分自编码器和条件网络,提出了一种基于扩散的模型,用于提升降水现在预测的精度和效率。

Comments Accepted by TMLR. Camera-ready submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20436 2025-12-24 eess.IV cs.AI cs.CV 79%

Dual-Encoder Transformer-Based Multimodal Learning for Ischemic Stroke Lesion Segmentation Using Diffusion MRI

基于双编码变压器的多模态学习用于扩散磁共振成像的缺血性中风病变分割

Muhammad Usman, Azka Rehman, Muhammad Mutti Ur Rehman, Abd Ur Rehman, Muhammad Umar Farooq

机构 * Department of Anesthesiology, Perioperative and Pain Medicine, Stanford University(麻醉学、围术期与疼痛医学系,斯坦福大学) Department of Biomedical Sciences, Seoul National University(生物医学科学系,首尔国立大学) Department of Computer Engineering, National University of Sciences and Technology (NUST)(计算机工程系,国立科学与技术大学(NUST)) Department of Computer Science, The University of Alabama(计算机科学系,阿拉巴马大学) Department of Computer Science, Hanyang University(计算机科学系,翰阳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出双编码变压器架构,利用多模态扩散MRI实现缺血性中风病变分割,达到85.4%的Dice分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18200 2025-12-24 eess.IV cs.CV 79%

SLIM: Semantic-based Low-bitrate Image compression for Machines by leveraging diffusion

SLIM: 基于语义的低比特率图像压缩用于机器视觉通过利用扩散

Hyeonjin Lee, Jun-Hyuk Kim, Jong-Seok Lee

机构 * School of Integrated Technology, Yonsei University(延世大学整合技术学院) Department of Artificial Intelligence, Chung-Ang University(Chung-Ang 大学人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SLIM通过利用扩散技术,提出了一种基于语义的低比特率图像压缩方法,专注于机器视觉中的感兴趣区域,实现高效压缩与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19678 2025-12-23 cs.CV cs.AI 79%

WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion

WorldWarp: 通过异步视频扩散传播3D几何

Hanyang Kong, Xingyi Yang, Xiaoxu Zheng, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WorldWarp通过结合3D结构锚和2D生成细化器,利用时空扩散模型实现几何一致的视频生成,解决遮挡和复杂轨迹问题。

Comments Project page: https://hyokong.github.io/worldwarp-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19584 2025-12-23 eess.IV cs.CV physics.med-ph 79%

Patlak Parametric Image Estimation from Dynamic PET Using Diffusion Model Prior

基于扩散模型先验的动态PET参数图像估计

Ziqian Huang, Boxiao Yu, Siqi Li, Savas Ozdemir, Sangjin Bae, Jae Sung Lee, Guobao Wang, Kuang Gong

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(J. Crayton Pruitt家族生物医学工程系,佛罗里达大学) Department of Radiology, University of Florida(放射学系,佛罗里达大学) Interdisciplinary Program in Bioengineering, Seoul National University(生物工程跨学科项目,首尔国立大学) Department of Nuclear Medicine, Seoul National University College of Medicine(核医学系,首尔国立大学医学院) Department of Radiology, University of California Davis Health(放射学系,加州大学戴维斯医学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的动态PET参数图像估计框架,利用Patlak模型提升图像质量。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18843 2025-12-23 cs.CV 79%

Brain-Gen: Towards Interpreting Neural Signals for Stimulus Reconstruction Using Transformers and Latent Diffusion Models

Brain-Gen: 向利用Transformer和潜在扩散模型解释神经信号以实现刺激重建

Hasib Aslam, Muhammad Talal Faiz, Muhammad Imran Malik

机构 * School of Electrical Engineering and Computer Science, National University of Sciences and Technology (NUST)(电气工程与计算机科学学院,国立科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Brain-Gen通过结合Transformer和潜在扩散模型,从EEG信号中提取空间-时间表示,实现对视觉刺激的重建,提升了EEG信号的语义解释能力。

Comments 21 pages and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18814 2025-12-23 cs.CV 79%

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

EchoMotion: 通过双模态扩散变换器实现统一的人体视频与运动生成

Yuxiao Yang, Hualian Sheng, Sijia Cai, Jing Lin, Jiahao Wang, Bing Deng, Junzhe Lu, Haoqian Wang, Jieping Ye

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Nanyang Technology University(南阳技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EchoMotion通过双模态扩散变换器统一生成人体视频与运动,提升复杂人类动作视频的连贯性与合理性。

Comments 26 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12159 2025-12-23 cs.CV 79%

DPL: Spatial-Conditioned Diffusion Prototype Enhancement for One-Shot Medical Segmentation

DPL:基于扩散的原型增强用于单次医疗分割

Ziyuan Gao, Philippe Morel

机构 * University College London(伦敦大学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DPL通过扩散增强和空间感知条件机制,提升单次医疗图像分割的原型表示能力,实现更鲁棒的泛化性能。

Comments Accepted at IVCNZ 2025. To be published in IEEE proceedings

Journal ref 2025 40th International Conference on Image and Vision Computing New Zealand (IVCNZ), IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12538 2025-12-23 eess.IV cs.CV 79%

High Frequency Matters: Uncertainty Guided Image Compression with Wavelet Diffusion

高频至关重要:基于小波扩散的不确定性引导图像压缩

Juan Song, Jiaxiang He, Lijie Yang, Mingtao Feng, Keyan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于小波扩散的不确定性引导图像压缩方法,通过高频压缩和残差编解码器提升图像压缩的保真度和效率。

Comments Revised version for IEEE TMM submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18241 2025-12-23 cs.CV 79%

SG-RIFE: Semantic-Guided Real-Time Intermediate Flow Estimation with Diffusion-Competitive Perceptual Quality

SG-RIFE:基于语义的实时中间流估计与扩散竞争感知质量

Pan Ben Wong, Chengli Wu, Hanyue Lu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SG-RIFE通过引入语义引导的微调策略和模块,实现了在实时条件下超越扩散方法的感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18007 2025-12-23 cs.RO cs.CV 79%

Robotic VLA Benefits from Joint Learning with Motion Image Diffusion

机器人VLA通过与运动图像扩散的联合学习获益

Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, Mingyu Ding, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。

Comments Website: https://vla-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12691 2025-12-23 cs.LG cs.AI cs.CV 79%

DiffEM: Learning from Corrupted Data with Diffusion Models via Expectation Maximization

DiffEM: 通过期望最大化从损坏数据中学习扩散模型

Danial Hosseintabar, Fan Chen, Giannis Daras, Antonio Torralba, Constantinos Daskalakis

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffEM通过期望最大化从损坏数据中学习扩散模型,利用条件扩散模型重建干净数据并优化模型参数,有效提升图像重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12898 2025-12-23 cs.LG cs.AI cs.CV cs.RO 79%

Vidar: Embodied Video Diffusion Model for Generalist Manipulation

Vidar:面向通用操作的具身视频扩散模型

Yao Feng, Hengkai Tan, Xinyi Mao, Chendong Xiang, Guodong Liu, Shuhe Huang, Hang Su, Jun Zhu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Vidar通过具身视频扩散模型和掩码逆动力学模型,实现了在不同机器人形态上的通用操作,仅需少量人类演示即可超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04262 2025-12-23 cs.CV 79%

Bridging Geometry-Coherent Text-to-3D Generation with Multi-View Diffusion Priors and Gaussian Splatting

弥合几何一致性文本到3D生成与多视图扩散先验和高斯点云

Feng Yang, Wenliang Qian, Wangmeng Zuo, Hui Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出耦合分数蒸馏框架,通过多视图联合分布先验和高斯点云优化,实现几何一致的文本到3D生成。

Comments Accepted by Neural Networks. The final published version is available at https://doi.org/10.1016/j.neunet.2025.108511

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17675 2025-12-22 cs.CV cs.AI 79%

An Empirical Study of Sampling Hyperparameters in Diffusion-Based Super-Resolution

扩散基超分辨率中采样超参数的实证研究

Yudhistira Arief Wibowo

机构 * Technical University of Munich(慕尼黑技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究通过实证分析发现,在扩散模型超分辨率中,条件步长对性能影响显著大于扩散步数,最佳步长范围为[2.0, 3.0]。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17323 2025-12-22 cs.CV 79%

DESSERT: Diffusion-based Event-driven Single-frame Synthesis via Residual Training

DESSERT: 基于扩散的事件驱动单帧合成 via 剩余训练

Jiyun Kong, Jun-Hyuk Kim, Jong-Seok Lee

机构 * Yonsei University(延世大学) Chung-Ang University(Chung-Ang 大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DESSERT通过基于扩散的剩余训练方法,实现了更清晰且时间一致的事件驱动单帧合成,优于现有多种视频帧预测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏