arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70196 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70196 篇

2512.22288 2025-12-30 cs.LG cs.AI cs.CV 79%

Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model

Co-GRPO:针对掩码扩散模型的协同优化组相对策略优化

Renping Zhou, Zanlin Ni, Tianyi Chen, Zeyu Liu, Yang Yue, Yulin Wang, Yuxuan Wang, Jingshu Liu, Gao Huang

机构 * Leap Lab, Tsinghua University(清华大学 leap 实验室) Anyverse Dynamics

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Co-GRPO通过协同优化模型和调度参数提升掩码扩散模型的生成质量。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22237 2025-12-30 cs.CV cs.AI 79%

Meta-information Guided Cross-domain Synergistic Diffusion Model for Low-dose PET Reconstruction

元信息引导的跨领域协同扩散模型用于低剂量PET重建

Mengxiao Geng, Ran Hong, Xiaoling Xu, Bingxuan Li, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出元信息引导的跨领域协同扩散模型,通过整合跨模态先验知识提升低剂量PET重建质量与生理细节保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22209 2025-12-30 eess.IV cs.AI cs.CV 79%

Super-Resolution Enhancement of Medical Images Based on Diffusion Model: An Optimization Scheme for Low-Resolution Gastric Images

基于扩散模型的医学图像超分辨率增强:一种用于低分辨率胃部图像的优化方案

Haozhe Jia

机构 * Boston University(波士顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的超分辨率增强方法,用于提升低分辨率胃部图像的质量,通过SR3框架实现更稳定的训练和更高的结构保真度。

Comments 19 pages, 16 figures. Undergraduate final year project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22175 2025-12-30 cs.CV cs.AI eess.IV 79%

Characterizing Motion Encoding in Video Diffusion Timesteps

视频扩散时间步中的运动编码表征

Vatsal Baherwani, Yixuan Ren, Abhinav Shrivastava

机构 * University of Maryland(马里兰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文通过分析视频扩散模型中时间步的运动与外观编码特性,发现早期时间步主导运动,后期主导外观,并提出受限于运动主导阶段的运动定制方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07984 2025-12-30 cs.CV 79%

View Selection for 3D Captioning via Diffusion Ranking

通过扩散排名进行3D描述生成的视图选择

Tiange Luo, Justin Johnson, Honglak Lee

机构 * University of Michigan LG AI Research(密歇根大学LG人工智能研究)

专题命中 扩散模型 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DiffuRank方法,通过评估3D物体与2D视图的对齐度,提升3D描述生成的准确性与细节,同时扩展数据集规模并优于CLIP模型。

Comments Dataset link: https://huggingface.co/datasets/tiange/Cap3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21905 2025-12-29 cs.CV 79%

High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer

高保真长时长人类图像动画

Shen Zheng, Jiaran Cai, Yuansheng Guan, Shenneng Huang, Xingpei Ma, Junjie Cao, Hanfeng Zhao, Qiang Zhang, Shunsi Zhang, Xiao-Ping Zhang

机构 * Guangzhou Quwan Network Technology(广州 quirwan 网络技术公司) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散变压器的框架,通过混合引导信号和位置移适应模块,实现高保真长时长人类图像动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21797 2025-12-29 cs.CV 79%

Diffusion Posterior Sampling for Super-Resolution under Gaussian Measurement Noise

在高斯测量噪声下用于超分辨率的扩散后验采样

Abu Hanif Muhammad Syarubany

机构 * Korea Advanced Institute of Science \& Technology (KAIST) Daejeon, South Korea

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种在高斯噪声下通过扩散后验采样实现超分辨率的方法,通过优化指导尺度和噪声水平提升重建质量,平衡先验与梯度强度以获得稳定高质量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21514 2025-12-29 cs.CV cs.AI 79%

DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO

DiverseGRPO: 通过多样性感知的GRPO缓解图像生成中的模式崩溃

Henglin Liu, Huijuan Huang, Jing Wang, Chang Liu, Xiu Li, Xiangyang Ji

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 扩散模型 :image generation(title,abstract);分类 cs.CV

AI总结 DiverseGRPO通过引入分布性创造力奖励和结构感知正则化,提升图像生成的多样性与质量平衡。

Comments Project Page: https://henglin-liu.github.io/DiverseGRPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21118 2025-12-25 cs.LG cs.AI cs.CV 79%

STLDM: Spatio-Temporal Latent Diffusion Model for Precipitation Nowcasting

STLDM:用于降水现在预测的时空潜在扩散模型

Shi Quan Foo, Chi-Ho Wong, Zhihan Gao, Dit-Yan Yeung, Ka-Hing Wong, Wai-Kin Wong

机构 * The Hong Kong University of Science and Technology(香港科技大学) Hong Kong Observatory(香港天文台)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 STLDM通过结合变分自编码器和条件网络,提出了一种基于扩散的模型,用于提升降水现在预测的精度和效率。

Comments Accepted by TMLR. Camera-ready submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20436 2025-12-24 eess.IV cs.AI cs.CV 79%

Dual-Encoder Transformer-Based Multimodal Learning for Ischemic Stroke Lesion Segmentation Using Diffusion MRI

基于双编码变压器的多模态学习用于扩散磁共振成像的缺血性中风病变分割

Muhammad Usman, Azka Rehman, Muhammad Mutti Ur Rehman, Abd Ur Rehman, Muhammad Umar Farooq

机构 * Department of Anesthesiology, Perioperative and Pain Medicine, Stanford University(麻醉学、围术期与疼痛医学系,斯坦福大学) Department of Biomedical Sciences, Seoul National University(生物医学科学系,首尔国立大学) Department of Computer Engineering, National University of Sciences and Technology (NUST)(计算机工程系,国立科学与技术大学(NUST)) Department of Computer Science, The University of Alabama(计算机科学系,阿拉巴马大学) Department of Computer Science, Hanyang University(计算机科学系,翰阳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出双编码变压器架构,利用多模态扩散MRI实现缺血性中风病变分割,达到85.4%的Dice分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18200 2025-12-24 eess.IV cs.CV 79%

SLIM: Semantic-based Low-bitrate Image compression for Machines by leveraging diffusion

SLIM: 基于语义的低比特率图像压缩用于机器视觉通过利用扩散

Hyeonjin Lee, Jun-Hyuk Kim, Jong-Seok Lee

机构 * School of Integrated Technology, Yonsei University(延世大学整合技术学院) Department of Artificial Intelligence, Chung-Ang University(Chung-Ang 大学人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SLIM通过利用扩散技术,提出了一种基于语义的低比特率图像压缩方法,专注于机器视觉中的感兴趣区域,实现高效压缩与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19678 2025-12-23 cs.CV cs.AI 79%

WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion

WorldWarp: 通过异步视频扩散传播3D几何

Hanyang Kong, Xingyi Yang, Xiaoxu Zheng, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WorldWarp通过结合3D结构锚和2D生成细化器,利用时空扩散模型实现几何一致的视频生成,解决遮挡和复杂轨迹问题。

Comments Project page: https://hyokong.github.io/worldwarp-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19584 2025-12-23 eess.IV cs.CV physics.med-ph 79%

Patlak Parametric Image Estimation from Dynamic PET Using Diffusion Model Prior

基于扩散模型先验的动态PET参数图像估计

Ziqian Huang, Boxiao Yu, Siqi Li, Savas Ozdemir, Sangjin Bae, Jae Sung Lee, Guobao Wang, Kuang Gong

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(J. Crayton Pruitt家族生物医学工程系,佛罗里达大学) Department of Radiology, University of Florida(放射学系,佛罗里达大学) Interdisciplinary Program in Bioengineering, Seoul National University(生物工程跨学科项目,首尔国立大学) Department of Nuclear Medicine, Seoul National University College of Medicine(核医学系,首尔国立大学医学院) Department of Radiology, University of California Davis Health(放射学系,加州大学戴维斯医学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的动态PET参数图像估计框架,利用Patlak模型提升图像质量。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18843 2025-12-23 cs.CV 79%

Brain-Gen: Towards Interpreting Neural Signals for Stimulus Reconstruction Using Transformers and Latent Diffusion Models

Brain-Gen: 向利用Transformer和潜在扩散模型解释神经信号以实现刺激重建

Hasib Aslam, Muhammad Talal Faiz, Muhammad Imran Malik

机构 * School of Electrical Engineering and Computer Science, National University of Sciences and Technology (NUST)(电气工程与计算机科学学院,国立科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Brain-Gen通过结合Transformer和潜在扩散模型,从EEG信号中提取空间-时间表示,实现对视觉刺激的重建,提升了EEG信号的语义解释能力。

Comments 21 pages and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18814 2025-12-23 cs.CV 79%

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

EchoMotion: 通过双模态扩散变换器实现统一的人体视频与运动生成

Yuxiao Yang, Hualian Sheng, Sijia Cai, Jing Lin, Jiahao Wang, Bing Deng, Junzhe Lu, Haoqian Wang, Jieping Ye

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Nanyang Technology University(南阳技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EchoMotion通过双模态扩散变换器统一生成人体视频与运动,提升复杂人类动作视频的连贯性与合理性。

Comments 26 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12159 2025-12-23 cs.CV 79%

DPL: Spatial-Conditioned Diffusion Prototype Enhancement for One-Shot Medical Segmentation

DPL:基于扩散的原型增强用于单次医疗分割

Ziyuan Gao, Philippe Morel

机构 * University College London(伦敦大学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DPL通过扩散增强和空间感知条件机制,提升单次医疗图像分割的原型表示能力,实现更鲁棒的泛化性能。

Comments Accepted at IVCNZ 2025. To be published in IEEE proceedings

Journal ref 2025 40th International Conference on Image and Vision Computing New Zealand (IVCNZ), IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12538 2025-12-23 eess.IV cs.CV 79%

High Frequency Matters: Uncertainty Guided Image Compression with Wavelet Diffusion

高频至关重要:基于小波扩散的不确定性引导图像压缩

Juan Song, Jiaxiang He, Lijie Yang, Mingtao Feng, Keyan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于小波扩散的不确定性引导图像压缩方法,通过高频压缩和残差编解码器提升图像压缩的保真度和效率。

Comments Revised version for IEEE TMM submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18241 2025-12-23 cs.CV 79%

SG-RIFE: Semantic-Guided Real-Time Intermediate Flow Estimation with Diffusion-Competitive Perceptual Quality

SG-RIFE:基于语义的实时中间流估计与扩散竞争感知质量

Pan Ben Wong, Chengli Wu, Hanyue Lu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SG-RIFE通过引入语义引导的微调策略和模块,实现了在实时条件下超越扩散方法的感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18007 2025-12-23 cs.RO cs.CV 79%

Robotic VLA Benefits from Joint Learning with Motion Image Diffusion

机器人VLA通过与运动图像扩散的联合学习获益

Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, Mingyu Ding, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。

Comments Website: https://vla-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12691 2025-12-23 cs.LG cs.AI cs.CV 79%

DiffEM: Learning from Corrupted Data with Diffusion Models via Expectation Maximization

DiffEM: 通过期望最大化从损坏数据中学习扩散模型

Danial Hosseintabar, Fan Chen, Giannis Daras, Antonio Torralba, Constantinos Daskalakis

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffEM通过期望最大化从损坏数据中学习扩散模型,利用条件扩散模型重建干净数据并优化模型参数,有效提升图像重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12898 2025-12-23 cs.LG cs.AI cs.CV cs.RO 79%

Vidar: Embodied Video Diffusion Model for Generalist Manipulation

Vidar:面向通用操作的具身视频扩散模型

Yao Feng, Hengkai Tan, Xinyi Mao, Chendong Xiang, Guodong Liu, Shuhe Huang, Hang Su, Jun Zhu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Vidar通过具身视频扩散模型和掩码逆动力学模型,实现了在不同机器人形态上的通用操作,仅需少量人类演示即可超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04262 2025-12-23 cs.CV 79%

Bridging Geometry-Coherent Text-to-3D Generation with Multi-View Diffusion Priors and Gaussian Splatting

弥合几何一致性文本到3D生成与多视图扩散先验和高斯点云

Feng Yang, Wenliang Qian, Wangmeng Zuo, Hui Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出耦合分数蒸馏框架,通过多视图联合分布先验和高斯点云优化,实现几何一致的文本到3D生成。

Comments Accepted by Neural Networks. The final published version is available at https://doi.org/10.1016/j.neunet.2025.108511

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17675 2025-12-22 cs.CV cs.AI 79%

An Empirical Study of Sampling Hyperparameters in Diffusion-Based Super-Resolution

扩散基超分辨率中采样超参数的实证研究

Yudhistira Arief Wibowo

机构 * Technical University of Munich(慕尼黑技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究通过实证分析发现,在扩散模型超分辨率中,条件步长对性能影响显著大于扩散步数,最佳步长范围为[2.0, 3.0]。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17323 2025-12-22 cs.CV 79%

DESSERT: Diffusion-based Event-driven Single-frame Synthesis via Residual Training

DESSERT: 基于扩散的事件驱动单帧合成 via 剩余训练

Jiyun Kong, Jun-Hyuk Kim, Jong-Seok Lee

机构 * Yonsei University(延世大学) Chung-Ang University(Chung-Ang 大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DESSERT通过基于扩散的剩余训练方法,实现了更清晰且时间一致的事件驱动单帧合成,优于现有多种视频帧预测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17253 2025-12-22 cs.CV 79%

Mitty: Diffusion-based Human-to-Robot Video Generation

Mitty:基于扩散的Human-to-Robot视频生成

Yiren Song, Cheng Liu, Weijia Mao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Mitty通过基于扩散的变换器实现端到端的人机视频生成,利用预训练模型和双向注意力机制,无需动作标签或中间抽象,生成高质量的机器人执行视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05814 2025-12-22 eess.IV cs.CV 79%

MSDiff: Multi-Scale Diffusion Model for Ultra-Sparse View CT Reconstruction

MSDiff:多尺度扩散模型用于超稀疏视角CT重建

Junyan Zhang, Mengxiao Geng, Pinhuang Tan, Yi Liu, Zhili Liu, Bin Huang, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MSDiff通过多尺度扩散模型提升超稀疏视角CT重建质量,整合全面与选择性采样技术,优化噪声分布与图像结构理解,实现更高效的图像恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12019 2025-12-22 cs.CV 79%

LN3DIFF++: Scalable Latent Neural Fields Diffusion for Speedy 3D Generation

LN3DIFF++: 可扩展的潜在神经场扩散用于快速3D生成

Yushi Lan, Fangzhou Hong, Shangchen Zhou, Shuai Yang, Xuyi Meng, Yongwei Chen, Zhaoyang Lyu, Bo Dai, Xingang Pan, Chen Change Loy

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LN3DIFF++通过3D感知架构和变分自编码器实现快速高质量的3D生成,优于现有方法在推理速度和生成质量上。

Comments TPAMI 2025 version of LN3Diff. Project webpage: https://nirvanalan.github.io/projects/ln3diff/ Code: https://github.com/NIRVANALAN/LN3Diff

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13107 2025-12-19 cs.CV cs.AI 79%

Diffusion-Based Restoration for Multi-Modal 3D Object Detection in Adverse Weather

基于扩散的多模态3D物体检测在恶劣天气中的修复

Zhijian He, Feifei Liu, Yuwei Li, Zhanpeng Luo, Jintao Cheng, Xieyuanli Chen, Xiaoyu Tang

机构 * School of Xingzhi College, South China Normal University(星智学院,华南师范大学) College of Big Data and Internet, Shenzhen Technology University(大数据与互联网学院,深圳科技大学) School of Data Science and Engineering, Xingzhi College, South China Normal University(数据科学与工程学院,星智学院,华南师范大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科技大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffFusion通过基于扩散的修复和自适应跨模态融合,提升多模态3D物体检测在恶劣天气中的鲁棒性与清洁数据性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16219 2025-12-19 cs.CV eess.IV 79%

Learning High-Quality Initial Noise for Single-View Synthesis with Diffusion Models

基于扩散模型的学习高质量初始噪声用于单视图合成

Zhihao Zhang, Xuejun Yang, Weihua Liu, Mouquan Shen

机构 * College of Electrical Engineering and Control Science, Nanjing Tech University(电气工程与控制科学学院,南京理工大学) Yongjiang Laboratory(永江实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于编码器-解码器网络的框架,通过注入图像语义信息将随机噪声转换为高质量噪声,提升单视图合成性能。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16075 2025-12-19 cs.CV cs.LG 79%

FOD-Diff: 3D Multi-Channel Patch Diffusion Model for Fiber Orientation Distribution

FOD-Diff: 3D多通道补丁扩散模型用于纤维方向分布

Hao Tang, Hanyu Liu, Alessandro Perelli, Xi Chen, Chao Li

机构 * University of Dundee(邓迪大学) University of Bath(巴斯大学) University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FOD-Diff通过3D多通道补丁扩散模型,高效生成HAR-FOD,提升白质完整性表征的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏