arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-24 至 2026-02-24 共收录 93 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 93 篇

2509.25162 2026-02-24 cs.CV 85%

AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models

AlignTok: 将预训练视觉编码器对齐到分词器以用于扩散模型

Bowei Chen, Sai Bi, Hao Tan, He Zhang, Tianyuan Zhang, Zhengqi Li, Yuanjun Xiong, Jianming Zhang, Kai Zhang

机构 * University of Washington(华盛顿大学) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 AlignTok通过将预训练视觉编码器对齐为分词器,提升扩散模型的生成质量和收敛速度,适用于图像生成任务。

Comments ICLR 2026, Project Page: https://aligntok.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19706 2026-02-24 cs.CV 83%

HDR Reconstruction Boosting with Training-Free and Exposure-Consistent Diffusion

通过无训练和曝光一致的扩散实现HDR重建增强

Yo-Tin Lin, Su-Kai Chen, Hou-Ning Hu, Yen-Yu Lin, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) MediaTek Inc.(联发科公司)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 通过无训练和曝光一致的扩散技术提升HDR重建效果,增强过曝区域的图像质量并保持多曝光一致性。

Comments WACV 2026. Project page: https://github.com/EusdenLin/HDR-Reconstruction-Boosting

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06751 2026-02-24 cs.CV 83%

OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot

OBS-Diff: 高精度扩散模型的一次性剪枝

Junhan Zhu, Hesong Wang, Mingluo Su, Zefang Wang, Huan Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 OBS-Diff通过引入时间步感知Hessian构造和高效分组顺序剪枝策略,实现了扩散模型的一次性精准剪枝,提升推理效率并保持视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18799 2026-02-24 cs.CV 83%

Rethinking Preference Alignment for Diffusion Models with Classifier-Free Guidance

重新思考扩散模型的偏好对齐:基于分类器自由引导

Zhou Jiang, Yandong Wen, Zhen Liu

机构 * Westlake University(西湖大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于分类器自由引导的方法,通过分解偏好学习为两个模块并生成对比引导向量,提升扩散模型对人类偏好的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18589 2026-02-24 eess.IV cs.AI cs.CV 83%

DM4CT: Benchmarking Diffusion Models for Computed Tomography Reconstruction

DM4CT:用于计算机断层扫描重建的扩散模型基准测试

Jiayang Shi, Daniel M. Pelt, K. Joost Batenburg

机构 * LIACS, Leiden University(莱顿大学LIACS) Centrum Wiskunde en Informatica(数学与信息学研究中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DM4CT通过对比不同方法在CT重建中的表现,评估扩散模型在实际应用中的有效性与局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08011 2026-02-24 cs.AI 82%

Training-Free Safe Denoisers for Safe Use of Diffusion Models

无需训练的安全去噪器用于安全使用扩散模型

Mingyu Kim, Dongjun Kim, Amman Yusuf, Stefano Ermon, Mijung Park

机构 * CS, UBC(计算机科学系,不列颠哥伦比亚大学) CS, Standford(计算机科学系,斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出无需训练的无训练安全去噪器,通过修改采样轨迹避免不安全数据区域,提升扩散模型的安全使用。

Comments NeurIPS2025, Code: https://github.com/MingyuKim87/Safe_Denoiser

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10040 2026-02-24 cs.RO 82%

Diffusion Trajectory-guided Policy for Long-horizon Robot Manipulation

用于长时程机器人操作的扩散轨迹引导策略

Shichao Fan, Quantao Yang, Yajie Liu, Kun Wu, Zhengping Che, Qingjie Liu, Min Wan

机构 * School of Mechanical Engineering and Automation, BeiHang University(机械工程与自动化学院,北航) School of Computer Science and Engineering, BeiHang University(计算机科学与工程学院,北航) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Division of Robotics, Perception and Learning (RPL), KTH Royal Institute of Technology(机器人、感知与学习 division,皇家理工学院)

专题命中 扩散模型 :diffusion(title,abstract);generative vision(abstract)

AI总结 本文提出DTP框架,通过生成轨迹减少模仿学习中的误差累积,提升长时程机器人任务的性能。

Comments 8 pages, 5 figures, accepted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 12, December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15500 2026-02-24 stat.ML cs.AI cs.LG math.ST stat.TH 82%

Low-Dimensional Adaptation of Rectified Flow: A Diffusion and Stochastic Localization Perspective

修正流的低维适应:从扩散和随机定位视角

Saptarshi Roy, Alessandro Rinaldo, Purnamrita Sarkar

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文提出一种基于修正流的低维适应采样方法,通过时间离散化方案和随机定位理论,提升采样效率和精度。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19931 2026-02-24 cs.LG cs.CV 79%

Expanding the Role of Diffusion Models for Robust Classifier Training

扩展扩散模型在鲁棒分类器训练中的作用

Pin-Han Huang, Shang-Tse Chen, Hsuan-Tien Lin

机构 * National Taiwan University(国立台湾大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究通过扩展扩散模型在对抗训练中的作用,发现其内部表示能提升鲁棒分类器的训练效果,并验证了扩散表示与合成数据的互补作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19512 2026-02-24 cs.LG cs.CV 79%

Variational Trajectory Optimization of Anisotropic Diffusion Schedules

变分轨迹优化非各向同性扩散计划

Pengxi Liu, Zeyu Michael Li, Xiang Cheng

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Duke University(杜克大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于变分轨迹优化的非各向同性扩散模型,通过矩阵值路径优化噪声计划,提升扩散模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19506 2026-02-24 cs.CV cs.LG 79%

Relational Feature Caching for Accelerating Diffusion Transformers

关系特征缓存用于加速扩散变换器

Byunggwan Son, Jeimin Jeon, Jeongwoo Choi, Bumsub Ham

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology (KIST)(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出关系特征缓存(RFC)方法,通过利用输入-输出关系提升特征预测准确性,有效减少扩散变换器的计算开销。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19180 2026-02-24 cs.CV 79%

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19064 2026-02-24 cs.CV 79%

L3DR: 3D-aware LiDAR Diffusion and Rectification

L3DR:基于3D感知的LiDAR扩散与校正

Quan Liu, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 L3DR通过3D-aware的LiDAR扩散和校正框架,在3D空间中消除RV伪影并恢复局部几何结构,实现更真实的3D几何生成。

Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15082 2026-02-24 cs.SD cs.AI cs.MM 79%

S-PRESSO: Ultra Low Bitrate Sound Effect Compression With Diffusion Autoencoders And Offline Quantization

S-PRESSO:基于扩散自编码器和离线量化的小 bitrate 声音效果压缩

Zineb Lahrichi, Gaëtan Hadjeres, Gaël Richard, Geoffroy Peeters

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 S-PRESSO通过扩散自编码器和离线量化,在极低bitrate下实现高质量声音效果压缩。

Journal ref International Conference on Acoustics, Speech, and Signal Processing (ICASSP), May 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05571 2026-02-24 cs.CV 79%

MedDIFT: Multi-Scale Diffusion-Based Correspondence in 3D Medical Imaging

MedDIFT:3D医学影像中的多尺度扩散对应方法

Xingyu Zhang, Anna Reithmeir, Fryderyk Kögl, Rickmer Braren, Julia A. Schnabel, Daniel M. Lang

机构 * 1 School of Computation, Information Technology, Technical University of Munich 2 Institute of Machine Learning in Biomedical Imaging, Helmholtz Munich 3 Munich Center for Machine Learning (MCML) 4 Institute for Diagnostic Interventional Radiology, Klinkum Rechts der Isar 5 School of Biomedical Engineering \& Imaging Sciences, King’s College London

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MedDIFT通过多尺度扩散特征融合实现无需训练的3D医学影像对应,有效提升解剖结构匹配精度。

Comments Updated results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05016 2026-02-24 cs.CV 79%

Generative Neural Video Compression via Video Diffusion Prior

基于视频扩散先验的生成神经视频压缩

Qi Mao, Hao Cheng, Tinghan Yang, Libiao Jin, Siwei Ma

机构 * School of Information and Communication Engineering, Communication University of China(信息与通信工程学院,通信大学) School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GNVC-VD通过结合视频扩散先验和序列级去噪,实现了高效的生成神经视频压缩,显著减少了闪烁伪影并提升了感知质量。

Comments accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19166 2026-02-24 cs.MM 79%

Step-Aware Residual-Guided Diffusion for EEG Spatial Super-Resolution

步感知残差引导扩散用于EEG空间超分辨率

Hongjun Liu, Leyu Zhou, Zijianghao Yang, Chao Yao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 SRGDiff通过步感知残差引导扩散模型,提升EEG空间超分辨率的保真度与一致性,实现高达40%的性能提升。

Comments ICLR 2026 Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23377 2026-02-24 cs.CV cs.AI cs.SD eess.AS 79%

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

JavisDiT:具有层次化时空先验同步的联合音频视频扩散变换器

Kai Liu, Wei Li, Lai Chen, Shengqiong Wu, Yanhao Zheng, Jiayi Ji, Fan Zhou, Jiebo Luo, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 JavisDiT通过层次化时空先验同步机制,实现了高质量的音频视频同步生成,解决了现实场景中的同步评估问题。

Comments Accepted by ICLR 2026. Homepage: https://javisverse.github.io/JavisDiT-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18874 2026-02-24 cs.CV cs.AI 79%

Structure-Level Disentangled Diffusion for Few-Shot Chinese Font Generation

结构层面解耦的扩散模型用于少样本中文字体生成

Jie Li, Suorong Yang, Jian Zhao, Furao Shen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(人工智能学院) Department of Computer Science and Technology, Nanjing University, China(计算机科学与技术系) School of Electronic Science and Engineering, Nanjing University, China(电子科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SLD-Font通过结构层面解耦和参数高效微调,实现少样本中文字体生成中更高的风格保真度和内容准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20126 2026-02-24 cs.LG cs.IT math.IT math.ST stat.ML stat.TH 78%

Adaptation to Intrinsic Dependence in Diffusion Language Models

适应内在依赖性在扩散语言模型中

Yunxiao Zhao, Changxiao Cai

机构 * Department of Industrial and Operations Engineering, University of Michigan(工业与运营工程系,密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种分布无关的解屏蔽计划,使扩散语言模型能够适应目标数据分布的内在依赖结构,从而提升采样效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20057 2026-02-24 cs.RO cs.AI 78%

AdaWorldPolicy: World-Model-Driven Diffusion Policy with Online Adaptive Learning for Robotic Manipulation

AdaWorldPolicy:基于世界模型的扩散策略与在线自适应学习的机器人操控

Ge Yuan, Qiyuan Qiao, Jing Zhang, Dong Xu

机构 * The University of Hong Kong(香港大学) Beihang University(北航大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 AdaWorldPolicy通过结合世界模型和在线自适应学习,实现机器人操控的高效动态适应。

Comments Homepage: https://AdaWorldPolicy.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19980 2026-02-24 cs.LG 78%

Discrete Diffusion Models Exploit Asymmetry to Solve Lookahead Planning Tasks

离散扩散模型利用不对称性解决前瞻规划任务

Itamar Trainin, Shauli Ravfogel, Omri Abend, Amir Feder

机构 * Hebrew University of Jerusalem(耶路撒冷希伯来大学) New York University(纽约大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 离散扩散模型通过反向生成机制在无需复杂遍历机制的情况下解决前瞻规划任务,相比自回归模型更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19801 2026-02-24 math.AP physics.ao-ph 78%

Local well-posedness of strong solutions to the non-isentropic compressible primitive equations with vertical diffusion

非等熵可压缩原始方程组中垂直扩散的强解局部适定性

Rupert Klein, Jinkai Li, Xin Liu, Edriss S. Titi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了非等熵可压缩原始方程组在仅含垂直扩散且无重力情况下的局部适定性,证明了强解的局部存在性、唯一性及对初始数据的连续依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19685 2026-02-24 cs.LG cs.AI 78%

PerturbDiff: Functional Diffusion for Single-Cell Perturbation Modeling

PerturbDiff: 基于功能扩散的单细胞扰动建模

Xinyu Yuan, Xixian Liu, Ya Shi Zhang, Zuobai Zhang, Hongyu Guo, Jian Tang

机构 * Department of XXX, University of YYY, Location, Country School of ZZZ, Institute of WWW, Location, Country Mila - Qu\'ebec AI Institute University of Montr\'eal University of Ottawa National Research Council of Canada CIFAR AI Chair

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PerturbDiff通过基于扩散的生成过程,实现了对单细胞扰动响应的高精度建模与预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19538 2026-02-24 cs.RO cs.AI cs.LG 78%

Cost-Aware Diffusion Active Search

面向成本的扩散主动搜索

Arundhati Banerjee, Jeff Schneider

机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的主动搜索方法,通过序列建模能力采样动作序列,实现高效成本感知决策,提升目标恢复率。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19522 2026-02-24 eess.SP cs.SD 78%

An LLM-Enabled Frequency-Aware Flow Diffusion Model for Natural-Language-Guided Power System Scenario Generation

基于LLM的频率感知流扩散模型:用于自然语言引导的电力系统场景生成

Zhenghao Zhou, Yiyan Li, Fei Xie, Lu Wang, Bo Wang, Jiansheng Wang, Zheng Yan, Mo-Yuen Chow

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出LLM赋能的频率感知流扩散模型,通过自然语言引导生成多样可控的电力系统场景,提升生成效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19488 2026-02-24 econ.GN q-fin.EC 78%

The dynamics of innovation diffusion: A survey of Bass-type models

创新扩散的动力学:Bass型模型的综述

Nicolas Langrené, Rui Liu, Xiangqin Wu, Tianhao Zhi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文综述了Bass型模型在创新扩散研究中的发展,涵盖模型扩展、参数估计方法及替代模型,揭示了该领域近几十年的研究进展。

Comments 26 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19153 2026-02-24 cond-mat.mtrl-sci cs.AI cs.LG 78%

Constrained Diffusion for Accelerated Structure Relaxation of Inorganic Solids with Point Defects

具有点缺陷的无机固体加速结构弛豫的约束扩散

Jingyi Cui, Jacob K. Christopher, Ankita Biswas, Prasanna V. Balachandran, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种约束扩散模型,用于高效模拟具有点缺陷的无机固体结构弛豫,提升第一性原理模拟的效率和准确性。

Comments Appeared in the NeurIPS 2025 Workshop on AI for Accelerated Material Design (AI4Mat)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19657 2026-02-24 cs.CL cs.AI 78%

One Token Is Enough: Improving Diffusion Language Models with a Sink Token

一个标记足矣:通过sink标记改进扩散语言模型

Zihou Zhang, Zheyong Xie, Li Zhong, Haifeng Liu, Yao Hu, Shaosheng Cao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过引入额外的sink标记,改进扩散语言模型的稳定性与性能,该标记具有低语义内容且位置无关,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04972 2026-02-24 physics.optics 78%

A diffusion model for light scattering in ejecta

用于喷射物中光散射的扩散模型

J. A. Don Jayamanne, J. -R. Burie, O. Durand, R. Pierrat, R. Carminati

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种用于喷射物中光散射的扩散模型,相较于辐射传输方程更易处理,并用于分析PDV测量中的深多重散射光谱图。

Journal ref J. Appl. Phys. 138, 203102 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏