arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-02 至 2026-03-02 共收录 54 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2602.13585 2026-03-02 cs.CV 88%

Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation

Diff-Aid: 修复文本到图像生成中的推理时间自适应交互去噪

Binglei Li, Mengping Yang, Zhiyu Tan, Junping Zhang, Hao Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 Diff-Aid通过自适应调整文本与图像交互提升文本到图像生成质量,提供可解释的调节模式并支持下游应用改进。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00445 2026-03-02 cs.CV 79%

AutoDebias: Automated Framework for Debiasing Text-to-Image Models

AutoDebias:文本到图像模型的自动化去偏框架

Hongyi Cai, Mohammad Mahdinur Rahman, Mingkang Dong, Muxin Pu, Moqyad Alqaily, Jie Li, Xinfeng Li, Jialie Shen, Meikang Qiu, Qingsong Wen

机构 * Universiti Malaya(马来大学) Monash University(莫纳什大学) United Arab Emirates University(阿拉伯联合酋长国大学) University of Science and Technology Beijing(北京科技大学) Nanyang Technological University (NTU)(南洋理工大学) City St George’s, University of London(伦敦大学圣乔治学院) Augusta University(奥古斯塔大学) Squirrel Ai Learning

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 AutoDebias提出了一种自动化框架,用于检测和减轻文本到图像模型中的恶意偏见,通过视觉语言模型和CLIP引导的训练过程,有效应对隐秘注入的刻板印象和多重攻击。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2505.23907 2026-03-02 cs.CV 88%

Cora: Correspondence-aware image editing using few step diffusion

Cora: 基于对应关系的图像编辑使用少量步骤扩散

Amirhossein Alimohammadi, Aryan Mikaeili, Sauradip Nag, Negar Hassanpour, Andrea Tagliasacchi, Ali Mahdavi-Amiri

机构 * Simon Fraser University(西蒙弗雷泽大学) Huawei(华为) University of Toronto(多伦多大学) Google Deepmind(谷歌DeepMind)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 Cora通过引入对应关系感知的噪声校正和插值注意力图,实现了在少量步骤下精准的图像编辑,有效保持结构、纹理和身份,优于现有方法。

Comments Published in SIGGRAPH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21778 2026-03-02 cs.CV 83%

From Statics to Dynamics: Physics-Aware Image Editing with Latent Transition Priors

从静态到动态:基于物理的图像编辑与潜在过渡先验

Liangbing Zhao, Le Zhuo, Sayak Paul, Hongsheng Li, Mohamed Elhoseiny

机构 * CUHK MMLab(香港中文大学多模态实验室)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出PhysicEdit,通过引入物理状态过渡和大规模数据集,提升图像编辑的物理真实性和知识引导能力,达到开源方法的新水平。

Comments All code, checkpoints, and datasets are available at https://liangbingzhao.github.io/statics2dynamics/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 40 篇

2602.12769 2026-03-02 cs.CV 89%

PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion

PixelRush: 通过一步扩散实现超快、无训练高分辨率图像生成

Hong-Phuc Lai, Phong Nguyen, Anh Tran

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 PixelRush通过一步扩散实现超快无训练高分辨率图像生成,生成4K图像速度提升10-35倍,保持高质量输出。

Comments Accepted to CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23847 2026-03-02 eess.IV cs.CV 83%

Polarization Uncertainty-Guided Diffusion Model for Color Polarization Image Demosaicking

极化不确定性引导的扩散模型用于颜色极化图像重建

Chenggong Li, Yidong Luo, Junchao Zhang, Degui Yang

机构 * footnotemark: 1(机构1)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种极化不确定性引导的扩散模型,用于提高颜色极化图像重建的精度和视觉效果。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24208 2026-03-02 cs.CV cs.LG 79%

SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching

SenCache: 通过敏感性感知缓存加速扩散模型推理

Yasaman Haghighi, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SenCache通过敏感性感知缓存策略,提升扩散模型推理效率与视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24043 2026-03-02 cs.CV 79%

Spatio-Temporal Garment Reconstruction Using Diffusion Mapping via Pattern Coordinates

基于模式坐标扩散映射的时空服装重建

Yingxuan You, Ren Li, Corentin Dumery, Cong Cao, Hao Li, Pascal Fua

机构 * CVLab, École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL)计算机视觉实验室) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Pinscreen and Mohamed bin Zayed University of Artificial Intelligence(Pinscreen和马尔代夫人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于模式坐标扩散映射的时空服装重建方法,结合隐式缝合模式与生成扩散模型,实现高保真3D服装重建,适用于虚拟试穿和动画等领域。

Comments arXiv admin note: text overlap with arXiv:2504.08353

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24013 2026-03-02 cs.CV 79%

Ordinal Diffusion Models for Color Fundus Images

序数扩散模型用于彩色视网膜图像

Gustav Schmidt, Philipp Berens, Sarah Müller

机构 * Hertie Institute for AI in Brain Health, University of T\"ubingen, Germany

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出序数潜在扩散模型,用于生成具有连续严重程度结构的彩色视网膜图像,通过标量疾病表示实现相邻阶段的平滑过渡,提升了生成质量与临床一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08552 2026-03-02 cs.LG cs.CV 79%

Confronting Reward Overoptimization for Diffusion Models: A Perspective of Inductive and Primacy Biases

对抗扩散模型中的奖励过度优化:从归纳偏置和优先偏置的角度出发

Ziyi Zhang, Sen Zhang, Yibing Zhan, Yong Luo, Yonggang Wen, Dacheng Tao

机构 * Institute of Artificial Intelligence, School of Computer Science, Wuhan University, China Hubei Luojia Laboratory, Wuhan, China The University of Sydney, Australia JD Explore Academy, Beijing, China Nanyang Technological University, Singapore

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TDPO-R算法,通过利用扩散模型的时间归纳偏置和抑制活跃神经元的优先偏置,有效缓解奖励过度优化问题。

Comments Accepted to ICML 2024

Journal ref International Conference on Machine Learning, pp. 60396-60413, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23447 2026-03-02 eess.IV cs.AI cs.CV cs.LG 79%

SALIENT: Frequency-Aware Paired Diffusion for Controllable Long-Tail CT Detection

SALIENT: 用于可控长尾CT检测的频率感知配对扩散

Yifan Li, Mehrdad Salimitari, Taiyu Zhang, Guang Li, David Dreizin

机构 * Trauma Radiology AI Laboratory (TRAIL)(创伤放射AI实验室) Department of Radiology and Nuclear Medicine(放射科与核医学科) University of Maryland School of Medicine(马里兰大学医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SALIENT通过频率感知的配对扩散方法,在长尾CT检测中实现可控且高效的增强,提升生成真实性并改善检测性能。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24083 2026-03-02 cs.LG math.PR stat.ML 78%

Neural Diffusion Intensity Models for Point Process Data

神经扩散强度模型用于点过程数据

Xinlong Du, Harsha Honnappa, Vinayak Rao

机构 * Edwardson School of Industrial Engineering, Purdue University(普渡大学工业工程系) Department of Statistics, Purdue University(普渡大学统计系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 神经扩散强度模型通过神经SDE驱动的变分框架,实现对点过程数据的高效后验推断与强度动态恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23968 2026-03-02 cs.LG 78%

Learning Generation Orders for Masked Discrete Diffusion Models via Variational Inference

通过变分推断学习掩码离散扩散模型的生成顺序

David Fox, Sam Bowyer, Song Liu, Laurence Aitchison, Raul Santos-Rodriguez, Mengyue Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于变分推断的学习框架,用于优化掩码离散扩散模型的并行生成顺序,通过实验展示了其在生成效率与质量上的竞争力。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23792 2026-03-02 cs.CL 78%

Divide and Conquer: Accelerating Diffusion-Based Large Language Models via Adaptive Parallel Decoding

分而治之:通过自适应并行解码加速扩散式大语言模型

Xiangzhong Luo, Yilin An, Zhicheng Yu, Weichen Liu, Xu Yang

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DiCo通过分而治之的自适应并行解码方法,提升扩散式大语言模型的推理速度并保持生成质量。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23737 2026-03-02 cs.LG cs.AI 78%

Bridging Dynamics Gaps via Diffusion Schrödinger Bridge for Cross-Domain Reinforcement Learning

通过扩散薛定谔桥跨领域强化学习弥合动态缺口

Hanping Zhang, Yuhong Guo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 BDGxRL通过扩散薛定谔桥对齐源域与目标域动态,利用离线演示实现跨领域强化学习策略学习,优于现有基线并具备强适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23715 2026-03-02 math.AP math.DS 78%

On $L^{\infty }$-estimates and the structure of the global attractor for weak solutions of reaction-diffusion equations

关于 $L^{\infty }$-估计和弱解反应扩散方程全局吸引子的结构

Rubén Caballero, Piotr Kalita, José Valero

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过Moser-Alikakos迭代法研究了反应扩散方程弱解的 $L^{\infty }$ 估计,并改进了全局吸引子的结构及维数估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23662 2026-03-02 cs.LG 78%

Selective Denoising Diffusion Model for Time Series Anomaly Detection

选择性去噪扩散模型用于时间序列异常检测

Kohei Obata, Zheng Chen, Yasuko Matsubara, Lingwei Zhu, Yasushi Sakurai

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 AnomalyFilter通过选择性去噪扩散模型,专注于时间序列异常检测中的噪声设计,提升异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23225 2026-03-02 cs.CL cs.AI 78%

Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?

为何扩散语言模型在真正并行(非自回归)解码中表现不佳?

Pengxiang Li, Dilxat Muhtar, Tianlong Chen, Lu Yin, Shiwei Liu

机构 * The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学) ELLIS Institute Tübingen, Tübingen, Germany(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统马克斯·普朗克研究所) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心) University of Surrey, Guildford, United Kingdom(萨里大学) The University of North Carolina at Chapel Hill, Chapel Hill, NC, USA(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出NAP方法,通过数据驱动策略改进扩散语言模型的非自回归并行解码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16622 2026-03-02 eess.AS cs.AI cs.SD 78%

Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing

基于扩散的大型语言模型用于语音识别与 deliberation 处理

Mengqi Wang, Zhan Liu, Zengrui Jin, Guangzhi Sun, Chao Zhang, Philip C. Woodland

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散的LLaDA模型用于ASR,通过改进解码策略降低WER,展示其在语音识别中的有效性。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21797 2026-03-02 math.AP nlin.PS 78%

Travelling front solutions in a spatially heterogeneous reaction-diffusion system

空间异质反应扩散系统中的行进前沿解

M. Chirilus-Bruckner, L. van Vianen, F. Veerman

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了空间异质反应扩散系统中行进前沿解的存在性,通过扩展Fenichel理论和时间依赖空间动力学方法,推导了前沿位置的延迟微分方程表达式,克服了传统谱分析的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.00080 2026-03-02 math.PR math.DG math.FA 78%

Spectral gap estimates for Brownian motion on domains with sticky-reflecting boundary diffusion

谱隙估计:带有粘性反射边界的布朗运动

Vitalii Konarovskyi, Victor Marx, Max von Renesse

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过插值方法推导出带有粘性反射边界扩散的布朗运动谱隙下界,并在流形情况下应用了 Reilly 公式。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23454 2026-03-02 math.AP math.DS 78%

Weak mean random attractors for non-local random and stochastic reaction-diffusion equations

非局部随机和随机反应扩散方程的弱均随机吸引子

Rubén Caballero, Pedro Marín-Rubio, José Valero

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了非局部随机和随机反应扩散方程的弱均随机吸引子存在性,证明了解的存在性与唯一性及吸引子的性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24148 2026-03-02 cs.CV 70%

HumanOrbit: 3D Human Reconstruction as 360° Orbit Generation

HumanOrbit:3D人体重建作为360°轨道生成

Keito Suzuki, Kunyao Chen, Lei Wang, Bang Du, Runfa Blark Li, Peng Liu, Ning Bi, Truong Nguyen

机构 * University of California, San Diego(加州大学圣地亚哥分校) Qualcomm(高通公司)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 HumanOrbit通过视频扩散模型实现多视角人体生成,生成360°轨道视频并重建高保真3D模型。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24289 2026-03-02 cs.CV cs.LG 57%

Mode Seeking meets Mean Seeking for Fast Long Video Generation

模式寻求与均值寻求的结合用于快速长视频生成

Shengqu Cai, Weili Nie, Chao Liu, Julius Berner, Lvmin Zhang, Nanye Ma, Hansheng Chen, Maneesh Agrawala, Leonidas Guibas, Gordon Wetzstein, Arash Vahdat

机构 * Stanford University, California, USA(斯坦福大学) NVIDIA Research, California, USA(NVIDIA研究)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种结合模式寻求与均值寻求的解耦扩散变换器,通过监督学习生成快速长视频,提升长距离连贯性和局部真实感。

Comments Project website: https://primecai.github.io/mmm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23814 2026-03-02 cs.CV 57%

Action-Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation

基于3D几何先验的双臂操作动作预测

Chongyang Xu, Haipeng Li, Shen Cheng, Jingyu Hu, Haoqiang Fan, Ziliang Feng, Shuaicheng Liu

机构 * College of Computer Science, Sichuan University, China(四川大学计算机学院) University of Electronic Science and Technology of China, China(电子科技大学) Dexmal The Chinese University of Hong Kong, HK SAR, China(香港中文大学(HK SAR))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于3D几何先验的双臂操作预测框架,通过融合几何特征与2D语义信息,实现高效动作预测与空间理解。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23732 2026-03-02 cs.CV 57%

A Difference-in-Difference Approach to Detecting AI-Generated Images

一种差分-in-差分方法用于检测AI生成图像

Xinyi Qi, Kai Ye, Chengchun Shi, Ying Yang, Hongyi Zhou, Jin Zhu

机构 * Tsinghua University(清华大学) The London School of Economics and Political Science(伦敦政治经济学院) University of Birmingham(伯明翰大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种基于二阶差分的检测方法,通过减少方差提高AI生成图像的检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23645 2026-03-02 cs.CV 57%

BuildAnyPoint: 3D Building Structured Abstraction from Diverse Point Clouds

BuildAnyPoint: 从多样点云构建三维建筑结构抽象

Tongyan Hua, Haoran Gong, Yuan Liu, Di Wang, Ying-Cong Chen, Wufan Zhao

机构 * HKUST(GZ)(香港科技大学(广州)) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 BuildAnyPoint通过Loca-DiT框架从多样点云中生成结构化三维建筑抽象,提升重建的表面准确性和分布均匀性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07845 2026-03-02 cs.CV cs.AI 57%

Spread them Apart: Towards Robust Watermarking of Generated Content

将它们分开:迈向生成内容的鲁棒水印技术

Mikhail Pautov, Danil Ivanov, Andrey V. Galichin, Oleg Rogov, Ivan Oseledets

机构 * AXXX VeinCV Applied AI Institute(应用人工智能研究所) MTUCI(莫斯科国立大学) Institute of Numerical Mathematics(数值数学研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种在生成内容推理过程中嵌入鲁棒水印的方法,以实现生成内容的检测与溯源,适用于扩散模型并具有抗攻击能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07590 2026-03-02 cs.DC cs.CV 57%

DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training

DSV:利用动态稀疏性加速大规模视频DiT训练

Xin Tan, Yuetao Chen, Yimin Jiang, Xing Chen, Kun Yan, Nan Duan, Yibo Zhu, Daxin Jiang, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) StepFun Unaffiliated(无隶属)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 DSV通过动态稀疏性技术提升视频DiT训练效率,实现3.02倍吞吐量提升,适用于大规模高分辨率视频训练。

Journal ref ASPLOS'26: Proceedings of the 31st ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Vol. 1 (2026) 101-116

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24118 2026-03-02 astro-ph.SR 50%

Temporal Evolution of Sunspot Groups and Increase in the Open flux During Solar Maximum in Cycle 24

第24循环中太阳黑子群的时序演变及太阳极大期开放磁通量的增加

Minami Yoshida, Toshifumi Shimizu, Shin Toriumi, Haruhisa Iijima

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过分析太阳黑子群和日冕空洞的相互作用,揭示了太阳极大期开放磁通量增加的机制。

Comments 18 pages, 8 figures, 1 table, accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏