arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2607.05274 2026-07-07 cs.CV 新提交 83%

Erasing Without Collateral Damage: Precise Concept Removal in Diffusion Models

无附带损害擦除:扩散模型中的精确概念移除

Parth Upman, Nishita Jain, Shreyank N Gowda

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对无训练概念擦除易损害相关非目标概念的问题,提出CARE闭式算子,在交叉注意力值空间实现精确擦除,无模型微调,可更好保留非目标概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04801 2026-07-07 cs.CV 新提交 83%

LILAC: Layer-Wise Independent LoRAs and Cascaded Conditioning for Multi-Concept Customization of Diffusion Models

LILAC:用于扩散模型多概念定制的分层独立LoRAs和级联条件处理

Marian Lupascu, Sebastian Ripa, Mihai Trascau, Mariana-Iuliana Georgescu, Ionut Mironica

机构 * Adobe Research, Romania(罗马尼亚Adobe研究院) Department of Computer Science, University of Bucharest, Romania(罗马尼亚布加勒斯特大学计算机科学系) International Computer High School of Bucharest, Romania(罗马尼亚布加勒斯特国际计算机高中)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究个性化文本到图像扩散模型渲染特定主题的难题,提出LILAC框架,通过分层独立训练低秩适配器并级联条件处理,避免参数干扰,无需联合训练,线性扩展且与主干无关,效果良好。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04461 2026-07-07 cs.CV 新提交 83%

Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models

Flash-BoN:扩散模型推理时缩放的即时草稿

Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli

机构 * University of Maryland, College Park(美国马里兰大学帕克分校) Hugging Face(拥抱脸)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像生成推理时缩放,对比简单BoN与引导搜索方法,发现简单BoN在实际评估中表现良好。提出Flash-BoN,结合多种加速方法生成草稿候选,经多阶段验证选最有潜力的优化,在多基准和模型规模下优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03831 2026-07-07 cs.CV cs.AI 新提交 83%

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

扩散分类器如何做出决策?以偏差为中心的评估

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi

机构 * K. N. Toosi University of Technology(伊朗科技大学) Amirkabir University of Technology(伊朗阿米尔卡比尔理工大学) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究扩散分类器如何决策,通过ASOB-Bench从属性绑定、大小顺序偏差和背景依赖三维度评估,发现其偏差特征与视觉语言模型不同,为构建更稳健模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03517 2026-07-07 cs.LG cs.CV 新提交 83%

Mixture-of-Gaussians-Guided Schedule Design for Brownian Bridge Diffusion Models

用于布朗桥扩散模型的高斯混合引导调度设计

Ron Levi, Michael Elad

机构 * Technion, Israel(以色列理工学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 研究为布朗桥扩散模型开发调度设计框架,基于高斯混合先验分析其反向动力学,得出理想后验和去噪器,据此制定两个调度设计目标,揭示权衡并证明通用调度存在,实验验证其价值。

Comments 66 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03397 2026-07-07 cs.AI cs.CV 新提交 83%

Efficient bias mitigation in T2I diffusion models using Concept Graphs

使用概念图在文本到图像扩散模型中有效减轻偏差

Mansi, Avinash Kori, Francesco Leofante

机构 * Department of Computing Imperial College London(伦敦帝国理工学院计算系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像扩散模型偏差问题,提出基于概念图对齐的CO-ALIGN方法,在模型内部概念本体上操作,能有效减轻偏差并保留生成完整性,性能优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03256 2026-07-07 cs.CV 新提交 83%

A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms

用于少步扩散模型的可分解探测器:跨主干家族和蒸馏范式的提示、潜在和分数选择性

Patrick Mu Haojie

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究少步蒸馏扩散模型质量差距,用可分解探测器沿三层在三种模式六种强度下注入扰动,报告选择性比率。结果表明不同层读取不同因素,潜在层是整流流主干的近二元探测器。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02563 2026-07-07 cs.CV cs.AI cs.HC 新提交 83%

Attention Dynamics in Diffusion Models: A Visual Analytics Framework for Human-AI Collaboration

扩散模型中的注意力动态:用于人机协作的视觉分析框架

Yiran Xiao, George Legrady

机构 * University of California, Santa Barbara(美国加利福尼亚大学圣巴巴拉分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型语义结构难以解释问题,提出视觉分析框架,通过整合定量测度与数据驱动阶段识别,对注意力动态进行结构化分析,助力人机协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20971 2026-07-07 cs.CV 新提交 83%

UNITY: Attention Flow Networks for Adaptive Conditioning in Diffusion

UNITY: 用于扩散模型中自适应条件化的注意力流网络

Aryan Das, Koushik Biswas, Moloud Abdar, Vinay Kumar Verma

机构 * VIT Bhopal, India(印度VIT布巴尔学院) IIIT Delhi, India(印度德里理工学院) The University of Queensland, Australia(澳大利亚昆士兰大学) IIT Kanpur, India(印度坎普尔理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出UNITY,一种两阶段训练范式,通过可变形注意力流网络实现多模态条件共享与专化,在保持图像保真度的同时显著降低推理延迟和内存消耗。

Comments Acccepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22972 2026-07-07 cs.CV 版本更新 83%

WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion

WorldMesh: 通过网格条件图像扩散生成可导航的多房间3D场景

Manuel-Andreas Schneider, Angela Dai

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出WorldMesh方法,通过网格条件图像扩散生成大规模多房间3D场景,结合结构化网格与真实外观合成,实现高丰富度和多样性的3D环境生成。

Comments Accepted to ECCV 2026. Project page: https://mschneider456.github.io/world-mesh/ Video: https://www.youtube.com/watch?v=MKMEbPT38-s Code: https://github.com/mschneider456/worldmesh

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14504 2026-07-07 cs.LG cs.AI cs.CV 版本更新 83%

Trust-Region Noise Search for Black-Box Alignment of Diffusion and Flow Models

基于信任区域的噪声搜索用于扩散和流模型的黑盒对齐

Niklas Schweiger, Daniel Cremers, Karnik Ram

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种基于信任区域的噪声搜索算法,用于对扩散和流模型进行黑盒对齐,通过优化噪声样本实现更好的生成效果,适用于多种生成任务。

Comments Preprint (shorter version accepted at ICLR ReaLM-GEN workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01651 2026-07-07 cs.CV 版本更新 83%

Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning

扩散模型是开放世界的功能学习器:利用生成先验进行3D功能学习

Hanqing Wang, Zhenhao Zhang, Kaiyang Ji, Mingyu Liu, Wenti Yin, yuchao chen, Zhirui Liu, Xiangyu Zeng, Tianxiang Gui, Hangxing Zhang, Jiahao Yuan, Zhiqing Cui, Jiaxin Liu, Zhiyuan Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究3D功能基础问题,利用文本到图像扩散模型提取先验知识,提出基于扩散的DAG框架用于3D功能预测,通过实验证明其优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11553 2026-07-07 cs.CV 版本更新 83%

AnyDesign: Versatile Area Fashion Editing via Mask-Free Diffusion

AnyDesign:通过无掩码扩散实现通用区域时尚编辑

Yunfang Niu, Dong Yi, Lingxiang Wu, Jie Peng, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究所) Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 研究时尚图像编辑,扩展数据集涵盖更多服装和复杂背景,提出基于扩散的AnyDesign方法,通过融合服装类型和特征实现无掩码编辑,实验表明该方法优于当代文本引导时尚编辑方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28417 2026-07-03 cs.CV 版本更新 83%

DiffRGD: An Inference-Time Diffusion Guidance Through Riemannian Gradient Descent

DiffRGD:通过黎曼梯度下降的推理时扩散引导

Jia-Wei Liao, Li-Xuan Peng, Mei-Heng Yueh, Min Sun, Cheng-Fu Chou, Jun-Cheng Chen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出DiffRGD框架,通过黎曼梯度下降在球流形上求解约束优化,保持潜在高斯分布,提升图像恢复与条件生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01147 2026-07-02 cs.CV 新提交 83%

EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation

EquiSteer: 面向更公平的文本引导图像生成的交叉注意力引导

Tatiana Gaintseva, Akshit Achara, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Noah’s Ark(华为诺亚方舟实验室) King’s College London(伦敦国王学院) Imperial College London(帝国理工学院)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出EquiSteer,一种无需训练的方法,通过在推理时引导交叉注意力激活来减少文本到图像扩散模型中的性别偏见,平均减少高达87%的性别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00183 2026-07-02 cs.CV 新提交 83%

DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation

DriftScope: 测量扩散模型适应的隐藏效应

Héctor Laria, Yiping Han, Julian D. Santamaria, Kai Wang, Bogdan Raducanu, Joost van de Weijer, Alexandra Gomez-Villa

机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Universitat Autonoma de Barcelona, Barcelona, Spain(巴塞罗那自治大学) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机科学项目) City University of Hong Kong, HK SAR, China(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对预训练文本到图像扩散模型的适应(概念定制或遗忘),提出DriftScope诊断工具,通过稀疏自编码器和零样本分类揭示模型权重修改导致语义无关概念系统性漂移,FID/KID无法早期检测,而特定类别零样本准确率下降高达18.9点。

Comments 22 pages, 5 figures, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27285 2026-07-02 cs.CV cs.CR 版本更新 83%

Rethinking Robust Adversarial Concept Erasure in Diffusion Models

重新思考扩散模型中的鲁棒对抗性概念擦除

Qinghong Yin, Yu Tian, Heming Yang, Xiang Chen, Xianlin Zhang, Yue Ming, Xueming Li, Yue Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散模型中概念擦除的对抗训练忽视概念语义导致拟合不足的问题,提出语义引导的鲁棒对抗概念擦除方法S-GRACE,显著提升擦除性能26%并减少90%训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11925 2026-07-02 cs.CV 版本更新 83%

Continuous Speculative Decoding for Autoregressive Image Generation

连续推测解码用于自回归图像生成

Zili Wang, Zheng Zhang, Kun Ding, Qi Yang, Fei Li, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) JD.COM Inc(京东集团股份有限公司) China Tower Corporation Limited(中国铁塔股份有限公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出连续推测解码方法,通过近似准则、去噪轨迹对齐和接受-拒绝采样,加速连续视觉自回归模型,实现2倍以上加速且保持生成质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31683 2026-07-01 cs.CV cs.AI cs.LG 新提交 83%

Histogram-constrained Image Generation

直方图约束的图像生成

Haoming Liu, Yuanhe Guo, Yijia Cao, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出直方图约束图像生成(HIG)框架,通过最优传输理论在扩散模型中精确施加用户指定的分布约束,实现全局与局部之间的中间粒度控制,并展示其在颜色/潜在直方图约束生成和高容量信息嵌入中的应用。

Comments Accepted to ECCV 2026; 31 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31427 2026-07-01 cs.CV cs.CR 新提交 83%

No Prompt, No Leaks: A Robust Generative Steganography Framework via Prompt-Free Diffusion

无需提示,无泄漏:基于无提示扩散的鲁棒生成式隐写框架

Jingwen Cai, Fen Xiao, Shuhua Deng, Xieping Gao

机构 * MOE Key Laboratory of Intelligent Computing and Information Processing, Xiangtan University(湘潭大学智能计算与信息处理教育部重点实验室) College of Information Science and Engineering, Hunan Normal University(湖南师范大学信息科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出无提示扩散图像隐写框架,通过级联仿射耦合模块和风格语义先验控制隐写图像生成,并引入预测-校正机制优化生成轨迹,在安全性、重建精度和可控性上达到先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30332 2026-06-30 cs.CV 83%

UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception

UniGP:驯服扩散Transformer以实现先验保留的统一生成与感知

Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zeekr Automobile R&D Co., Ltd.(小鹏汽车研发有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出UniGP框架,基于MMDiT通过简单联合训练统一可控生成与密集预测,无需复杂任务设计,保留骨干先验,在多个任务上超越先前统一方法并与专用方法持平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29801 2026-06-30 cs.CV 83%

Concept Removal Guidance: Evidence-Calibrated Negative Guidance for Safe Diffusion Sampling

概念移除引导:用于安全扩散采样的证据校准负引导

Yoonseok Choi, Chaeyoung Oh, Hyunjun Choi, Seokin Seo, Kee-Eung Kim

机构 * KAIST(韩国科学技术院) KIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出概念移除引导(CRG),一种无需训练的方法,通过从模型噪声预测中估计不良概念存在并自适应校准负引导权重,在保持良性保真度的同时降低攻击成功率。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28628 2026-06-30 eess.IV cs.CV cs.LG 83%

Envisage: Diffusion-Based Rhinoplasty Goal Visualization with Mask-Decomposed Evaluation

Envisage:基于扩散的鼻整形目标可视化与掩码分解评估

Mudit Agarwal, Amit D. Bhrany

机构 * University of Washington(华盛顿大学) University of Washington School of Medicine(华盛顿大学医学院) Department of Otolaryngology–Head and Neck Surgery(耳鼻喉科–头颈外科部门)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出Envisage扩散修复管线,从单张正面照片可视化鼻整形目标,并引入SurgicalScore掩码分解协议评估局部编辑质量,克服全脸身份指标在硬合成编辑下的混淆。

Comments 29 pages, 4 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00654 2026-06-30 cs.CV 83%

Seed-to-Seed: Unpaired Image Translation in Diffusion Seed Space

种子到种子:扩散种子空间中的无配对图像翻译

Or Greenberg, Eran Kishon, Dani Lischinski

机构 * General Motors R&D(通用汽车研发中心) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出一种结合GAN和扩散模型的无配对图像翻译方法,通过利用预训练扩散模型的种子空间语义信息,实现复杂汽车场景的结构保持翻译,优于现有方法。

Comments British Machine Vision Conference (BMVC) 2025. Official proceedings: https://bmvc2025.bmva.org/proceedings/154/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05934 2026-06-30 cs.CV 83%

AD-DAE: Alzheimer's Disease Progression Modeling with Unpaired Longitudinal MRI using Diffusion Auto-Encoders

AD-DAE:利用未配对纵向MRI进行阿尔茨海默病进展建模的扩散自编码器

Ayantika Das, Arunima Sarkar, Keerthi Ram, Mohanasankar Sivaprakasam

机构 * Indian Institute of Technology Madras (IITM)(印度理工学院马德拉斯分校) Sudha Gopalakrishnan Brain Centre (SGBC), IITM(苏达·戈帕拉克里希南脑中心(SGBC),印度理工学院马德拉斯分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出AD-DAE框架,通过扩散自编码器在无配对纵向MRI数据中建模阿尔茨海默病进展,利用紧凑的潜在空间生成后续影像。

Comments Accepted in IEEE Journal of Biomedical and Health Informatics ( https://ieeexplore.ieee.org/document/11579738 )

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07711 2026-06-30 cs.CV cs.AI 83%

SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces

结构状态空间模型与视频扩散模型的结合:利用结构状态空间实现高效长时视频生成

Yuta Oshima, Shohei Taniguchi, Masahiro Suzuki, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出利用结构状态空间模型作为视频扩散模型的时序特征提取器,以解决传统注意力层在生成长视频序列时的计算成本问题,实验表明结构状态空间模型在内存使用和性能上更具优势。

Comments Accepted as a workshop paper at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27978 2026-06-29 cs.CV cs.AI 新提交 83%

Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation

像素空间自回归图像生成的并行展开近似

Jiayi Xu, Di He, Guolin Ke

机构 * Peking University(北京大学) DP Technology

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出并行展开近似(PRA)框架,通过生成低维中间状态并映射回像素令牌,解决像素空间连续令牌自回归生成中高维补丁误差大和训练-推理差距问题,在ImageNet-1K上以135M参数实现FID 2.58,511M参数达到1.94,创像素空间AR模型新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06668 2026-06-29 cs.CV cs.LG eess.IV 版本更新 83%

StableMotion: One-Step Motion Estimation with Diffusion Prior

StableMotion: 基于扩散先验的单步运动估计

Ziyi Wang, Haipeng Li, Lin Sui, Tianhao Zhou, Hai Jiang, Lang Nie, Bing Zeng, Shuaicheng Liu

机构 * Yingcai Honors College, University of Electronic Science and Technology of China(电子科技大学英才实验学院) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Paradigm Inc.(第四范式) School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(重庆邮电大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出StableMotion框架,利用预训练图像扩散模型的几何和内容先验,通过自适应集成策略和单步推理设计,在图像矫正任务中实现高效、高保真的运动估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01014 2026-06-29 cs.CV 版本更新 83%

An Expectation-Maximization Algorithm for Training Clean Diffusion Models from Corrupted Observations

一种从损坏观测中训练清洁扩散模型的期望最大化算法

Weimin Bai, Yifei Wang, Wenzheng Chen, He Sun

机构 * Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) College of Future Technology, Peking University(北京大学未来技术学院) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) Yuanpei College, Peking University(北京大学元培学院) State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出EMDiffusion,一种期望最大化方法,通过交替重建和模型更新从损坏观测中训练扩散模型,在多种成像逆任务上达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27147 2026-06-26 cs.CV cs.AI 新提交 83%

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

安全自回归图像生成与迭代自改进码本

Yunqi Xue, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) Torr Vision Group, University of Oxford(牛津大学Torr视觉组)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对自回归统一多模态模型生成图像的安全性问题,提出迭代自改进码本方法,利用模型自身判断不安全图像并修正码本映射,消除有害输出并保证生成质量。

Comments 10 pages including references, 8 figures, accepted for publication at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏