arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2337 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2337 篇

2608.04394 2026-08-06 cs.CV 新提交 83%

Free-Lunch Augmentation by Revisiting Diffusion-Based Data Generation for Cross-Domain Few-Shot Object Detection

通过重新审视基于扩散模型的跨域小样本目标检测数据生成实现无额外开销的数据增强

Zijian Zhuang, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 针对跨域小样本目标检测的域差距与数据稀缺挑战,提出带定制噪声的选择性修复(SITN)方法,结合定制噪声生成与选择性修复模块合成有效数据,在6个CDFSOD和4个CDFSS数据集上达到新的最先进性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01298 2026-08-04 cs.CV cs.AI cs.LG 新提交 83%

UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction

UDT:通过数据自适应令牌缩减协调U-Net与扩散Transformer

Junno Yun, Yaşar Utku Alçalar, Mehmet Akçakaya

机构 * University of Minnesota(明尼苏达大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本研究提出UDT架构,通过数据自适应令牌合并协调U-Net与DiTs,在ImageNet图像生成任务中收敛速度更快、FID指标更优,为DiTs提供了新的高效骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00444 2026-08-04 cs.CV 新提交 83%

Reconstruction-Shift Discrimination via Mask-Guided Latent Diffusion for Medical Anomaly Detection

基于掩码引导的潜在扩散的重构-偏移判别用于医学异常检测

Yibo Wan, Jinyu Cai, Yunhe Zhang, Yi Bin, See-kiong Ng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出判别式掩码引导扩散(DMD)框架,结合自监督分类的重构-偏移判别与残差定位,在五种医学影像数据集上实现了最优的无监督医学异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29337 2026-08-03 cs.CV cs.AI 新提交 83%

DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmentation Mask Generation

DualDiT:用于联合生成OCT图像与分割掩码的条件双输出扩散Transformer

Fernando García-Torres, Rocío del Amor, Sandra Morales, Álvaro Barroso, Peter Heiduschka, Björn Kemper, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-tech), Universitat Politècnica de València(瓦伦西亚理工大学以人类为中心技术大学研究所) Artikode Intelligence S.L(Artikode智能公司) Biomedical Technology Center of the Medical Faculty, University of Muenster(明斯特大学医学院生物医学技术中心) Department of Ophthalmology, University of Muenster Medical Centre(明斯特大学医学中心眼科)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 该研究提出DualDiT模型,联合生成小鼠OCT图像与分割掩码,在生成质量、下游分割性能上优于DDPM、LDM,可用于医学图像数据增强

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24249 2026-07-28 cs.CV cs.RO 新提交 83%

SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation

SILICA:将扩散先验用于联合玻璃分割和深度估计

Tarun R, Anuj Verma, Laksh Nanwani, Sourav Garg, K. Madhava Krishna

机构 * Robotics Research Center (RRC), IIIT Hyderabad(海得拉巴国际信息技术研究所机器人研究中心)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究透明表面深度估计难题,提出SILICA统一管道,利用文本到图像扩散模型先验联合预测玻璃分割和深度,无需真实世界玻璃深度注释,经实验验证其在不同环境中零样本转移性能出色,优于现有模型。

Comments IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23937 2026-07-28 cs.CV 新提交 83%

Manifold-Constrained Noise Optimization for Diverse Diffusion Sampling

用于多样化扩散采样的流形约束噪声优化

Qitan Shi, Cheng Jin, Ziyuan Liu, Yuantao Gu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究如何在推理时优化初始噪声以恢复几步蒸馏扩散模型的提示多样性。提出MoNO方法,在低维噪声流形上进行流形约束噪声优化,能大步长更新且无需辅助目标,实验表明该方法可保持图像质量并提升提示多样性。

Comments 19 pages, 14 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24110 2026-07-28 cs.CV cs.LG physics.optics 新提交 83%

BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion

超越融合:用于无校准红外超分辨率和红外-可见光融合的自对齐潜在扩散

Minchong Chen, Xiaoyun Yuan, Minyu Cao, Jianing Zhang, Jun Zhang, Shuyang Liu, Xiaokang Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对移动红外-可见光成像中跨传感器未对准问题,提出超越融合框架,通过引入跨模态自对齐模块及未对准增强模块,实现无校准条件下的红外超分辨率和红外-可见光融合,经实验验证了其有效性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21591 2026-07-24 cs.CV 新提交 83%

Inference-Time Scaling of Diffusion Models via Progressive Seed Pruning

通过渐进式种子剪枝实现扩散模型的推理时间缩放

Rogerio Guimaraes, Pietro Perona

机构 * California Institute of Technology(加州理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究扩散模型推理时间缩放问题,提出渐进式种子剪枝方法,通过早期评估多种子并剪枝,有效利用固定计算预算,在扩散和流匹配主干上比其他基线方法在奖励引导选择及提示对齐评估上表现更优。

Comments Project page: https://www.vision.caltech.edu/psp. Code: https://github.com/rogerioagjr/psp

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19895 2026-07-23 cs.CV cs.AI 新提交 83%

OSVE: One Step Video Editing with One Step Diffusion Models

OSVE:使用单步扩散模型进行单步视频编辑

Habin Lim, Gyeong-Moon Park

机构 * Korea University(韩国大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究针对扩散模型文本引导视频编辑慢的问题,提出OSVE框架。通过训练可学习编码器预测初始噪声,引入UFE技术及滑动窗口策略保持一致性,实现高质量视频编辑,速度比现有方法快约155 - 171倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18882 2026-07-22 cs.CV cs.LG 新提交 83%

Local Label-Informed Feature Transfer for Generating Ground-Truth Medical Images: A Comparison of GAN- and Diffusion-Based Approaches

用于生成真实医学图像的局部标签信息特征转移:基于GAN和扩散方法的比较

Rick Wilming, Irem Ozseker, Luca Matteo Cornils, Ahcène Boubekki, Benedict Clark, Danny Panknin, Stefan Haufe

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 研究针对医学成像中验证XAI方法缺少真实数据的问题,提出LLIFT框架,用GAN和扩散两种范式实现,能生成含真实病变的半合成脑磁共振图像,为评估XAI方法提供了可控真实数据,且评估效果良好。

Comments 6 pages, submitted to IEEE MetroXRAINE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18510 2026-07-22 cs.CV 新提交 83%

DuSPiT: Dual-Branch Sub-Patch Pixel Diffusion Transformer

DuSPiT:双分支子补丁像素扩散变换器

Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Reve(瑞夫)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究针对像素空间扩散中单一表示兼顾全局与细节的问题,提出双分支子补丁像素扩散变换器DuSPiT。通过分离全局与局部处理,利用两分支交互,实现更丰富细节和更好质量效率权衡,优于此前的像素空间扩散变换器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14765 2026-07-17 cs.CV 新提交 83%

Rare Concept Generation via Counterfactual Inference in Diffusion Models

通过扩散模型中的反事实推理生成罕见概念

Zhengyuan Jiang, Haipeng Liu, Meng Wang, Yang Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散模型训练的常识偏差致罕见概念图像生成不佳的问题,提出基于反事实推理的CI-Diff方法,阻断干扰,利用自然直接效应解耦属性,重新设计引导机制,经实验验证该方法优于现有模型。

Comments Comments: 17 pages, 15 figures, to appear at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13812 2026-07-16 eess.IV cs.CV 新提交 83%

TCAM-Diff: Triplane-Aware Cross-Attention Medical Diffusion Model

TCAM-Diff:三平面感知交叉注意力医学扩散模型

Zhenkai Zhang, Krista A. Ehinger, Tom Drummond

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究提出TCAM-Diff这一3D医学图像生成模型,采用仅解码器自动编码器方法学习三平面表示,利用三平面感知交叉注意力扩散模型整合特征,经预训练解码器模块转换为3D体素,在多规模医学数据集实验中结果出色,优于其他类似方法。

Comments Accepted at AAAI 2025. Code is available at https://github.com/Fredy-Zhang/TCAM-Diff

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 39(21): 22732-22740, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09784 2026-07-14 cs.CV cs.IT math.IT 新提交 83%

Compression Asymmetry and Trajectory Binding in Noise-Anchored Diffusion Inversion

噪声锚定扩散反演中的压缩不对称性与轨迹绑定

Yongseong Park, Joeun Kim, HoEun Kim, Young-Sik Kim

机构 * DGIST(大邱庆北科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究真实图像扩散反演的质量-成本权衡,通过高斯噪声锚分离出压缩不对称与轨迹绑定机制,据此提出NARC方法,该方法无需训练,存储少且效果好,在实验中表现出色并可应用于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05274 2026-07-07 cs.CV 新提交 83%

Erasing Without Collateral Damage: Precise Concept Removal in Diffusion Models

无附带损害擦除:扩散模型中的精确概念移除

Parth Upman, Nishita Jain, Shreyank N Gowda

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对无训练概念擦除易损害相关非目标概念的问题,提出CARE闭式算子,在交叉注意力值空间实现精确擦除,无模型微调,可更好保留非目标概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04801 2026-07-07 cs.CV 新提交 83%

LILAC: Layer-Wise Independent LoRAs and Cascaded Conditioning for Multi-Concept Customization of Diffusion Models

LILAC:用于扩散模型多概念定制的分层独立LoRAs和级联条件处理

Marian Lupascu, Sebastian Ripa, Mihai Trascau, Mariana-Iuliana Georgescu, Ionut Mironica

机构 * Adobe Research, Romania(罗马尼亚Adobe研究院) Department of Computer Science, University of Bucharest, Romania(罗马尼亚布加勒斯特大学计算机科学系) International Computer High School of Bucharest, Romania(罗马尼亚布加勒斯特国际计算机高中)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究个性化文本到图像扩散模型渲染特定主题的难题,提出LILAC框架,通过分层独立训练低秩适配器并级联条件处理,避免参数干扰,无需联合训练,线性扩展且与主干无关,效果良好。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04461 2026-07-07 cs.CV 新提交 83%

Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models

Flash-BoN:扩散模型推理时缩放的即时草稿

Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli

机构 * University of Maryland, College Park(美国马里兰大学帕克分校) Hugging Face(拥抱脸)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像生成推理时缩放,对比简单BoN与引导搜索方法,发现简单BoN在实际评估中表现良好。提出Flash-BoN,结合多种加速方法生成草稿候选,经多阶段验证选最有潜力的优化,在多基准和模型规模下优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03831 2026-07-07 cs.CV cs.AI 新提交 83%

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

扩散分类器如何做出决策?以偏差为中心的评估

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi

机构 * K. N. Toosi University of Technology(伊朗科技大学) Amirkabir University of Technology(伊朗阿米尔卡比尔理工大学) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究扩散分类器如何决策,通过ASOB-Bench从属性绑定、大小顺序偏差和背景依赖三维度评估,发现其偏差特征与视觉语言模型不同,为构建更稳健模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03517 2026-07-07 cs.LG cs.CV 新提交 83%

Mixture-of-Gaussians-Guided Schedule Design for Brownian Bridge Diffusion Models

用于布朗桥扩散模型的高斯混合引导调度设计

Ron Levi, Michael Elad

机构 * Technion, Israel(以色列理工学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 研究为布朗桥扩散模型开发调度设计框架,基于高斯混合先验分析其反向动力学,得出理想后验和去噪器,据此制定两个调度设计目标,揭示权衡并证明通用调度存在,实验验证其价值。

Comments 66 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03397 2026-07-07 cs.AI cs.CV 新提交 83%

Efficient bias mitigation in T2I diffusion models using Concept Graphs

使用概念图在文本到图像扩散模型中有效减轻偏差

Mansi, Avinash Kori, Francesco Leofante

机构 * Department of Computing Imperial College London(伦敦帝国理工学院计算系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像扩散模型偏差问题,提出基于概念图对齐的CO-ALIGN方法,在模型内部概念本体上操作,能有效减轻偏差并保留生成完整性,性能优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03256 2026-07-07 cs.CV 新提交 83%

A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms

用于少步扩散模型的可分解探测器:跨主干家族和蒸馏范式的提示、潜在和分数选择性

Patrick Mu Haojie

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究少步蒸馏扩散模型质量差距,用可分解探测器沿三层在三种模式六种强度下注入扰动,报告选择性比率。结果表明不同层读取不同因素,潜在层是整流流主干的近二元探测器。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02563 2026-07-07 cs.CV cs.AI cs.HC 新提交 83%

Attention Dynamics in Diffusion Models: A Visual Analytics Framework for Human-AI Collaboration

扩散模型中的注意力动态:用于人机协作的视觉分析框架

Yiran Xiao, George Legrady

机构 * University of California, Santa Barbara(美国加利福尼亚大学圣巴巴拉分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型语义结构难以解释问题,提出视觉分析框架,通过整合定量测度与数据驱动阶段识别,对注意力动态进行结构化分析,助力人机协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20971 2026-07-07 cs.CV 新提交 83%

UNITY: Attention Flow Networks for Adaptive Conditioning in Diffusion

UNITY: 用于扩散模型中自适应条件化的注意力流网络

Aryan Das, Koushik Biswas, Moloud Abdar, Vinay Kumar Verma

机构 * VIT Bhopal, India(印度VIT布巴尔学院) IIIT Delhi, India(印度德里理工学院) The University of Queensland, Australia(澳大利亚昆士兰大学) IIT Kanpur, India(印度坎普尔理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出UNITY,一种两阶段训练范式,通过可变形注意力流网络实现多模态条件共享与专化,在保持图像保真度的同时显著降低推理延迟和内存消耗。

Comments Acccepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01147 2026-07-02 cs.CV 新提交 83%

EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation

EquiSteer: 面向更公平的文本引导图像生成的交叉注意力引导

Tatiana Gaintseva, Akshit Achara, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Noah’s Ark(华为诺亚方舟实验室) King’s College London(伦敦国王学院) Imperial College London(帝国理工学院)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出EquiSteer,一种无需训练的方法,通过在推理时引导交叉注意力激活来减少文本到图像扩散模型中的性别偏见,平均减少高达87%的性别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00183 2026-07-02 cs.CV 新提交 83%

DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation

DriftScope: 测量扩散模型适应的隐藏效应

Héctor Laria, Yiping Han, Julian D. Santamaria, Kai Wang, Bogdan Raducanu, Joost van de Weijer, Alexandra Gomez-Villa

机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Universitat Autonoma de Barcelona, Barcelona, Spain(巴塞罗那自治大学) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机科学项目) City University of Hong Kong, HK SAR, China(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对预训练文本到图像扩散模型的适应(概念定制或遗忘),提出DriftScope诊断工具,通过稀疏自编码器和零样本分类揭示模型权重修改导致语义无关概念系统性漂移,FID/KID无法早期检测,而特定类别零样本准确率下降高达18.9点。

Comments 22 pages, 5 figures, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31683 2026-07-01 cs.CV cs.AI cs.LG 新提交 83%

Histogram-constrained Image Generation

直方图约束的图像生成

Haoming Liu, Yuanhe Guo, Yijia Cao, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出直方图约束图像生成(HIG)框架,通过最优传输理论在扩散模型中精确施加用户指定的分布约束,实现全局与局部之间的中间粒度控制,并展示其在颜色/潜在直方图约束生成和高容量信息嵌入中的应用。

Comments Accepted to ECCV 2026; 31 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31427 2026-07-01 cs.CV cs.CR 新提交 83%

No Prompt, No Leaks: A Robust Generative Steganography Framework via Prompt-Free Diffusion

无需提示,无泄漏:基于无提示扩散的鲁棒生成式隐写框架

Jingwen Cai, Fen Xiao, Shuhua Deng, Xieping Gao

机构 * MOE Key Laboratory of Intelligent Computing and Information Processing, Xiangtan University(湘潭大学智能计算与信息处理教育部重点实验室) College of Information Science and Engineering, Hunan Normal University(湖南师范大学信息科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出无提示扩散图像隐写框架,通过级联仿射耦合模块和风格语义先验控制隐写图像生成,并引入预测-校正机制优化生成轨迹,在安全性、重建精度和可控性上达到先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27978 2026-06-29 cs.CV cs.AI 新提交 83%

Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation

像素空间自回归图像生成的并行展开近似

Jiayi Xu, Di He, Guolin Ke

机构 * Peking University(北京大学) DP Technology

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出并行展开近似(PRA)框架,通过生成低维中间状态并映射回像素令牌,解决像素空间连续令牌自回归生成中高维补丁误差大和训练-推理差距问题,在ImageNet-1K上以135M参数实现FID 2.58,511M参数达到1.94,创像素空间AR模型新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27147 2026-06-26 cs.CV cs.AI 新提交 83%

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

安全自回归图像生成与迭代自改进码本

Yunqi Xue, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) Torr Vision Group, University of Oxford(牛津大学Torr视觉组)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对自回归统一多模态模型生成图像的安全性问题,提出迭代自改进码本方法,利用模型自身判断不安全图像并修正码本映射,消除有害输出并保证生成质量。

Comments 10 pages including references, 8 figures, accepted for publication at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26764 2026-06-26 cs.CV cs.AI 新提交 83%

Anatomy-Guided Residual Motion Diffusion for Controllable 4D Cardiac MRI Synthesis

解剖引导的残差运动扩散用于可控4D心脏MRI合成

Yiheng Cao, Gustavo Andrade-Miranda, Jiatian Zhang, Lingxiao Zhao, Xin Gao

机构 * Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Science(中国科学院苏州生物医学工程技术研究所) Systemes Complexes et Intelligence Artificielle, IMT Mines Ales(复杂系统与人工智能实验室,IMT 阿莱斯矿业学院) School of Artificial Intelligence and Advanced Computing, Xi’an Jiaotong-Liverpool University(西交利物浦大学人工智能与先进计算学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出一种4D可控生成框架,通过半监督VAE解耦解剖与运动,利用级联潜扩散模型生成时序一致的心脏MRI,在跨厂商数据上提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏