arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2602.14157 2026-04-01 cs.CV cs.AI cs.LG 83%

When Test-Time Guidance Is Enough: Fast Image and Video Editing with Diffusion Guidance

测试时指导足矣:基于扩散指导的快速图像和视频编辑

Ahmed Ghorbel, Badr Moufad, Navid Bagheri Shouraki, Alain Oliviero Durmus, Thomas Hirtz, Eric Moulines, Jimmy Olsson, Yazid Janati

机构 * CMAP, Ecole Polytechnique(巴黎综合理工学院CMAP实验室) Institute of Foundation Models(基础模型研究所) MBZUAI(穆罕默德·本·扎耶德人工智能大学) EPITA(法国高等信息技术学院) Sorbonne University(索邦大学) Lagrange Mathematics and Computing Research Center(拉格朗日数学与计算研究中心) EPITA Research Lab(EPITA研究实验室) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过测试时指导实现高效的图像和视频编辑,理论分析并扩展了现有方法,证明测试时指导能与训练时方法媲美甚至超越。

Journal ref ICLR 2026, ReALM-GEN workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28763 2026-03-31 cs.CV 83%

PoseDreamer: Scalable and Photorealistic Human Data Generation Pipeline with Diffusion Models

PoseDreamer:基于扩散模型的可扩展且逼真的人体数据生成管道

Lorenza Prospero, Orest Kupyn, Ostap Viniavskyi, João F. Henriques, Christian Rupprecht

机构 * The Podium Institute for Sports Medicine and Technology, University of Oxford(牛津大学体育医学与技术讲台研究所) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Ukrainian Catholic University(乌克兰天主教大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出PoseDreamer,通过扩散模型生成大规模合成数据,结合可控图像生成与偏好优化,提升3D人体数据质量与多样性,实现比传统合成数据更高的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15288 2026-03-31 cs.CV 83%

APPLE: Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping

APPLE:基于扩散模型的属性保留伪标签面部交换

Jiwon Kang, Yeji Choi, JoungBin Lee, Wooseok Jang, Jinhyeok Choi, Taekeun Kang, Yongjae Park, Myungin Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) SAMSUNG(三星)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出APPLE框架,通过条件去模糊和属性感知反向方案提升面部交换中属性保留能力,实现高保真属性与身份转移。

Comments Accepted at CVPR 2026. Project Page: https://cvlab-kaist.github.io/APPLE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27637 2026-03-31 cs.CV 83%

OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation

OPRO:用于面板感知上下文图像生成的正交面板相对运算符

Sanghyeon Lee, Minwoo Lee, Euijin Shin, Kangyeol Kim, Seunghwan Choi, Jaegul Choo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种参数高效的方法,通过在预训练扩散转换器的冻结位置编码上添加可学习的面板特定正交运算符,提升上下文图像生成的面板感知能力,实验表明其方法具有通用性和有效性。

Comments Accepted to CVPR 2026. 16 pages, 9 figures. Includes Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06178 2026-03-30 cs.CV 83%

Making Training-Free Diffusion Segmentors Scale with the Generative Power

利用生成能力使免训练扩散分割器扩展

Benyuan Meng, Qianqian Xu, Zitai Wang, Xiaochun Cao, Longtao Huang, Qingming Huang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) School of Cyber Science and Tech., Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Alibaba Group(阿里巴巴集团) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Key Laboratory of Big Data Mining and Knowledge Management, CAS(中国科学院大数据挖掘与知识管理重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究了如何通过提升扩散模型的生成能力来改进免训练的图像分割方法,提出自动聚合和像素级重缩放技术以解决注意力图与全局表示不一致及文本标记间得分不平衡的问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21419 2026-03-30 cs.LG cs.CV 83%

Revisiting Diffusion Model Predictions Through Dimensionality

通过维度性重新审视扩散模型预测

Qing Jin, Chaoyang Wang

机构 * Independent Researcher(独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文通过理论框架解释高维数据中直接预测数据优于噪声和速度预测的原因,并提出k-Diff框架自动学习最优预测参数以提升生成性能。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25194 2026-03-27 cs.CV 83%

CardioDiT: Latent Diffusion Transformers for 4D Cardiac MRI Synthesis

CardioDiT:用于4D心脏MRI合成的潜在扩散变换器

Marvin Seyfarth, Sarah Kaye Müller, Arman Ghanaat, Isabelle Ayx, Fabian Fastenrath, Philipp Wild, Alexander Hertel, Theano Papavassiliu, Salman Ul Hassan Dar, Sandy Engelhardt

机构 * Institute for Artificial Intelligence in Cardiovascular Medicine, Medical Faculty of Heidelberg University, Heidelberg University(海德堡大学医学院心血管医学人工智能研究所,海德堡大学) Department of Cardiology, Angiology, Pneumology, Heidelberg University Hospital(海德堡大学医院心脏病学、血管学、肺病学系) DZHK (German Centre for Cardiovascular Research), Partner Site Heidelberg/Mannheim(德国心血管研究中心(DZHK),海德堡/曼海姆合作站点) Department of Radiology and Nuclear Medicine, University Medical Center Mannheim(曼海姆大学医学中心放射学与核医学系) Section for Invasive Cardiology and Electrophysiology, I. Medical Department, Cardiology, Hemostasiology and Intensive Care, University Medical Centre Mannheim(曼海姆大学医学中心第一内科(心脏病学、止血学与重症监护)介入心脏病学与电生理学科) University Medical Center of the Johannes Gutenberg-University Mainz(美因茨约翰内斯·古腾堡大学医学中心) Department of Cardiology, Angiology, Hemostasis, and Medical Intensive Care, University Medical Centre Mannheim, Medical Faculty Mannheim, University of Heidelberg(海德堡大学曼海姆医学院曼海姆大学医学中心心脏病学、血管学、止血学与内科重症监护系)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CardioDiT,一种基于扩散变换器的4D潜在扩散模型,用于合成短轴 cine CMR,通过联合建模空间和时间实现连续心脏动态生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17900 2026-03-27 cs.CV cs.RO 83%

Diffusion Forcing for Multi-Agent Interaction Sequence Modeling

扩散力场用于多智能体交互序列建模

Vongani H. Maluleke, Kie Horiuchi, Lea Wilken, Evonne Ng, Jitendra Malik, Angjoo Kanazawa

机构 * Sony Group Corporation(索尼集团公司) Meta UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出MAGNet框架,通过灵活的条件和采样生成多智能体运动序列,支持多种交互任务,实现长序列生成和智能体间协调。

Comments Project page: https://von31.github.io/MAGNet/ ; Code: https://github.com/Von31/MAGNet-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23022 2026-03-27 cs.CV 83%

DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis

DMAligner:通过扩散模型基于视角合成增强图像对齐

Xinglong Luo, Ao Luo, Zhengning Wang, Yueqi Yang, Chaoyu Feng, Lei Lei, Bing Zeng, Shuaicheng Liu

机构 * University of Electronic Science and Technology of China(电子科技大学) Qianyuan Laboratory(钱元实验室) Southwest Jiaotong University(西南交通大学) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DMAligner通过扩散模型基于视角合成的方法提升图像对齐效果,解决传统光流方法在遮挡和光照变化下的局限性,提出动态感知扩散训练和动态场景图像对齐数据集。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20012 2026-03-26 cs.CV 83%

Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features

基于扩散模型的化妆转移与面部区域感知化妆特征

Zheng Gao, Debin Meng, Yunqi Miao, Zhensong Zhang, Songcen Xu, Ioannis Patras, Jifei Song

机构 * Queen Mary University of London(伦敦女王学院) Huawei London Research Center(华为伦敦研发中心)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出FRAM方法,通过微调化妆CLIP和区域感知化妆注入,提升扩散模型在面部区域特定化妆转移中的可控性与效果。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16371 2026-03-26 cs.CV 83%

Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models

锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中

Mariam Hassan, Bastien Van Delft, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01718 2026-03-26 cs.RO cs.CV 83%

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process

统一扩散VLA:通过联合离散去噪扩散过程实现视觉-语言-动作模型

Jiayi Chen, Wenxuan Song, Pengxiang Ding, Ziyang Zhou, Han Zhao, Feilong Tang, Donglin Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Westlake University(西交大学) Zhejiang University(浙江大学) Monash University(墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出统一扩散VLA模型,通过联合离散去噪扩散过程实现视觉语言动作的协同生成与执行,提升多模态任务的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22626 2026-03-25 cs.CV 83%

PIVM: Diffusion-Based Prior-Integrated Variation Modeling for Anatomically Precise Abdominal CT Synthesis

PIVM:基于扩散的先验集成变分建模用于解剖学精确的腹部CT合成

Dinglun He, Baoming Zhang, Xu Wang, Yao Hao, Deshan Yang, Ye Duan

机构 * Department of Electrical Engineering and Computer Science, University of Missouri, Columbia, MO, USA(密苏里大学电气工程与计算机科学系) Department of Computer Science, The University of Texas at Dallas, Richardson, TX, USA(德克萨斯大学达拉斯分校计算机科学系) Department of Radiation Oncology, Washington University in St. Louis, MO, USA(华盛顿大学圣路易斯分校放射肿瘤学系) Department of Radiation Oncology, Duke University, Durham, NC, USA(达特茅斯大学放射肿瘤学系) School of Computing, Clemson University, Clemson, SC, USA(克莱姆森大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出PIVM框架,通过整合器官特定强度先验,实现高精度腹部CT图像合成,保留HU范围和细密解剖纹理。

Comments Accepted at the IEEE International Symposium on Biomedical Imaging (ISBI) 2026 (Oral). Equal contribution by the first three authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22125 2026-03-24 cs.CV 83%

DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment

DA-VAE:通过细节对齐实现扩散模型的插件式潜在压缩

Xin Cai, Zhiyuan You, Zhoutong Zhang, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DA-VAE,通过轻量级调整预训练扩散模型,实现潜在空间压缩,使1024×1024图像生成使用32×32 tokens,比原模型减少40%,并支持2048×2048生成,保持图像质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19575 2026-03-24 cs.CV 83%

MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation

MagicSeg: 通过反事实扩散模型自动生成实现开放世界分割预训练

Kaixin Cai, Pengzhen Ren, Jianhua Han, Yi Zhu, Hang Xu, Jianzhuang Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) PengCheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 MagicSeg通过反事实扩散模型自动生成数据集,提升开放世界语义分割性能,实验在PASCAL VOC等数据集上取得SOTA结果。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21348 2026-03-24 cs.CV 83%

Efficient Coarse-to-Fine Diffusion Models with Time Step Sequence Redistribution

高效粗到细扩散模型与时间步序列重分布

Yu-Shan Tai, An-Yeu, Wu

机构 * Graduate Institute of Electrical Engineering(电气工程研究所) National Taiwan University(台湾大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出粗到细扩散模型与时间步序列重分布方法,通过减少粗特征生成计算和优化采样轨迹,实现CIFAR10和LSUN-Church上80%-90%的计算量减少,近无损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21085 2026-03-24 cs.CV 83%

Taming Sampling Perturbations with Variance Expansion Loss for Latent Diffusion Models

通过方差扩展损失镇定采样扰动以提升潜在扩散模型

Qifan Li, Xingyu Zhou, Jinhua Zhang, Weiyi You, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出方差扩展损失,通过对抗重建与方差扩展的交互,提升潜在空间鲁棒性,改进扩散生成质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10634 2026-03-24 cs.CV cs.AI 83%

Symmetrical Flow Matching: Unified Image Generation, Segmentation, and Classification with Score-Based Generative Models

对称流匹配:基于分数生成模型的统一图像生成、分割与分类

Francisco Caetano, Christiaan Viviers, Peter H. N. De With, Fons van der Sommen

专题命中 扩散模型 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出对称流匹配方法,通过联合建模正反向变换实现图像生成、分割和分类的统一,采用对称学习目标确保双向一致性并保留生成多样性,实验表明其在多个基准上取得SOTA性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19939 2026-03-23 cs.CV 83%

Timestep-Aware Block Masking for Efficient Diffusion Model Inference

基于时间步的块掩码:用于高效扩散模型推理的优化方法

Haodong He, Yuan Gao, Weizhong Zhang, Gui-Song Xia

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出基于时间步的块掩码方法,通过动态决定执行或跳过哪些块来优化预训练DPMs的计算图,提升推理效率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19676 2026-03-23 cs.CV cs.AI cs.LG 83%

ATHENA: Adaptive Test-Time Steering for Improving Count Fidelity in Diffusion Models

ATHENA: 适应性测试时引导以提高扩散模型中的计数保真度

Mohammad Shahab Sepehri, Asal Mehradfar, Berk Tinaz, Salman Avestimehr, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 ATHENA通过测试时自适应引导框架提升扩散模型中物体计数保真度,不修改模型结构或需重新训练,利用中间表示估计计数并进行噪声校正,三种变体在计算上权衡提升数值精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19195 2026-03-20 cs.CV 83%

All-in-One Slider for Attribute Manipulation in Diffusion Models

用于扩散模型属性操控的全能滑块

Weixin Ye, Hongguang Zhu, Wei Wang, Yahui Liu, Mengyu Wang, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Visual Intelligence + X International Cooperation Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际合作联合实验室) City University of Macau(澳门城市大学) Kuaishou(快手) Meitu(美图)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出All-in-One滑块模块,通过分解文本嵌入空间实现高效的属性操控,支持多属性组合与零样本操控,提升扩散模型的属性操控精度和可扩展性。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18466 2026-03-20 cs.CV 83%

Recolour What Matters: Region-Aware Colour Editing via Token-Level Diffusion

重新着色所关注的:通过令牌级扩散实现区域感知的着色编辑

Yuqi Yang, Dongliang Chang, Yijia Ling, Ruoyi Du, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(北京多模态数据智能感知与治理重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出ColourCrafter框架,通过令牌级融合RGB颜色和图像令牌,在潜在空间中实现区域感知的着色生成,提升细粒度着色编辑的准确性和可控性。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17237 2026-03-19 cs.CV 83%

Mechanistic Interpretability of Diffusion Models: Circuit-Level Analysis and Causal Validation

扩散模型的机理可解释性:电路级分析与因果验证

Dip Roy

机构 * Computer Science and Engineering, Indian Institute of Technology, Patna, India(计算机科学与工程,印度理工学院,帕坦,印度)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究通过系统干预实验揭示扩散模型在合成与自然数据处理中的算法差异,发现真实人脸处理需更高计算复杂度的电路,识别出八种功能不同的注意力机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05823 2026-03-17 cs.CV 83%

Boosting Latent Diffusion Models via Disentangled Representation Alignment

通过解耦表征对齐提升潜在扩散模型

John Page, Xuesong Niu, Kai Wu, Kun Gai

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Semantics-Disentangled VAE,通过非线性映射架构提升VAE的语义解耦能力,实现高质量图像生成,FID达1.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18706 2026-03-17 cs.CV 83%

CoD: A Diffusion Foundation Model for Image Compression

CoD:一种面向图像压缩的扩散基础模型

Zhaoyang Jia, Zihan Zheng, Naifu Xue, Jiahao Li, Bin Li, Zongyu Guo, Xiaoyi Zhang, Houqiang Li, Yan Lu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出CoD,一种面向图像压缩的扩散基础模型,通过端到端优化提升压缩效率和生成质量,在超低比特率下实现SOTA结果,同时降低训练成本并提供新研究视角。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14128 2026-03-17 cs.CV cs.AI cs.LG 83%

Diffusion Reinforcement Learning via Centered Reward Distillation

通过中心化奖励蒸馏实现扩散强化学习

Yuanzhi Zhu, Xi Wang, Stéphane Lathuilière, Vicky Kalogeiton

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出中心化奖励蒸馏框架,通过KL正则化奖励最大化和前向过程微调,解决扩散模型在细粒度提示保真度、组合正确性等任务中的表现问题,实现更稳定的奖励优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03608 2026-03-17 cs.CV 83%

Diffusion-Classifier Synergy: Reward-Aligned Learning via Mutual Boosting Loop for FSCIL

扩散-分类器协同:通过互boost循环实现奖励对齐学习以实现少样本类增量学习

Ruitao Wu, Yifan Zhao, Guangyao Chen, Jia Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Diffusion-Classifier Synergy框架,通过扩散模型与分类器的互boost循环,利用奖励对齐策略提升少样本类增量学习的性能,增强知识保留与新类学习能力。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25940 2026-03-17 cs.CV cs.LG 83%

Steer Away From Mode Collisions: Improving Composition In Diffusion Models

避免模式碰撞:改进扩散模型中的组合性能

Debottam Dutta, Jianchong Chen, Rajalaxmi Rajagopalan, Yu-Lin Wei, Romit Roy Choudhury

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过纠正采样策略改进文本到图像扩散模型中多概念提示的保真度,避免模式碰撞,提升概念平衡性和鲁棒性。

Comments Accepted to ICLR 2026. Code: https://github.com/debottam-dutta7/co3

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13162 2026-03-16 eess.IV cs.CV 83%

DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression

DiT-IC:面向高效图像压缩的对齐扩散变换器

Junqi Shi, Ming Lu, Xingchen Li, Anle Ke, Ruiqi Zhang, Zhan Ma

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DiT-IC,通过三种对齐机制在紧凑的潜在空间中实现高效图像压缩,显著提升解码速度和降低内存使用,实现状态领先的感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14815 2026-03-16 cs.CV cs.AI cs.CE cs.LG physics.geo-ph 83%

Latent diffusion models for parameterization and data assimilation of facies-based geomodels

基于潜扩散模型的地质体参数化与数据同化

Guido Di Federico, Louis J. Durlofsky

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出利用潜扩散模型对基于岩性地质体进行参数化与数据同化,通过变分自编码器和U-Net实现降维与去噪,生成与参考模型一致的地质体实现。

Journal ref 10.1016/j.cageo.2024.105755

详情

展开后加载摘要…

URL PDF HTML 收藏