arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2510.05356 2026-06-09 cs.CV cs.LG 版本更新 85%

Mitigating Diffusion Model Hallucinations with Dynamic Guidance

通过动态引导缓解扩散模型幻觉

Kostas Triaridis, Alexandros Graikos, Aggelina Chatziagapi, Grigorios G. Chrysos, Dimitris Samaras

机构 * Stony Brook University(石溪大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型因分数函数过度平滑导致的幻觉问题,提出动态引导方法,沿预定方向选择性锐化分数函数,保留有效语义变化,显著减少幻觉。

Comments Project page: https://cvlab-stonybrook.github.io/DynamicGuidance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04264 2026-06-04 cs.CV 85%

UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation

UniCanvas: 一种基于扩散的图文联合生成统一模型

Zeyuan Yang, Hao-Wei Chen, Xueyang Yu, Yuncong Yang, Haoyu Zhen, Ziqiao Ma, Maohao Shen, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) University of Michigan(密歇根大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出UniCanvas,通过扩散模型在像素画布上以文本嵌入图像的方式实现图文联合生成,解决现有模型在视觉与文本生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01380 2026-06-02 cs.CV 85%

Training-free image inversion for one-step diffusion models

无需训练的一步扩散模型图像反演

Tao Wu, Senmao Li, Yaxing Wang, Shiqi Yang, Kai Wang, Joost van de Weijer

机构 * CVC, University of Alabama in Birmingham(CVC,阿拉巴马大学伯明翰分校) Machine Intelligence Institute, Masdar Institute of Science and Technology(机器智能研究所,马斯达尔科技 institute) Jilin University(吉林大学) City University of Hong Kong, Department of Geography(香港城市大学地理系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 提出一种无需训练的反演框架TFinv,通过迭代噪声对齐和后缀学习解决一步扩散模型中真实图像反演与编辑的关键挑战,实现高效编辑。

Comments Accepted to Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06453 2026-06-02 cs.CV 85%

Pinterest Canvas: Large-Scale Image Generation at Pinterest

Pinterest Canvas: Pinterest 的大规模图像生成系统

Yu Wang, Eric Tzeng, Raymond Shiau, Jie Yang, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest, Inc.(Pinterest公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出 Pinterest Canvas,一个基于扩散模型的大规模图像生成系统,通过基础模型微调为特定任务(如背景增强和宽高比外扩)生成专用模型,并在线上实验中分别获得18.0%和12.5%的参与度提升。

Comments Accepted by KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16880 2026-05-29 cs.CV cs.AI cs.LG 85%

Finding DoRI: Discovery of Retained Images in Diffusion Models

Finding DoRI: 扩散模型中保留图像的发现

Antoni Kowalczuk, Dominik Hintersdorf, Lukas Struppek, Kristian Kersting, Adam Dziedzic, Franziska Boenisch

机构 * CISPA Helmholtz Center for Information Security(CISPA信息安全研究中心) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Technical University of Darmstadt(达姆施塔特技术大学) Hessian Center for AI (Hessian.AI)(黑森人工智能中心(Hessian.AI)) Centre for Cognitive Science, Technical University of Darmstadt(达姆施塔特技术大学认知科学中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 通过挑战记忆局部化假设,发现文本嵌入的小扰动可重新触发数据复制,并证明记忆本质上是非局部的,从而提出对抗微调实现更鲁棒的缓解方法。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28036 2026-05-28 cs.CV cs.LG 85%

Stay Fair! Ensuring Group Fairness in Diffusion Models Across Guidance Scales

保持公平!确保扩散模型在不同引导尺度下的群体公平性

Myeongsoo Kim, Eunji Kim, Minwoo Chae, Sangwoo Mo

机构 * POSTECH Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出StayFair方法,通过分解总偏差为模型偏差和引导偏差,并扩展强人口平价到引导过程,设计公平引导算法,使扩散模型在不同引导尺度下保持群体公平性。

Comments 28 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09675 2026-05-28 cs.CV 85%

Accelerating Diffusion Sampling via Exploiting Local Transition Coherence

利用局部转移一致性加速扩散采样

Shangwen Zhu, Han Zhang, Zhantao Yang, Qianyu Peng, Zhao Pu, Huangji Wang, Fan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种无需训练的加速方法LTC-Accel,通过利用相邻步骤间转移算子的统计关系来估计当前转移算子,从而加速文本到图像和视频的扩散采样,兼容多种网络结构和现有加速技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01608 2026-05-27 cs.CV 85%

Guiding Token-Sparse Diffusion Models

引导令牌稀疏扩散模型

Felix Krause, Stefan Andreas Baumann, Johannes Schusterbauer, Olga Grebenkova, Ming Gui, Vincent Tao Hu, Björn Ommer

机构 * CompVis

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对稀疏训练扩散模型在推理时对无分类器引导响应不足的问题,提出令牌级稀疏引导方法,在保持输出高质量和高方差的同时降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25191 2026-05-26 cs.CV 85%

Injecting Image Guidance into Text-Conditioned Diffusion Models at Inference

在推理时将图像引导注入文本条件扩散模型

Agata Żywot, Iason Skylitsis, Thijmen Nijdam, Zoe Tzifa-Kratira, Derck Prinzhorn, Konrad Szewczyk, Aritra Bhowmik

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出视觉概念融合(VCF),一种无需重新训练即可在推理时同时以图像和文本为条件进行双重引导的方法,通过对齐CLIP图像特征与文本嵌入空间实现视觉概念注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25123 2026-05-26 cs.LG cs.AI cs.CL cs.CV stat.ML 85%

Inference-Time Alignment of Diffusion Models via Trust-Region Iterative Twisted Sequential Monte Carlo

扩散模型的推理时对齐:基于信任区域迭代扭曲序贯蒙特卡洛方法

Weixin Wang, Yu Yang, Wei Deng, Pan Xu

机构 * Duke University(杜克大学) Morgan Stanley(摩根大通)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出信任区域迭代扭曲序贯蒙特卡洛(TRI-TSMC)框架,通过迭代学习扭曲函数来改进扩散模型推理时的对齐,在文本生成和文本到图像生成任务上优于现有方法。

Comments 34 pages, 6 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24631 2026-05-26 cs.LG cs.AI cs.CV 85%

Beyond Generative Priors: Minority Sampling with JEPA-Guided Diffusion

超越生成先验:JEPA引导扩散的少数采样

Sol Park, Soobin Um

机构 * Department of Artificial Intelligence, Kookmin University, Seoul, South Korea(人工智能系,韩国全州大学,首尔)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种基于世界模型JEPA引导的扩散采样框架,通过近似策略实现高效计算,在无条件、类别条件和文本到图像生成中提升少数样本的保真度和语义有效性。

Comments ICML 2026, 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22668 2026-05-22 cs.CV 85%

SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers

SEGA:用于扩散变换器中分辨率外推的频谱-能量引导注意力

Javad Rajabi, Kimia Shaban, Koorosh Roohi, David B. Lindell, Babak Taati

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 SEGA通过动态调整注意力权重来提升扩散变换器在高分辨率生成中的表现,其核心方法是根据潜在空间的频谱结构调整RoPE组件的注意力缩放,从而在保持全局结构和恢复细节方面取得平衡。

Comments 27 pages, 14 figures. Project page: https://rajabi2001.github.io/sega/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21123 2026-05-21 cs.CV cs.LG 85%

Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models

Linear-DPO: 用于扩散和流匹配生成模型的线性直接偏好优化

Kesong Li, Yixuan Xu, Kuo-kun Tseng, Weiyi Lu, Kan Liu, Tao Lan

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Linear-DPO,通过统一的反向时间SDE框架推导出涵盖扩散和流匹配的通用DPO目标,指出标准DPO目标在文本到图像生成中不最优,并通过定性定量实验验证了其在扩散模型和流匹配模型上的优越性。

Comments Code and models are available at: https://github.com/Whynot0101/Linear-DPO . Work done during an internship at Alibaba Group

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20316 2026-05-21 cs.CV cs.AI 85%

FullFlow: Upgrading Text-to-Image Flow Matching Models for Bidirectional Vision--Language Generation

FullFlow: 通过双向视觉-语言生成升级文本到图像流匹配模型

Eric Tillmann Bill, Enis Simsar, Alessio Tonioni, Thomas Hofmann

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出FullFlow方法,通过仅训练LoRA适配器和轻量级文本头部,将预训练的rectified-flow文本到图像模型升级为双向视觉-语言生成器,从而在保持图像连续流的同时添加文本离散插入过程,提升文本到图像和图像到文本的生成质量。

Comments project page: https://ericbill21.github.io/fullflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20309 2026-05-21 cs.CV cs.AI 85%

Tiny-Engram: Trigger-Indexed Concept Tables for Generative Vision

Tiny-Engram: 生成视觉中的触发索引概念表

Runyuan Cai, Yiming Wang, Yu Lin, Xiaodong Zeng

机构 * AutoArk-AI

专题命中 扩散模型 :generative vision(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Tiny-Engram,一种紧凑的触发索引概念表,通过显式地为视觉记忆分配词汇地址和激活边界,实现对冻结图像和视频生成器中的概念的控制。该方法通过注册的n-gram匹配索引参数化每个概念,仅在匹配触发区域调节文本编码器的隐藏状态,从而在保持周围提示的组合控制的同时,将罕见触发短语绑定到目标身份。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10180 2026-05-20 cs.CV cs.CR 85%

What Concepts Lie Within? Detecting and Suppressing Risky Content in Diffusion Transformers

什么概念在其中?在扩散变换器中检测和抑制危险内容

Chenyu Zhang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究了如何在扩散变换器中检测和抑制危险内容,提出了一种无需训练的推理时安全机制AHV-D&S,通过分析注意力头对概念的敏感性来检测和抑制危险生成倾向,有效压制了性内容、受版权保护的内容及有害内容,同时保持视觉质量。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16736 2026-05-20 cs.CV 85%

CAB: Accelerating Flow and Diffusion Sampling via Rectification and Corrected Adams-Bashforth

CAB: 通过校正和修正Adams-Bashforth加速流和扩散采样

Anuska Roy, Pravin Nair

机构 * Department of Electrical Engineering(电气工程系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的采样器CAB,通过将采样动态转换为统一的校正坐标系,并应用带有基于过去速度评估的简单修正项的多步Adams-Bashforth预测器,从而在不增加额外函数评估次数的情况下加速流和扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10759 2026-05-19 cs.LG cs.CV 85%

Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

强化共轭匹配:扩散和流匹配模型的后训练强化学习扩展

Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) King's College London(伦敦国王学院) Microsoft Research New England(微软研究院新英格兰分部) University of Oxford(牛津大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Reinforce Adjoint Matching方法,通过强化学习后训练优化扩散和流匹配模型,无需SDE回滚或梯度,提升生成质量与人类偏好匹配度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02307 2026-05-18 cs.CV cs.AI 85%

NoiseShift: Resolution-Aware Noise Recalibration for Better Low-Resolution Image Generation

NoiseShift: 为更好的低分辨率图像生成的分辨率感知噪声校准

Ruozhen He, Moayed Haji-Ali, Ziyan Yang, Vicente Ordonez

机构 * Rice University(里士大学)

专题命中 扩散模型 :image generation(title);diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 本文提出NoiseShift,通过校准噪声条件以恢复局部正反向一致性,提升低分辨率图像生成质量,无需额外计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18944 2026-05-18 cs.CV cs.AI cs.CR 85%

Rethinking and Red-Teaming Protective Perturbation in Personalized Diffusion Models

重新审视并红队测试个性化扩散模型中的保护扰动

Yixin Liu, Ruoxi Chen, Xun Chen, Lichao Sun

机构 * Lehigh University(莱维大学) Lehigh University Computer Science(莱维大学计算机科学) Engineering Bethlehem PA USA(工程 布雷顿 佛罗里达 美国) Independent Researcher(独立研究员) Independent Researcher Fremont California USA(独立研究员 佛罗里达 加州 美国)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过快捷学习视角分析PDM微调过程,揭示对抗扰动导致的潜在空间错位问题,提出数据净化与对比解耦学习框架以提升保护性能。

Comments Code is available at https://github.com/liuyixin-louis/DiffShortcut

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09065 2026-05-12 cs.CV cs.LG 85%

Dependency-Aware Discrete Diffusion for Scene Graph Generation

面向依赖关系的离散扩散用于场景图生成

Rajalaxmi Rajagopalan, Romit Roy Choudhury

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种依赖感知的层次约束离散扩散模型,用于生成场景图,通过分离结构与语义,提升生成的依赖关系和层次结构,实验显示在场景图和布局指标上优于基线方法,并在多对象场景中提升图像生成的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07973 2026-05-11 cs.CV 85%

HEART: Hyperspherical Embedding Alignment via Kent-Representation Traversal in Diffusion Models

HEART:通过扩散模型中的Kent表示遍历实现超球面嵌入对齐

Arani Roy, Shristi Das Biswas, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出HEART框架,通过超球面几何对齐实现图像生成中的直观精确编辑,无需微调或优化,提升控制精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17966 2026-05-08 eess.IV cs.CV 85%

A Wavelet Diffusion GAN for Image Super-Resolution

基于小波的扩散GAN用于图像超分辨率

Lorenzo Aloisi, Luigi Sigillo, Aurelio Uncini, Danilo Comminiello

机构 * Department of Information Engineering, Electronics and Telecommunications (DIET)(信息工程、电子与电信系) ``Sapienza'' University of Rome(罗马大学萨皮恩扎分校) Via Eudossiana 18, 00184, Rome(埃杜斯西亚纳街18号,00184,罗马)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于小波的扩散GAN方案,通过减少反向扩散步骤和利用小波变换进行降维,提升图像超分辨率的训练和推理效率。实验验证在CelebA-HQ数据集上优于现有方法,实现高保真输出。

Comments The paper has been accepted at Italian Workshop on Neural Networks (WIRN) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01510 2026-05-05 cs.CV 85%

SwiftPie: Lightning-fast Subject-driven Image Personalization via One step Diffusion

SwiftPie: 通过一步扩散实现闪电般的主体驱动图像个性化

Huy Duong, Trong-Tung Nguyen, Cuong Pham, Anh Tran, Khoi Nguyen, Minh Hoai

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 SwiftPie提出一种一步扩散模型,实现快速主体驱动图像生成,通过双分支身份注入机制和掩码引导重缩放策略,提升生成效率和质量。

Comments CVPR26 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25299 2026-04-29 cs.CV cs.AI 85%

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

思考像素:多模态扩散潜在中的递归稀疏推理

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种递归稀疏混合专家框架,用于提升多模态文本生成任务中视觉token的生成质量,通过递归机制和稀疏参数共享提高生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21289 2026-04-24 cs.CV 85%

AttDiff-GAN: A Hybrid Diffusion-GAN Framework for Facial Attribute Editing

AttDiff-GAN:一种用于面部属性编辑的混合扩散-生成对抗网络框架

Wenmin Huang, Weiqi Luo, Xiaochun Cao, Jiwu Huang

机构 * GuangDong Province Key Lab of Information Security Technology and School of Computer Science and Engineering(广东信息安全技术重点实验室和计算机科学与工程学院) School of Cyber Science and Technology, Shenzhen Campus(深圳校区网络科学与技术学院) Guangdong Laboratory of Machine Perception and Intelligent Computing, Faculty of Engineering(广东机器感知与智能计算实验室,工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出AttDiff-GAN框架,结合GAN属性操控与扩散图像生成,通过特征级对抗学习和PriorMapper、RefineExtractor提升风格-属性对齐,实现更精确的面部属性编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21008 2026-04-24 cs.CV 85%

Linear Image Generation by Synthesizing Exposure Brackets

通过合成曝光快门生成线性图像

Yuekun Dai, Zhoutong Zhang, Shangchen Zhou, Nanxuan Zhao

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Adobe NextCam Adobe Research(Adobe研究院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出基于文本的线性图像生成方法,通过合成曝光快门序列生成高质量场景参考线性图像,保留完整动态范围,用于专业后期处理。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20354 2026-04-23 cs.CV 85%

Hallucination Early Detection in Diffusion Models

扩散模型中的幻觉早期检测

Federico Betti, Lorenzo Baraldi, Lorenzo Baraldi, Rita Cucchiara, Nicu Sebe

机构 * University of Trento(特伦托大学) Università di Pisa(比萨大学) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出HEaD+方法,通过整合交叉注意力图和文本信息,早期检测扩散模型生成中的幻觉问题,提高生成完整图像的准确率并减少生成时间。

Comments 21 pages, 6 figures, 4 tables. Published in International Journal of Computer Vision (IJCV)

Journal ref Int. J. Comput. Vis. 134, 35 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19135 2026-04-22 cs.CV 85%

Diff-SBSR: Learning Multimodal Feature-Enhanced Diffusion Models for Zero-Shot Sketch-Based 3D Shape Retrieval

Diff-SBSR: 学习多模态特征增强的扩散模型用于零样本素描基础3D形状检索

Hang Cheng, Fanhe Dong, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出利用文本到图像扩散模型解决零样本素描基础3D形状检索问题,通过多模态特征增强策略提升语义上下文捕捉能力,实验表明方法在公开基准上优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18076 2026-04-21 cs.CV cs.AI 85%

Class-specific diffusion models improve military object detection in a low-data domain

特定类别的扩散模型在低数据域中改进军事目标检测

Ella P. Fokkinga, Jan Erik van Woerden, Thijs A. Eker, Sebastiaan P. Snel, Elfi I. S. Hofmeijer, Klamer Schutte, Friso G. Heslinga

机构 * TNO - Intelligent Imaging(TNO智能成像实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文通过特定类别的扩散模型生成合成数据,提升低数据条件下军事车辆检测性能,特别是在样本稀少时效果显著,同时引入结构引导生成数据进一步增强模型表现。

Comments Submitted to SPIE Defense + Security

详情

展开后加载摘要…

URL PDF HTML 收藏