arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70082 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2606.08260 2026-08-10 cs.CV 版本更新 79%

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

TIDE: 任务隔离扩散模型用于统一视频编辑与生成

Qi Liu, Gang Yue, Mingyu Yin, Lisai Zhang, Yidi Wu, Yaole Wang, Yaohui Wang, Chang Yao, Jingyuan Chen, Lin Ma

机构 * Zhejiang University(浙江大学) Bilibili Inc.(哔哩哔哩股份有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07419 2026-08-10 cs.CV 版本更新 79%

DisPOSE: Projected Polystochastic Diffusion for Self-Supervised Multi-View 3D Human Pose Estimation

DisPOSE: 投影多随机扩散用于自监督多视图3D人体姿态估计

Tony Danjun Wang, Tolga Birdal, Nassir Navab, Lennart Bastian

机构 * Imperial College London(伦敦帝国学院) Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DisPOSE框架,将多视图人员分配问题建模为多随机张量空间上的生成扩散过程,通过可微Sinkhorn投影和超图卷积解码器实现自监督3D人体姿态估计,在标准数据集和手术室遮挡场景中表现优异。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10340 2026-08-10 cs.CV 版本更新 79%

Learning Ordinal Degradation Representations with Textual Priors for Diffusion-Based Blind Image Super-Resolution

通过插件分层退化表示实现稳定扩散的零样本适应

Yi-Cheng Liao, Shyang-En Weng, Yu-Syuan Xu, Chia-Hung Yuan, Wei-Chen Chiu, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) MediaTek Inc.(联发科公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HD-CLIP通过分层退化表示提升扩散模型在现实世界超分辨率中的零样本适应能力,增强细节保真度和感知真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06125 2026-08-07 cs.CV 新提交 79%

Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training

面向不确定性引导的扩散模型后训练的样本自适应潜在奖励

Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出\textsc{SURE}框架,含\textsc{SURE-LRM}与\textsc{SURE-REFL},通过样本自适应潜在奖励与不确定性引导反馈优化扩散模型,在偏好预测、SOTA性能及VBench指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05976 2026-08-07 cs.CV 新提交 79%

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model

Diff-VF:基于扩散模型的免训练高质量长视频生成

Haoning Yang, Xinyuan Chen, Yaohui Wang, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出免训练的Diff-VF框架,通过三种互补策略及跳跃残差引导,实现高质量长视频生成,在时间一致性与动作多样性上优于现有基线。

Comments Accepted for publication in ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05834 2026-08-07 cs.CV 新提交 79%

Controllable Clothing: Precise Labels and Generation for Virtual Try-On with Latent Diffusion Models

可控服装:基于潜在扩散模型的虚拟试穿精准标签与生成

Max Rehman Linder

机构 * Publicis Resources GenAI Team(阳狮集团GenAI团队) École Polytechnique(巴黎综合理工学院) KTH(皇家理工学院)

专题命中 扩散模型 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 本研究提出基于潜在扩散模型的新方法,通过开源AI模型添加标签并训练适配器,实现虚拟试穿图像的可控生成,可避免误导消费者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05804 2026-08-07 cs.CV 新提交 79%

Ordered Diffusion for 3D Human Registration

用于三维人体配准的有序扩散模型

Mattia Masiero, Ilya A. Petrov, Daniel Cremers, Gerard Pons-Moll, Riccardo Marin

机构 * University of Tübingen(蒂宾根大学) Tübingen AI Center(蒂宾根人工智能中心) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对三维人体配准的不确定性问题,提出ODin模型,将配准建模为三维扩散过程,实现了更优性能并大幅缩短配准时间。

Comments Accepted at GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05237 2026-08-07 cs.CV cs.AI 新提交 79%

In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion

上下文强制:揭示自回归视频扩散中的上下文效应

Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Tencent Youtu Lab(腾讯云图实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对自回归视频扩散模型依赖干净帧导致的时间一致性差等问题,提出In-Context Forcing方法,通过递减噪声水平的上下文实现自适应指导,兼具时间一致性与动态性,还可并行去噪加速推理,在VBench上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26237 2026-08-07 cs.CV 版本更新 79%

LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models

LumaGuide:用于扩散模型中无需训练的高动态范围(HDR)生成的分布塑造方法

Bowen Chen, Shreshth Saini, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无需训练的LumaGuide框架,通过在采样时直接塑造输出分布,实现扩散模型的可控生成,可用于HDR及视频生成,无需重新训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04906 2026-08-06 cs.CV 新提交 79%

Enhancing Low Back Pain Assessment with Diffusion Models for Lumbar Spine MRI Segmentation

利用扩散模型增强下腰痛评估的腰椎MRI分割

Maria Monzon, Thomas Iff, Ender Konukoglu, Catherine R. Jutzeler

机构 * ETH Zürich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出SpineSegDiff扩散框架,基于SPIDER数据集实现腰椎MRI的语义分割,性能接近nnUnet,可提升退化椎间盘识别,不确定性图助力临床审查,有望增强下腰痛的诊断与管理。

Comments Maria Monzon and Thomas Iff contributed equally to this work. Published in Proceedings of The 8th International Conference on Medical Imaging with Deep Learning (MIDL 2025), PMLR volume 301, pages 1145-1163, 2026

Journal ref Proceedings of Machine Learning Research 301:1145-1163, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04887 2026-08-06 cs.CV 新提交 79%

STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models

STEP-OPD:重新思考扩散模型在线策略蒸馏中的输出目标与内部动态

Qingyan Wei, Guangzhao Li, Xiaobing Tu, Yinggui Wang, Xiantao Zhang, Jinkui Ren, Xiaohong Liu, Linfeng Zhang

专题命中 扩散模型 :diffusion(title);image generation(abstract);分类 cs.CV

AI总结 该研究针对扩散模型在线策略蒸馏提出STEP-OPD框架,通过扩展学习目标、对齐表示变化,提升了生成模型性能,在多项任务中优于标准OPD方法及对应单任务教师模型。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04701 2026-08-06 cs.CV 新提交 79%

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

UniWorld-View:基于视频扩散模型的大基线视图合成

Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

机构 * Peking University(北京大学) Rabbitpre AI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniWorld-View 是结合显式 3D 指导与视频扩散建模的统一框架,可从单目输入实现可控大基线新视图合成,在基准测试中展现出优异的可控性、几何一致性与视觉保真度。

Comments Project Homepage: https://zhouhyocean.github.io/uniworld-view/ Code: https://github.com/PKU-YuanGroup/UniWorld-View

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04655 2026-08-06 cs.CV cs.AI 新提交 79%

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

CSGen:一种基于分层多模态扩散的多领域曲线结构生成模型

Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie

机构 * Hainan University(海南大学) Guangdong Ocean University(广东海洋大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对可控曲线结构图像生成的挑战,提出CSGen模型,通过构建多领域数据集、分层渐进控制策略与稀疏感知损失机制,提升生成图像的结构精度与下游分割性能,为曲线结构分析提供新范式。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04623 2026-08-06 cs.CV 新提交 79%

Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition

扩散模型中的视觉锚定:多模态零样本骨骼动作识别

Zehao Bao, Shujun Guo, Bruce X. B. Yu

机构 * The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对零样本骨骼动作识别中模态融合的问题,提出TDSM-MM模型,通过生成式分类范式结合视觉锚定,在NTU数据集上取得优异零样本识别性能,为零样本学习提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13357 2026-08-06 cs.CV cs.AI 版本更新 79%

AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers

AdaCorrection: 用于准确扩散变换器的自适应偏移缓存校正

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AdaCorrection框架,通过自适应偏移缓存校正提升扩散变换器的生成质量与缓存复用效率,减少计算开销并保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14294 2026-08-06 cs.CV cs.AI cs.LG cs.RO 版本更新 79%

Seeking Physics in Diffusion Noise

在扩散噪声中寻求物理规律

Chujun Tang, Lei Zhong, Fangqiang Ding

机构 * Brown University(布朗大学) University of Edinburgh(爱丁堡大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究通过分析预训练扩散变换器的中间去噪表示,发现物理合理与不合理视频在中层特征空间部分可分离,提出渐进轨迹选择策略提升物理一致性并降低推理成本。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03540 2026-08-05 cs.CV 新提交 79%

S$^3$-Diff: Structural Semantic Synergy Diffusion Model for High Fidelity Super Resolution of Pathological Images

S³-Diff:用于病理图像高保真超分辨率的结构语义协同扩散模型

Jiaming Liang, QiHui Han, Guangye Ou, Jiawen Liu, Haolin Chen, Xi Zhong, Jiazhou Chen, Xiaoqi Sheng, Hongmin Cai

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现有病理图像超分辨率技术易致形态平滑、语义漂移的问题,提出S³-Diff模型,通过SSA与SSFT实现高保真超分,性能优于现有最优方法,源代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03539 2026-08-05 cs.CV 新提交 79%

IRIS: Visual-Semantic Binding for Forgery-Resistant Watermarking of Diffusion Images

IRIS:用于扩散图像防伪造水印的视觉-语义绑定

Xiaoyan Feng, Zheng Gao, Tong Guan, Rui Bao, Bokang Zeng, Xiaoyu Li, Jiaojiao Jiang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 IRIS是一种无需训练的扩散图像防伪造水印方案,通过视觉-语义绑定抵御固定图案移植与事后再生剥离,在三个提示数据集上检测可靠且保真度优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03335 2026-08-05 cs.CV 新提交 79%

SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference

SPADE:用于快速视频扩散模型推理的输入自适应稀疏注意力引擎

Shanghao Liu, Renze Chen, Size Zheng, Yuanqiang Liu, Yun, Liang, Hailong Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散Transformer推理开销过高的问题,提出无训练的SPADE稀疏注意力引擎,通过三部分设计实现注意力2.26x-3.40x、端到端推理1.49x-1.80x的加速且保持生成质量。

Comments Published in the 63rd ACM/IEEE Design Automation Conference (DAC '26). 7 pages, 6 figures, 3 tables

Journal ref 63rd ACM/IEEE Design Automation Conference (DAC '26), 2026, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03082 2026-08-05 cs.CV 新提交 79%

DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers

DiverseDiT++:量化、分析与提升扩散Transformer的表示多样性

Binglei Li, Mengping Yang, Zhiyu Tan, Xiaomeng Yang, Zhizhong Huang, Junping Zhang, Hao Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对扩散Transformer(DiTs)表示学习机制不明的问题,提出加权多样性分数(WDS)指标,进而构建DiverseDiT++框架提升表示多样性,在ImageNet数据集上实现了性能提升与收敛加速。

Comments 35 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02151 2026-08-05 cs.GR 版本更新 79%

Fourier-Latent Diffusion for Constrained Generation of Triply Periodic Minimal Surfaces

用于三重周期极小曲面约束生成的傅里叶潜扩散模型

Shu Yan, Bohan Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 该研究提出基于扩散的生成框架,构建含超1.8万种TPMS的数据集,训练Transformer扩散模型实现TPMS的可控生成,满足几何与弹性能约束,为TPMS逆设计提供实用工具。

Comments 11 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27741 2026-08-05 cs.CV 版本更新 79%

SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models

SIFT: 视频扩散模型中物理合理运动的自我想象微调

Ruoyu Wang, Jialun Liu, Huayang Huang, Haibin Huang, Jiepeng Wang, Chi Zhang, Xuelong Li, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型生成运动物理不合理的问题,提出自我想象微调(SIFT)范式,通过从模型自身生成视频学习而非直接重建真实视频,结合运动感知判别监督和渐进式难例重放策略,提升运动解耦与物理真实性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15615 2026-08-05 cs.LG cs.CV 版本更新 79%

MoECa: Aligning Feature Reuse with Expert Decomposition in Diffusion Transformers

MoECa: 在扩散变换器中对齐特征复用与专家分解

Maoliang Li, Haojing Chen, Jiayu Chen, Zihao Zheng, Xinhao Sun, Hailong Zou, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Software Engineering, University of Electronic Science and Technology of China(电子科技大学软件工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对DiT-MoE中跨时间步的冗余计算,提出基于专家分支级别的细粒度缓存框架MoECa,实现分支级特征复用,并引入专家感知自适应控制和同步缓存更新,在多个模型上取得高达2.83倍加速且质量损失极小。

Comments Will appear in ACM MM'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15169 2026-08-05 cs.CV 版本更新 79%

MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion

MeSS: 基于城市网格的户外场景生成与跨视角一致扩散

Xuyang Chen, Zhijun Zhai, Kaixuan Zhou, Zengmao Wang, Jianan He, Dong Wang, Yanfeng Zhang, mingwei Sun, Rüdiger Westermann, Konrad Schindler, Liqiu Meng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MeSS通过改进跨视角一致性,利用城市网格模型生成高质量且风格一致的户外场景,并结合3D高斯点划重建技术提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23953 2026-08-05 cs.CV 版本更新 79%

T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models

T2VAttack:针对文本到视频扩散模型的对抗攻击

Changzhen Li, Yuecong Min, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * Hangzhou Institute for Advanced Study, UCAS, school of Intelligent Science and Technology(杭州高等研究院,UCAS,智能科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences (UCAS)(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 T2VAttack研究了文本到视频扩散模型的对抗攻击,提出两种攻击方法揭示模型在语义和时间动态上的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04551 2026-08-05 cs.CV 版本更新 79%

Two-Way Garment Transfer: Unified Diffusion Framework for Dressing and Undressing Synthesis

双向衣物迁移:用于穿衣和脱衣合成的统一扩散框架

Angang Zhang, Fang Deng, Hao Chen, Zhongjian Chen, Junyan Li

专题命中 扩散模型 :diffusion(title);image synthesis(abstract);分类 cs.CV

AI总结 本研究针对虚拟试穿与脱衣任务孤立研究的不足,提出双向衣物迁移模型,构建统一扩散框架,通过双向特征解纠缠和分阶段训练,在两个公开数据集上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01845 2026-08-04 cs.LG cs.CV 新提交 79%

WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model

WorldDynCache:用于扩散世界模型的风险控制隐式动力学近似

Leyang Chen, Junyi Wu, Shaoqiu Zhang, Yulun Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出WorldDynCache框架,通过风险估计器和提升隐式代理解决扩散世界模型推理慢的问题,在两个数据集上实现加速并取得最优生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01821 2026-08-04 cs.CV cs.LG 新提交 79%

DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models

DAVET:面向扩散视觉-语言模型的降噪感知视觉证据轨迹分配

Yongkang Zhou, Xiang Xia, Cheng Yan, Fan Xu, Wuyang Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DAVET 是一种无需训练的框架,通过根据扩散视觉-语言模型的生成状态自适应分配视觉证据,实现平均 1.55 倍加速且仅 1.86% 的平均性能下降,降低了视觉条件成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01276 2026-08-04 cs.CV 新提交 79%

Astrolabe: Spherical-Map Guidance Across Diffusion Pipelines for Full-Body Capture from Unconstrained Images

Astrolabe:跨扩散管道的球面图引导,用于从非约束图像中捕获全身信息

Shuliang Zhu, Qi Wang, Ryugo Morita, Jinjia Zhou

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Astrolabe适配器,通过球面图转换为噪声偏移引导扩散管道,在Puzzle-IOI和4D-Dress数据集上提升全身捕获的图像与几何指标,后视图图像增益显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00588 2026-08-04 cs.CV 新提交 79%

InstancePin: Instance-Addressable Layout-to-Image Diffusion via Coordinate Pinning

InstancePin:通过坐标锚定实现实例可寻址的布局到图像扩散模型

Chaoyue Wu, Yunfei Zhang, Si Wu

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出InstancePin框架,通过坐标锚定与实例感知适配器等技术,解决布局到图像扩散模型的实例纠缠问题,在Cityscapes数据集上提升了图像保真度与语义一致性。

Comments Accepted to PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏