arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3055 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2337 篇

2607.02643 2026-07-07 cs.CV 新提交 79%

BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models

BiSLW:用于生成扩散模型的双谱潜在水印

Aryan Pandit

机构 * PDPM Indian Institute of Information Technology, Jabalpur(印度信息技术学院(贾巴尔普尔))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散生成模型易被非法使用且缺乏可靠溯源方法的问题,提出BiSLW框架,利用潜在空间频率结构在互补谱带嵌入身份信号,平衡感知保真度与鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02038 2026-07-07 cs.CV 新提交 79%

Hierarchical Anti-Aesthetics: Protecting Facial Privacy against Customized Diffusion Models

分层反美学:保护面部隐私免受定制扩散模型侵害

Songping Wang, Yueming Lyu, Shiqi Liu, Chen Zhao, Ziyuan Chen, Ning Li, Jing Dong, Caifeng Shan

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) China Mobile Information Technology Co., Ltd.(中国移动信息科技有限公司) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Center for Research on Intelligent Perception and Computing (CRIPAC), Institute of Automation Chinese Academy of Sciences (CASIA)(多模态人工智能系统国家重点实验室(MAIS)、智能感知与计算研究中心(CRIPAC)、中国科学院自动化研究所(CASIA))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出分层反美学框架,通过全局和局部反美学奖励机制降低定制扩散模型的生成质量,从而保护面部隐私。

Comments arXiv admin note: text overlap with arXiv:2504.12129

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01983 2026-07-07 cs.CV cs.LG 新提交 79%

Open-Weather Robust 3D Detection via Dual-Critic Diffusion Alignment

基于双判别器扩散对齐的开放天气鲁棒3D检测

Shuyao Li, Chuanxing Geng, Heyang Sun, Qiang Zhou, Jingjing Gu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(工业和信息化部模式分析与机器智能重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出双判别器引导扩散对齐(DCDA)框架,通过4D雷达条件扩散过程恢复退化LiDAR特征,无需显式天气建模,在未见天气类型和强度下实现鲁棒3D检测。

Comments 18 pages, 6 figures, 8 tables. ECCV 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02515 2026-07-03 cs.CV 新提交 79%

PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation

PointDiT: 用于单目几何估计的像素空间扩散

Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geiger, Federico Tombari, Michael Niemeyer

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于纯ViT的像素空间扩散Transformer,直接在原始3D点图块上操作,无需复杂架构和潜在空间压缩,在单目几何估计中超越潜在扩散模型。

Comments ICML 2026. Project page: https://haofeixu.github.io/pointdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02461 2026-07-03 cs.CV cs.AI cs.LG 新提交 79%

OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers

OrbitQuant: 图像和视频扩散Transformer的数据无关量化

Donghyun Lee, Jitesh Chavan, Duy Nguyen, Sam Huang, Liming Jiang, Priyadarshini Panda, Timo Mertens, Saurabh Shukla

机构 * Cantina Labs(Cantina实验室) University of Southern California(南加州大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出数据无关量化方法OrbitQuant,通过归一化旋转基和Lloyd-Max码本,无需校准数据即可对扩散Transformer的权重和激活进行低比特量化,在多个模型和模态上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01869 2026-07-03 cs.CV 新提交 79%

QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers

QWERTY: 通过查询扭曲的视频扩散变换器实现无需训练的运动控制

Kyobin Choo, Youngmin Kim, Hyunkyung Han, Geunrip Park, Chanyoung Kim, Sunyoung Jung, Seong Jae Hwang

机构 * Department of Computer Science, Yonsei University(延世大学计算机科学系) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出QWERTY框架,通过扭曲查询的语义子空间,在预训练图像到视频扩散变换器中实现无需训练的运动控制,性能接近微调方法。

Comments 37 pages, 18 figures, accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01756 2026-07-03 cs.CV 新提交 79%

ProSAC-CT: Progressive Spectral-Anatomical Co-Guided Multi-Stage Diffusion Model for Low-Dose CT Denoising

ProSAC-CT: 渐进式频谱-解剖协同引导的多阶段扩散模型用于低剂量CT去噪

Xuepeng Liu, Zetong Liu, Renyiming Li, Yan Li, Ruiyu Li, Ruili Li, Jiayi Ding, Eichi Takaya

机构 * College of Medicine and Biological Information Engineering, Northeastern University(东北大学医学与生物信息工程学院) Tohoku University School of Medicine(东北大学医学院) State Key Laboratory of Oncology in South China, Sun Yat-sen University Cancer Center(华南肿瘤学国家重点实验室,中山大学肿瘤防治中心) AI Lab, Tohoku University Hospital(东北大学医院人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ProSAC-CT,一种渐进式频谱-解剖协同引导的多阶段扩散模型,通过解剖先验引导、残差频域解耦和时间步解耦解码器,有效去除低剂量CT噪声并保留解剖细节。

Comments 14 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01743 2026-07-03 cs.CV 新提交 79%

InterCMDM: Block-Causal Diffusion for Autoregressive Human Interaction Generation

InterCMDM:用于自回归人体交互生成的块因果扩散

Qing Yu, Kent Fujiwara

机构 * LY Corporation(LY公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出InterCMDM块因果潜扩散框架,通过双流因果扩散Transformer和多重任务注意力掩码实现自回归双人交互生成,解决因果性缺失和时间漂移问题,在InterHuman和InterX上达到最优性能。

Comments Accepted to ECCV 2026, Project website: https://yu1ut.com/InterCMDM-HP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01677 2026-07-03 cs.CV 新提交 79%

ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning

ICDepth: 通过上下文条件化驯服视频扩散模型用于视频深度估计

Xuanhua He, Jiaxin Xie, Mingzhe Zheng, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ICDepth框架,利用上下文条件化(ICC)将预训练文本到视频扩散Transformer适配到视频深度估计,通过SAND-Attention确保时空对齐和SRFM注入语义分辨率先验,仅用0.8M帧训练数据即达到SOTA并展现强零样本泛化。

Comments Accepted to ECCV 2026. Project page: https://xuanhuahe.github.io/ICDepth/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01370 2026-07-03 cs.CV 新提交 79%

MapDreamer: Aerial Imagery Conditioned Latent Diffusion for Lane-Level Map Generation

MapDreamer: 基于航空影像条件潜扩散的车道级地图生成

Julian Brandes, Philipp Crocoll, Wolfram Burgard

机构 * Department CSAI at University of Technology Nuremberg(纽伦堡工业大学CSAI系) Robert Bosch GmbH(罗伯特·博世有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MapDreamer,一种从单张航空影像直接生成带显式拓扑的车道级矢量地图的生成扩散模型,通过变分自编码器学习车道中心线及其拓扑的紧凑潜表示,并利用基于Transformer的潜扩散模型预测图结构,在几何和拓扑保真度上优于非生成基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31699 2026-07-03 cs.CV cs.AI 新提交 79%

Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models

用稀疏自编码器实现扩散模型中的遗忘:只看不碰

Enrico Cassano, Riccardo Renzulli, Rayyan Ahmed, Marco Grangetto, Stephan Alaniz

机构 * University of Turin(都灵大学) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎综合理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文利用稀疏自编码器作为语义检测器,通过检测并替换包含目标对象的图像区域,实现扩散模型中的对象擦除,避免了直接干预潜在空间导致的视觉伪影。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00987 2026-07-02 cs.CV 新提交 79%

AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution

AVSR-Diff: 用于时间一致任意尺度视频超分辨率的尺度无关扩散先验

Geunhyuk Youk, Jeonghyeok Do, Dayeon Kim, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) CMLab, Chung-Ang University(中央大学CMLab)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出AVSR-Diff框架,通过解耦尺度无关的潜在去噪与连续坐标渲染,并引入时间门控特征循环和尺度感知傅里叶细化模块,实现任意尺度下的高保真时间一致视频超分辨率。

Comments Accepted to ECCV 2026. Project page: https://kaist-viclab.github.io/AVSR-Diff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00647 2026-07-02 cs.CV 新提交 79%

Not All Prediction Targets Keep Training-Free Diffusion Guidance on the Manifold

并非所有预测目标都能保持无训练扩散引导在流形上

Yunsung Lee, Hyeongmin Lee

机构 * Seoul National University of Science and Technology(首尔科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文分析不同预测目标对无训练扩散引导中干净图像估计精度的影响,提出x预测能最可靠地保持引导样本在数据流形上,并引入Child FID指标评估流形损伤。

Comments Accepted to ECCV 2026. 15-page main paper with appendix (48 pages total, 14 figures). Project page: https://manluml.github.io/on-manifold-tfg

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00509 2026-07-02 cs.CV 新提交 79%

AnF-DiffPET: Anatomy- and Frequency-Guided Diffusion for PET/CT Denoising

AnF-DiffPET: 用于PET/CT去噪的解剖与频率引导扩散

Xuepeng Liu, Ruili Li, Zetong Liu, Renyiming Li, Yan Li, Yin Dai, Chao Li, Yueyang Teng

机构 * College of Medicine and Biological Information Engineering, Northeastern University(东北大学医学与生物信息工程学院) Tohoku University School of Medicine(东北大学医学院) Department of Clinical Neurosciences, University of Cambridge(剑桥大学临床神经科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出AnF-DiffPET框架,通过解剖-频率引导、多尺度交叉变换重建和频率对比硬挖掘,解决低剂量PET去噪中的解剖引导不足、多尺度特征传播不稳定和频域恢复不确定性问题,在多个数据集上优于现有方法。

Comments 11 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00382 2026-07-02 cs.CV 新提交 79%

Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

活力感知压缩:面向高效图像到形状扩散Transformer

Jaeah Lee, Hyunjin Kim, Jaewoong Cho, Gihyun Kwon

机构 * KRAFTON AI, Republic of Korea(KRAFTON AI, 韩国) Amazon, Australia(亚马逊, 澳大利亚)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出首个针对图像到形状扩散Transformer的压缩方法,通过活力引导的结构化剪枝、自适应量化和微调,在保持几何保真度下实现高达66%的模型尺寸缩减。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00058 2026-07-02 cs.CV 新提交 79%

Joint Medical Image Enhancement and Segmentation with Diffusion-based Symbiotic Information Interaction

基于扩散的共生信息交互的联合医学图像增强与分割

Ying Chen, Jinyue Li, Qiankun Li

机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) University of Science and Technology of China(中国科学技术大学) Imperial Global Singapore, Imperial College London(伦敦帝国学院新加坡分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DiSIINet,利用扩散模型和共生信息交互模块,在统一框架中实现图像增强与分割的相互促进,在多模态医学图像上取得显著性能提升。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31521 2026-07-01 eess.IV cs.CV eess.SP 新提交 79%

Distortion-Corrected Diffusion MRI Using Rotated-View EPI and Joint Field-Map/Image Estimation with Gaussian Primitives

使用旋转视图EPI和高斯原型的联合场图/图像估计的畸变校正扩散MRI

Wenqi Huang, Zhitao Li, Nan Wang, Yimeng Lin, Mengze Gao, Yurui Qian, Sevgi Gokce Kafali, Xiaozhi Cao, Kawin Setsompop, Daniel Rueckert, Congyu Liao

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital, and the School of Computation, Information and Technology, TUM(慕尼黑工业大学(TUM)医疗与医学人工智能教席、TUM大学医院、计算信息与技术学院) Neuroimaging Technology Research Center, Department of Radiology and Biomedical Imaging, University of California, San Francisco(加州大学旧金山分校放射与生物医学影像系神经影像技术研究中心) Innovation Academy for Precision Measurement Science and Technology, Chinese Academy of Sciences(中国科学院精密测量科学与技术创新研究院) Department of Radiology, Stanford University(斯坦福大学放射学系) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种物理信息框架,直接从k空间联合估计B0场和无畸变图像,避免中间并行成像重建,通过高斯原型的连续参数化表示图像和场,支持旋转视图EPI,在高b值和高加速下显著改善畸变校正质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31323 2026-07-01 cs.CV 新提交 79%

Accelerated Likelihood Maximization for Diffusion-based Versatile Content Generation

基于扩散模型的加速似然最大化用于多样化内容生成

Hyunsoo Lee, Inwoo Hwang, Young Min Kim

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出加速似然最大化(ALM)方法,通过直接优化未观测区域并引入加速策略,实现高效、全局一致的内容生成,在多种任务中超越现有方法。

Comments ECCV 2026. Project website: http://hleephilip.github.io/ALM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31318 2026-07-01 cs.CV 新提交 79%

Wavelet-Optimized Pseudo-3D Accelerated Diffusion Model for Truncated Computed Laminography

小波优化的伪3D加速扩散模型用于截断计算机层析成像

Genyuan Zhang, Junyao Wang, Chuandong Tan, Fenglin Liu, Yongning Zhou

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对计算机层析成像中的投影截断问题,提出小波优化的伪3D加速扩散模型,通过扩展重建区域和引入小波正则化消除伪影,恢复高保真3D结构。

Comments 17 pages, 11 figures, 4 tables. Under review at NDT&E International

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27935 2026-07-01 cs.CV 新提交 79%

Controllable Histopathology Image Synthesis with Training-free Structural Initialization and Textural Modulation

可控的组织病理学图像合成:无需训练的结构初始化和纹理调制

Yuheng Qiu, Jingyi Luo, Chenfei Ye, Ting Ma, Jianfeng Cao

机构 * School of Biomedical Engineering, Harbin Institute of Technology (Shenzhen), Shenzhen, China(哈尔滨工业大学(深圳)生物医学工程学院,深圳,中国)

专题命中 扩散模型 :image synthesis(title);diffusion(abstract);分类 cs.CV

AI总结 提出CHIS框架,通过频率域结构初始化和小波域纹理调制,使无标签预训练扩散模型生成与先验结构掩码对齐且保持参考组织风格的图像,提升下游分割任务性能。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28092 2026-06-29 cs.CV 新提交 79%

Diffusion Model Attribution via Spectral Coupling of Denoiser Responses

通过去噪器响应的谱耦合进行扩散模型归因

Pragati Shuddhodhan Meshram, Varun Chandrasekaran

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出谱去噪签名(SDS)方法,通过分析去噪过程中的谱几何特性,实现高精度非侵入式扩散模型归因,准确率达99.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28039 2026-06-29 cs.CV cs.AI 新提交 79%

Mind the Gap: Quantifying the Domain Gap in Cross-Sensor Diffusion Super-Resolution

注意差距:量化跨传感器扩散超分辨率中的域差距

Dawid Kopeć, Katarzyna Jabłońska, Wojciech Kozłowski, Maciej Zięba

机构 * WUST(弗罗茨瓦夫科技大学) Tooploox

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对跨传感器超分辨率中合成数据与真实数据之间的域差距,首次系统研究其对扩散模型的影响,提出域自适应感知指标LPIPS-Sat,并揭示合成训练与真实训练的双重挑战。

Comments 26th International Conference on Computational Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27988 2026-06-29 cs.CV 新提交 79%

Latent Visual Diffusion Reasoning with Monte Carlo Tree Search

潜在视觉扩散推理与蒙特卡洛树搜索

Xirui Teng, Nan Xi, Junsong Yuan

机构 * Beijing Jiaotong University(北京交通大学) Virginia Commonwealth University(弗吉尼亚联邦大学) University at Buffalo(布法罗大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出LVDR框架,结合关键点引导的蒙特卡洛树搜索,实现细粒度技能活动的可解释视觉推理,在多个体育和手术数据集上取得竞争性表现。

Comments Accepted to ECCV 2026. Project page: https://github.com/XiruiTeng/LVDR_Official.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27760 2026-06-29 cs.CV 新提交 79%

PixelU: A U-Shaped Transformer for Efficient End-to-End Pixel Diffusion

PixelU: 一种用于高效端到端像素扩散的U形Transformer

Zipeng Guo, Lichen Ma, Yu He, Xiaolong Fu, Jingling Fu, Junshi Huang, Yan Li

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PixelU,一种极简单阶段U形扩散Transformer,通过零成本跳跃连接和恒通道空间下采样解耦高低频建模,在ImageNet上以约1/3计算成本超越强基线JiT-G。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27659 2026-06-29 cs.CV 新提交 79%

GeoFace: Consistent Multi-View Face Generation with Geometry-Constrained Diffusion

GeoFace: 基于几何约束的一致多视角人脸生成扩散模型

Yeji Choi, Jinhyeok Choi, Jaewon Min, Minkyung Kwon, Jin Hyeon Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出GeoFace,一种几何约束的多视角扩散框架,通过外观与几何流的共享注意力层和几何引导注意力对齐损失,实现从单张输入生成一致的多视角人脸图像和3D几何,显著提升跨视角几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26712 2026-06-26 eess.IV cs.AI cs.CV 新提交 79%

MLFFM-SegDiff: A Multi-Level Feature Fusion Diffusion Model for Skin Lesion Segmentation

MLFFM-SegDiff:一种用于皮肤病变分割的多级特征融合扩散模型

Jingjun Gu, Chaojie Shen, Yifeng Cao, Wei Zhang, Yiliu Li, Aobo Fan

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对皮肤镜图像分割中边界模糊、对比度低等问题,提出基于扩散模型的多级特征融合方法MLFFM-SegDiff,通过双路径U-Net编码器、多级特征融合模块和边界敏感损失函数提升分割精度,在ISIC2018等数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27123 2026-06-26 cs.RO cs.CV 新提交 79%

Proposal-Conditioned Latent Diffusion for Closed-Loop Traffic Scenario Generation

基于提议条件的闭环交通场景生成潜扩散模型

Shubham Vaijanath Phoolari, Aleyna Kara, Christoph Lauer, Steven Peters

机构 * CARIAD SE Technical University of Munich(慕尼黑工业大学) Institute of Automotive Engineering (FZD), TU Darmstadt(达姆施塔特工业大学汽车工程研究所(FZD))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于实例场景上下文和多模态提议先验的扩散框架,通过紧凑动作潜表示和提议初始化提升采样效率,实现闭环交通场景的逼真、安全且可控生成。

Comments Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26938 2026-06-26 cs.CV 新提交 79%

Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE

关注重要之处:面向扩散MoE的显著性引导精确路由

Haoyou Deng, Keyu Yan, Chaojie Mao, Xiang Wang, Yu Liu, Changxin Gao, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院图像处理与智能控制重点实验室) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散MoE中路由无法准确分配计算资源给显著令牌的问题,提出SharpMoE后训练框架,利用干净潜在特征作为无噪声引导信号,并引入轨迹路由损失,实现精确资源分配,在视觉生成中达到最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26778 2026-06-26 cs.CV cs.LG 新提交 79%

LearniBridge: Learnable Calibration of Feature Caching for Diffusion Models Acceleration

LearniBridge: 用于扩散模型加速的特征缓存的可学习校准

Xuyue Huang, Zhe Chen, Wang Shen, Xiao-Ping Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出LearniBridge,一种基于低秩共享子空间的可学习校准机制,通过轻量LoRA更新实现特征缓存的多时间步校准,仅需3-5个训练样本即可在图像和视频生成中实现高达5.87倍加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26769 2026-06-26 cs.AI cs.CV 新提交 79%

ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration

ResilPhase: 即插即用的相位映射与抗噪宏轨迹外推用于扩散加速

Qicheng Zhao, Yu Li, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散模型推理延迟高的问题,提出ResilPhase框架,通过将加速推理重构为ODE空间中的稳定宏轨迹外推,并引入无导数重心拉格朗日外推器和有界相位映射,实现高加速比下的抗噪加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏