arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2602.11130 2026-05-19 cs.LG cs.CV 79%

Meltdown: Circuits and Bifurcations in Point-Cloud-Conditioned 3D Diffusion Transformers

Meltdown: 点云条件化3D扩散变换器中的电路与分叉

Maximilian Plattner, Fabian Paischer, Johannes Brandstetter, Arturs Berzins

机构 * Institute for Machine Learning, JKU Linz(机器学习研究所,林茨大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究探讨了点云条件化3D扩散变换器在输入变化下的失败模式,揭示了Meltdown现象,通过机制性案例研究展示了其成因,并提出了PowerRemap方法以抑制该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12598 2026-05-19 cs.CV 79%

Setting the Stage: Text-Driven Scene-Consistent Image Generation

设定舞台:基于文本的场景一致图像生成

Cong Xie, Che Wang, Yan Zhang, Ruiqi Yu, Han Zou, Zheng Pan, Zhenpeng Zhan

机构 * Global Business Unit, Baidu Inc.(百度公司全球业务部)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文研究了场景构建任务,通过结合参考场景图像和文本条件生成符合空间关系的演员图像,提出了一种新的数据构建管道和对应关系引导的注意力损失,以提高场景一致性和文本-图像一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06384 2026-05-19 eess.IV cs.CV 79%

Mitigating 3D Prostate Biparametric MRI Data Scarcity through Domain Adaptation using Locally-Trained Latent Diffusion Models for Prostate Cancer Detection

通过使用本地训练的潜在扩散模型进行领域适应以缓解3D前列腺双参数MRI数据稀缺问题

Emerson P. Grabke, Babak Taati, Masoom A. Haider

机构 * Institute of Biomedical Engineering, University of Toronto(多伦多大学生物医学工程研究所) Lunenfeld-Tanenbaum Research Institute, Mount Sinai Hospital(圣心医院卢内尔-塔内本研究所) KITE Research Institute, Toronto Rehabilitation Institute, University Health Network(多伦多康复研究所、KITE研究所在大学健康网络) Joint Department of Medical Imaging, University of Toronto, Princess Margaret Hospital, and Sinai Health systems(多伦多大学联合医学影像部门、玛格丽特医院及辛纳医疗系统) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Faculty Affiliate of the Vector Institute, Toronto(向量研究所教职员工)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CCELLA++,一种新的潜在扩散模型流程,用于同时生成3D双参数前列腺MRI(bpMRI),包括轴向T2加权(AxT2)、高b值扩散系列(HighB)和表观扩散系数图(ADC),以克服数据稀缺问题。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18158 2026-05-19 cs.CV eess.IV 79%

Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion

语义解耦与组合用于具有高效LLM推理和生成扩散的通用图像编码

Jinming Liu, Yuntao Wei, Junyan Lin, Shengyang Zhao, Heming Sun, Zhibo Chen, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Ningbo Institute of Digital Twin(宁波数字孪生研究院) Eastern Institute of Technology(东部技术研究院) University of Science and Technology of China(中国科学技术大学) Yokohama National University(Yokohama国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UniCodec,一种基于语义解耦和组合生成的通用图像编码框架,通过高效LLM推理和生成扩散模型实现人类和机器需求的统一压缩,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17248 2026-05-19 cs.CV 79%

Image-to-Video Diffusion: From Foundations to Open Frontiers

图像到视频扩散:从基础到开放前沿

Xianlong Wang, Wenbo Pan, Shijia Zhou, Ke Li, Yuqi Wang, Zeyu Ye, Hangtao Zhang, Leo Yu Zhang, Xiaohua Jia

机构 * IEEE Publication Technology Group(IEEE出版技术组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了图像到视频扩散生成的核心问题,通过梳理任务定义、模型架构、数据集和评估指标,提出了一种基于架构和训练范式的分类方法,并总结了四个核心设计:条件编码、时间建模、噪声先验设计和空间时间上采样,探讨了代表性应用场景和主要开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17087 2026-05-19 cs.CV 79%

The Learnability Gap in Medical Latent Diffusion

医学潜在扩散中的可学习差距

Mischa Dombrowski, Felix Nützel, Bernhard Kainz

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了医学图像中潜在扩散模型在处理类别不平衡问题时的可学习差距,指出尽管预训练的自动编码器能有效编码判别特征,但其潜在表示的结构性使分类器难以学习,通过开发噪声条件潜在分类器和图像空间蒸馏技术,提高了效率并改善了潜在空间质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16990 2026-05-19 cs.CV 79%

DreamEdit3D: Personalization of Multi-View Diffusion Models for 3D Editing

DreamEdit3D: 多视角扩散模型的3D编辑个性化

Jinxin Ai, Matthias Nießner, Ziya Erkoç

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DreamEdit3D,通过自然语言实现多视角扩散模型的3D编辑个性化,通过提取语义组件并学习不同组件的token嵌入,实现多视角一致的高质量3D编辑。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16949 2026-05-19 cs.CV 79%

Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers

超越点对点匹配:为加速扩散变换器的结构表示对齐

Shaodong Xu, Zhendong Wang, Litong Gong, Zexian Li, Wengang Zhou, Tiezheng Ge, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出sREPA框架,通过显式结构约束来对齐特征图的相对几何关系,以提高生成质量并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16918 2026-05-19 cs.CV 79%

HighSync: High-Quality Lip Synchronization via Latent Diffusion Models

HighSync: 通过潜在扩散模型实现高质量唇部同步

Saeed Firouzi Daghigh, Majid Iranpour Mobarekeh, Mostafa Alavi, Mehdi Bagheri

机构 * Department of Computer Engineering and Information Technology, Payam Noor University(Payam Noor大学计算机工程与信息科技系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HighSync,一种端到端的扩散框架,用于生成与任意输入音频对齐的逼真说话人脸视频。该方法同时解决了图像质量和同步准确性之间的矛盾,是首个原生在512*512分辨率上运行的唇部同步模型,适用于电影和广播行业等专业生产环境。

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16807 2026-05-19 cs.CV 79%

DecoRec: Decomposed 3D Scene Reconstruction from Single-View Images via Object-Level Diffusion

DecoRec: 通过物体级扩散进行单视图图像的分解3D场景重建

Yuhan Ping, Yuan Liu, Xiaoxiao Long, Peng Wang, Junhui Hou, Jianyi Zheng, Jia Pan, Xin Li, Cheng Lin

机构 * Department of Computer Science, the University of Hong Kong(香港大学计算机科学系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Faculty of Humanities and Arts, Macau University of Science and Technology(澳门科学理工学院人文艺术学院) Department of Computer Science and Engineering, Texas A&M University(德克萨斯A&M大学计算机科学与工程系) Department of Computer Science and Engineering, Macau University of Science and Technology(澳门科学理工学院计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DecoRec系统,通过物体级扩散方法实现单视图图像的分解3D场景重建,解决了现有方法在场景重建中出现的精度问题,并通过可微渲染和扩散引导细化技术提升重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14223 2026-05-19 cs.CV 79%

StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion Model

StreamingTalker: 基于音频的3D面部动画与自回归扩散模型

Yifan Yang, Zhi Cen, Sida Peng, Xiangwei Chen, Yifu Deng, Xinyu Zhu, Fan Jia, Xiaowei Zhou, Hujun Bao

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) College of Computer Science, Zhejiang University(浙江大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于自回归扩散模型的StreamingTalker,解决音频驱动3D面部动画中长音频处理延迟和超训练范围的问题,通过动态条件生成高质量实时面部动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20389 2026-05-19 eess.IV cs.CV 79%

High-Resolution Reference Image Assisted Volumetric Super-Resolution of Cardiac Diffusion Weighted Imaging

高分辨率参考图像辅助的心脏扩散加权成像体积分辨率提升

Yinzhe Wu, Jiahao Huang, Fanwen Wang, Pedro Ferreira, Andrew Scott, Sonia Nielles-Vallespin, Guang Yang

机构 * Department of Bioengineering, Imperial College London(帝国理工学院生物工程系) Cardiovascular Magnetic Resonance Unit, Royal Brompton Hospital(皇家布里托尼医院心血管磁共振单位) National Heart and Lung Institute, Imperial College London(帝国理工学院国家心脏和肺研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于深度学习的体积分辨率提升框架,利用高分辨率b0 DWI作为输入,提升心脏扩散加权成像的图像质量,并证明了该框架在未见b值下的泛化能力。

Comments Accepted by SPIE Medical Imaging 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16444 2026-05-19 cs.CV cs.AI 79%

Diffusion Attention Expert Model for Predicting and Semi-automatic Localizing STAS in Lung Cancer Histopathological Images

扩散注意力专家模型用于预测和半自动定位肺癌组织病理图像中的STAS

Liangrui Pan, Jiadi Luo, Yuxuan Xiao, Chenchen Nie, Xiaoshuai Wu, Songqing Fan, Ling Chu, Manqiu Li, Rongfang He, Zhenyu Zhao, Ruixing Wang, Shulin Liu, Yiyi Liang, Xiang Wang, Qingchun Liang, Shaoliang Peng

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Department of Pathology, The Second Xiangya Hospital, Central South University(中南大学湘雅医院病理科) Hunan Clinical Medical Research Center for Cancer Pathogenic Genes Testing and Diagnosis(湖南临床医学肿瘤基因检测与诊断研究中心) Department of Thoracic Surgery, The Second Xiangya Hospital, Central South University(中南大学湘雅医院胸外科) Department of pathology, Hunan Cancer Hospital, The Affiliated Cancer Hospital of Xiangya School of Medicine, Central South University(湖南肿瘤医院病理科) Department of Pathology, The Third Xiangya Hospital, Central South University(中南大学湘雅第三医院病理科) Department of Pathology, First People's Hospital of Pingjiang County(平江县第一人民医院病理科) Department of Pathology, the First Affiliated Hospital, Hengyang Medical School, University of South China(南华大学衡阳医学院第一附属医院病理科) Department of Radiology, The Second Xiangya Hospital of Central South University(中南大学湘雅医院放射科) Department of Radiology, Xiangya Hospital, Central South University(中南大学湘雅医院放射科) Oncology Department and State Key Laboratory of Systems Medicine for Cancer of Shanghai Cancer Institute, Renji Hospital, School of Medicine, Shanghai Jiaotong University(上海癌症研究院肿瘤科及上海交通大学医学院系统医学重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DAEM模型,通过多尺度特征学习和双分支架构提升STAS检测精度,实现对冷冻切片和石蜡切片的高AUC值检测,并利用肿瘤微环境特征实现STAS半自动定位。

Comments Accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16420 2026-05-19 cs.CV cs.LG 79%

Video Reconstruction using Diffusion-based Image-to-Video Generation with Trajectory Guidance

基于扩散模型的图像到视频生成与轨迹引导的视频重建

Stelio Bompai, Ioannis Kontopoulos, Giannis Spiliopoulos, Dimitris Zissis, Konstantinos Tserpes

机构 * Department of Electrical and Computer Engineering, National Technical University of Athens, Greece(电气与计算机工程系,希腊国家技术大学雅典分校) Department of Product and Systems Design Engineering, University of the Aegean, Syros, Greece(产品与系统设计工程系,爱琴海大学锡罗斯分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用预训练的图像到视频扩散模型,通过GPS轨迹引导生成无人机视频的缺失或丢失帧,无需领域特定微调,展示了在低纹理和小目标条件下视频重建的有效性。

Comments Accepted at the 1st Workshop on Multi-Sensor Trajectory Knowledge Discovery and Extraction (MuseKDE 2026), co-located with the 27th IEEE International Conference on Mobile Data Management (IEEE MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15908 2026-05-18 cs.CV cs.AI 79%

RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations

RaPD:通过语义增强的隐式表示实现分辨率无关的像素扩散

Yanhao Ge, Shanyan Guan, Weihao Wang, Ying Tai, Mingyu You

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RaPD通过语义表示引导和坐标查询注意力渲染器,在连续神经图像场的潜在空间中实现分辨率无关的像素扩散,解决了重建与生成之间的差距,提升了生成质量和分辨率扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15895 2026-05-18 eess.IV cs.CV 79%

Layer Selection in Feature-Based Losses Affects Image Quality and Microstructural Consistency in Deep Learning Super-Resolution of Brain Diffusion MRI

基于特征的损失函数中层选择影响深度学习超分辨率中图像质量及微结构一致性

David Lohr, Rene Werner

机构 * Institue for Applied Medical Informatics, University Medical Center Hamburg-Eppendorf(应用医学信息学研究所,汉堡大学医学中心) Institute of Computational Neuroscience, University Medical Center Hamburg-Eppendorf(计算神经科学研究所,汉堡大学医学中心) Center for Biomedical Artificial Intelligence (bAIome), University Medical Center Hamburg-Eppendorf(生物医学人工智能中心(bAIome),汉堡大学医学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究探讨了基于特征的损失函数在深度学习超分辨率中对扩散信号一致性的影响,发现深层网络层会导致网格状伪影,而浅层网络层能保持图像与地面真实的一致性,尤其在9倍超分辨率下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15855 2026-05-18 cs.CV 79%

Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?

少即是多:我们是否需要为扩散模型的强化学习微调进行每一步优化?

Renye Yan, Jikang Cheng, Shikun Sun, Yi Sun, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Junliang Xing, Yimao Cai

机构 * Peking University(北京大学) Tsinghua University(清华大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散模型强化学习微调中优化步骤的影响,提出AdaScope方法通过动态控制训练时机提升生成质量并降低计算成本。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12894 2026-05-18 cs.RO cs.CV 79%

Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning

稀疏动作生成:通过实时剪枝加速扩散策略

Kangye Ji, Jianbo Zhou, Yuan Meng, Ye Li, Hanyun Cui, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SAG方法,通过自适应剪枝和重用机制实现稀疏动作生成,提升实时视觉运动控制效率,实验显示生成速度提升4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04321 2026-05-18 cs.AI cs.MM 79%

Generative Semantic Communication: Diffusion Models Beyond Bit Recovery

生成语义通信:扩散模型超越位恢复

Eleonora Grassucci, Sergio Barbarossa, Danilo Comminiello

机构 * Dept. of Information Engineering, Electronics, and Telecommunication, Sapienza University of Rome(信息工程、电子与电信系,罗马萨皮恩扎大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 本文提出一种新的生成扩散框架,利用扩散模型合成多媒体内容并保留语义特征,通过空间自适应归一化生成语义一致的场景,提升在信道噪声下的图像生成质量。

Journal ref IEEE Transactions on Cognitive Communication and Networking, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15682 2026-05-18 cs.CV 79%

DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer

DreamSR:通过增强感受野的扩散变换器实现超高清图像超分辨率

Qingji Dong, Hang Dong, Mingqin Chen, Rui Zhang, Yitong Wang

机构 * ByteDance Inc.(字节跳动公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamSR通过双分支MM-ControlNet和增强感受野策略,解决超分辨率中局部过生成和细节合成问题,实现高质量细节恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15660 2026-05-18 cs.CV 79%

MaTe: Images Are All You Need for Material Transfer via Diffusion Transformer

MaTe:仅需图像进行材料迁移的扩散变换器

Nisha Huang, Henglin Liu, Yizhou Lin, Kaer Huang, Chubin Chen, Jie Guo, Tong-Yee Lee, Xiu Li

机构 * Tsinghua University(清华大学) PengCheng Laboratory(鹏城实验室) Lenovo Research(联想研究院) National Cheng-Kung University(国立成功大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MaTe通过多模态注意力机制实现材料迁移,无需文本指导或辅助网络,提升了生成质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15519 2026-05-18 cs.CV cs.AI 79%

DiffVAS: Diffusion-Guided Visual Active Search in Partially Observable Environments

DiffVAS: 在部分可观测环境中基于扩散的视觉主动搜索

Anindya Sarkar, Srikumar Sastry, Aleksis Pirinen, Nathan Jacobs, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) RISE Research Institutes of Sweden(瑞典RISE研究机构) Climate AI Nordics(北欧气候AI)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffVAS提出了一种目标条件化的策略,能够在部分可观测环境中同时搜索多种目标,提升了视觉主动搜索在现实应用中的部署能力。

Comments 26 Pages, 12 figures, Accepted to AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12202 2026-05-15 cs.CV 79%

Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generation

Hunyuan3D 2.0:基于扩散模型的高分辨率纹理3D资产生成

Zibo Zhao, Zeqiang Lai, Qingxiang Lin, Yunfei Zhao, Haolin Liu, Shuhui Yang, Yifei Feng, Mingxin Yang, Sheng Zhang, Xianghui Yang, Huiwen Shi, Sicong Liu, Junta Wu, Yihang Lian, Fan Yang, Ruining Tang, Zebin He, Xinzhou Wang, Jian Liu, Xuhui Zuo, Zhuo Chen, Biwen Lei, Haohan Weng, Jing Xu, Yiling Zhu, Xinhai Liu, Lixin Xu, Changrong Hu, Shaoxiong Yang, Song Zhang, Yang Liu, Tianyu Huang, Lifu Wang, Jihong Zhang, Meng Chen, Liang Dong, Yiwen Jia, Yulin Cai, Jiaao Yu, Yixuan Tang, Hao Zhang, Zheng Ye, Peng He, Runzhou Wu, Chao Zhang, Yonghao Tan, Jie Xiao, Yangyu Tao, Jianchen Zhu, Jinbao Xue, Kai Liu, Chongqing Zhao, Xinming Wu, Zhichao Hu, Lei Qin, Jianbing Peng, Zhan Li, Minghui Chen, Xipeng Zhang, Lin Niu, Paige Wang, Yingkai Wang, Haozhao Kuang, Zhongyi Fan, Xu Zheng, Weihao Zhuang, YingPing He, Tian Liu, Yong Yang, Di Wang, Yuhong Liu, Jie Jiang, Jingwei Huang, Chunchao Guo

机构 * Tencent(腾讯)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Hunyuan3D 2.0通过大规模形状生成模型和纹理合成模型,实现高分辨率纹理3D资产生成,其核心贡献在于提升几何细节、条件对齐和纹理质量,并提供用户友好的生产平台。

Comments GitHub link: https://github.com/Tencent/Hunyuan3D-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14396 2026-05-15 cs.CV cs.CR cs.LG cs.RO 79%

Systematic Discovery of Semantic Attacks in Online Map Construction through Conditional Diffusion

通过条件扩散系统发现在线地图构建中的语义攻击

Chenyi Wang, Ruoyu Song, Raymond Muller, Jean-Philippe Monteuuis, Jonathan Petit, Z. Berkay Celik, Ryan Gerdes, Ming F. Li

机构 * University of Arizona(亚利桑那大学) Purdue University(普渡大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MIRAGE框架,系统发现能绕过对抗防御的语义攻击,通过寻找环境变化(如阴影、湿路)来降低地图预测准确性,实验显示两种攻击在多种防御下仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14337 2026-05-15 cs.CV 79%

IG-Diff: Complex Night Scene Restoration with Illumination-Guided Diffusion Model

IG-Diff: 复杂夜间场景恢复与光照引导扩散模型

Yifan Chen, Fei Yin, Chunle Guo, Chongyi Li, Yujiu Yang

机构 * Tsinghua Univerisity(清华大学) NanKai University(南开大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出IG-Diff模型,通过光照引导模块提升低光照环境下复杂场景的恢复能力,解决天气与低光共存的挑战。

Comments Accepted by CGI-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14191 2026-05-15 cs.CV 79%

CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers

CoReDiT:基于空间一致性引导的令牌剪枝与重建用于高效的扩散变换器

Zhuojin Li, Hsin-Pai Cheng, Hong Cai, Shizhong Han, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CoReDiT通过空间一致性引导的令牌剪枝与重建,显著降低扩散变换器的计算量,提升推理速度,同时保持高质量视觉输出。

Comments 8 pages, 8 figures, CVPR workshop

Journal ref 2026 CVPR Workshop of EDGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04473 2026-05-15 cs.CV 79%

CC-Pan: Channel-wise Compression based Diffusion for Efficient Pan-Sharpening

CC-Pan: 基于通道压缩的扩散模型用于高效全色锐化

Junjie Li, Congyang Ou, Haokui Zhang, Guoting Wei, Shengqin Jiang, Ying Li

机构 * School of Cyberspace Security, Northwestern Polytechnical University(网络安全学院,西北工业大学) Nanjing University of Science and Technology(南京理工大学) School of Computer Science, Nanjing University of Information Science and Technology(计算机科学学院,南京信息工程大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CC-Pan,一种跨传感器潜在扩散框架,通过带级单通道变分自编码器编码高分辨率多谱段图像,结合轻量级区域基于跨带注意力模块,提升全色锐化精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12083 2026-05-15 cs.CV 79%

RePack then Refine: Efficient Diffusion Transformer with Vision Foundation Model

RePack then Refine:高效的扩散变换器与视觉基础模型

Guanfang Dong, Luke Schultz, Negar Hassanpour, Chao Gao

机构 * Huawei Technologies Canada Ltd.(华为加拿大有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出RePack then Refine框架,通过压缩高维VFM特征并细化提升扩散变换器的生成效率与质量,在ImageNet-1K上取得优于最新LDMs的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09549 2026-05-15 cs.CV 79%

SD-ReID: View-aware Stable Diffusion for Aerial-Ground Person Re-Identification

SD-ReID: 视角感知的稳定扩散用于空-地人员重识别

Yuhao Wang, Xiang Hu, Lixin Wang, Pingping Zhang, Huchuan Lu

机构 * School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SD-ReID框架,通过生成模型模仿不同视角的特征分布,提取稳健的身份表示,提升空-地人员重识别的鲁棒性和准确性。

Comments This work is accepted by IEEE TIP 2026. More modifications may performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14136 2026-05-15 cs.CV 79%

TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion

TeDiO:基于时间对角优化的训练自由一致视频扩散

Nurislam Tursynbek, Zhiqiang Lao, Heather Yu, Gedas Bertasius, Marc Niethammer

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Futurewei Technologies Inc(未来科技有限公司) UCSD(加州大学圣迭戈分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TeDiO通过优化内部注意力模式提升视频生成的时序一致性,无需训练或外部监督,实现更流畅的动态表现。

Comments CVPR'26 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏