arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2605.27495 2026-05-28 cs.CV cs.LG 79%

Representation-Conditioned Diffusion Models for Guided Training Data Generation

表示条件扩散模型用于引导训练数据生成

Nithesh Chandher Karthikeyan, Jonas Unger, Gabriel Eilertsen

机构 * Linköping University(利乌普斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出表示条件扩散模型,通过DINOv2、DINOv3和CLIP的表示条件生成合成图像,在ImageNet100上分类准确率比类条件生成高10.76个百分点,甚至超过真实数据训练的模型2.0个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27487 2026-05-28 cs.CV cs.AI 79%

Diffusion-Based Ukrainian Handwritten Text Generation with Cross-Domain Style Transfer

基于扩散的乌克兰手写文本生成与跨域风格迁移

Andrii Ahitoliev, Pavlo Berezin

机构 * Ukrainian Catholic University, Lviv, Ukraine(乌克兰天主教大学,利沃夫,乌克兰) National University of ``Kyiv-Mohyla Academy'', Kyiv, Ukraine(基輔-莫 Hil'a 学院国立大学,基輔,乌克兰)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对乌克兰语等非拉丁文字手写文本生成缺乏数据和模型泛化研究的问题,构建了乌克兰手写单词数据集并重新训练DiffusionPen模型,通过跨语言、零样本和少样本迁移实验验证了潜在扩散模型在跨域风格迁移中的有效性。

Comments 16 pages, 7 figures. Submitted to ICTERI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19729 2026-05-28 cs.CV cs.AI 79%

LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models

LIFT and PLACE: 一种简单、稳定且有效的轻量级扩散模型知识蒸馏框架

Hyunsoo Han, Sangyeop Yeo, Jaejun Yoo

机构 * Ulsan National Institute of Science and Technology (UNIST)(ulsan国家科学技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出LIFT和PLACE框架,通过粗到细的蒸馏策略解决教师网络高复杂度带来的学生模仿困难,在极端压缩下仍能稳定训练并取得良好性能。

Comments Project page: https://hyun-s.github.io/LIFT_PLACE_site , 15 pages, 11 figure, 9 tables, To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15523 2026-05-28 cs.CV 79%

Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning

自提示扩散变压器用于开放词汇场景文本编辑的上下文学习

Hongxi Li, Tong Wang, Chengjing Wu, Tianbao Liu, Jiangtao Yao, Xiaochao Qu, Xinxiao Wu, Luoqi Liu, Ting Liu

机构 * MT Lab, Meitu Inc., Beijing, China School of Computer Science \& Technology, Beijing Institute of Technology, Beijing, China

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种自提示场景文本编辑方法,通过构建风格和字形提示,利用多模态扩散变压器的上下文学习能力,实现开放词汇和风格一致的文本编辑。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18647 2026-05-28 cs.LG cs.AI cs.CV cs.IT math.IT 79%

Noise Scheduling as Information-Guided Allocation in Diffusion Training

噪声调度作为扩散训练中的信息引导分配

Gabriel Raya, Bac Nguyen, Georgios Batzolis, Yuhta Takida, Dejan Stancevic, Naoki Murata, Chieh-Hsin Lai, Yuki Mitsufuji, Luca Ambrogioni

机构 * Tilburg University & JADS(蒂尔堡大学及JADS) Sony AI(索尼人工智能) University of Cambridge(剑桥大学) Radboud University(拉德堡德大学) Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出InfoNoise,一种在线自适应噪声调度方法,通过估计条件熵率剖面动态调整训练噪声分布,以优化去噪任务中的信息增益,在图像、DNA和语言生成等任务中达到或超越基线,并节省高达3倍训练计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16872 2026-05-28 cs.CV 79%

DODO: Discrete OCR Diffusion Models

DODO: 离散OCR扩散模型

Sean Man, Gilad Deutch, Roy Ganz, Roi Ronen, Shahar Tsiper, Shai Mazor, Niv Nayman

机构 * Technion - Israel Institute of Technology, Haifa, Israel.(特拉维夫大学-以色列理工学院,海法,以色列。) Amazon Web Services(亚马逊网络服务)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对OCR任务中自回归解码速度慢的问题,提出首个利用块离散扩散的VLM模型DODO,在保持高精度的同时实现高达5倍的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26538 2026-05-27 cs.CV 79%

Scheduled Style Injection: Expanding the Style-Content Pareto Frontier in Training-Free Diffusion-based Style Transfer

调度式风格注入:在免训练扩散风格迁移中扩展风格-内容帕累托前沿

Amey Sunil Kulkarni

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过系统探索层、时间步和ControlNet几何条件四个维度的调度,发现递减调度(浅层和早期时间步强结构注入)优于递增调度,且余弦和平方根时间步调度优于线性,结合近乎独立的gamma调度与ControlNet条件可扩展帕累托前沿,在ArtFID上相对提升6.1%。

Comments Accepted to CVPR NTIRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26470 2026-05-27 cs.CV 79%

Triadic Dynamics Aware Diffusion Posterior Sampling for Inverse Problems: Optimizing Guidance and Stochasticity Schedules

面向逆问题的三元动力学感知扩散后验采样:优化引导与随机性调度

Junseo Bang, Dong Ju Mun, Hoigi Seo, Seongmin Hong, Se Young Chun

机构 * IPAI \& AIIS, Seoul National University, Republic of Korea

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TriPS方法,将后验采样建模为时变控制问题,通过优化数据一致性引导、无分类器引导和随机性的调度策略,显著提升成像逆问题的求解性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16116 2026-05-27 cs.CV 79%

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Pusa V1.0: 通过向量化时间步长适应解锁预训练视频扩散模型中的时间控制

Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

机构 * City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong(香港中文大学) Huawei Research(华为研究) Great Bay University(大湾大学) AI Technology Center, Tencent PCG(腾讯AI技术中心) Lingnan University(岭南大学) Hong Kong Centre for Cerebro-Cardiovascular Health Engineering(香港脑心血管健康工程中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出向量化时间步长适应(VTA)方法,在统一视频扩散框架中实现细粒度时间控制,零样本完成图像到视频生成、起止帧控制等任务,且不破坏基础模型能力。

Comments Code is open-sourced at https://github.com/Yaofang-Liu/Pusa-VidGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07813 2026-05-27 cs.CV cs.AI 79%

Self-Cascaded Diffusion Models for Arbitrary-Scale Image Super-Resolution

自级联扩散模型用于任意尺度图像超分辨率

Junseo Bang, Joonhee Lee, Kyeonghyun Lee, Haechang Lee, Dong Un Kang, Se Young Chun

机构 * Department of Electrical and Computer Engineering (ECE), Seoul National University(电气电子工程系(ECE),首尔国立大学) Institute of New Media and Communications (INMC) & Interdisciplinary Program in AI (IPAI), Seoul National University(新媒体与通讯研究所(INMC)及人工智能跨学科项目(IPAI),首尔国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出自级联扩散框架CasArbi,通过将任意缩放因子分解为连续小步骤,逐步提升分辨率并保持尺度一致性,在感知和失真指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25941 2026-05-26 cs.CV 79%

Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models

概念擦除应发生在何处:文本到视频扩散模型中的概念-层对齐

Yiwei Xie, Ping Liu, Zheng Zhang

机构 * The School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan 430074, China(人工智能与自动化学院,华中科技大学,武汉430074,中国) Department of Computer Science and Engineering, University of Nevada, Reno, NV, USA(计算机科学与工程系,内华达大学里诺分校,内华达州,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文通过识别概念-层拓扑对齐瓶颈,提出基于可分离性优化的CLEAR框架,在文本到视频扩散模型中实现精确的概念擦除并保持生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22894 2026-05-26 cs.GR cs.LG cs.RO 79%

SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control

SCRIPT: 面向语言驱动的物理仿真人体控制的可扩展扩散策略与多阶段训练

Jingyan Zhang, Han Liang, Ruichi Zhang, Bin Li, Juze Zhang, Xin Chen, Jingya Wang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 提出SCRIPT框架,通过联合动作-状态-文本扩散Transformer和多阶段训练(监督模仿预训练+混合奖励强化学习后训练),实现语言指令驱动的物理仿真人体控制,在文本对齐、运动质量和物理真实性上超越现有方法。

Comments Project page: https://zhanglele12138.github.io/SCRIPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15264 2026-05-26 cs.CV 79%

DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion

DriveGen3D: 通过高效视频扩散提升前馈驾驶场景生成

Weijie Wang, Jiagang Zhu, Zeyu Zhang, Xiaofeng Wang, Zheng Zhu, Guosheng Zhao, Chaojun Ni, Haoxiao Wang, Guan Huang, Xinze Chen, Yukun Zhou, Wenkang Qin, Duochao Shi, Haoyun Li, Yicheng Xiao, Donny Y. Chen, Jiwen Lu

机构 * Zhejiang University(浙江大学) GigaAI Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Monash University(墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DriveGen3D框架,结合快速视频扩散Transformer(FastDrive-DiT)和前馈3D重建模块(FastRecon3D),实现高质量、可控的动态3D驾驶场景生成,在长视频和3D一致性上达到最优。

Comments ICME 2026 Oral, Project Page: https://lhmd.top/drivegen3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24959 2026-05-26 cs.CV 79%

Three-Step Conditional Diffusion 3D Reconstruction for Light-Field Microscopy

三步条件扩散光场显微三维重建

Qihong Zhao, Shaokang Yan, Zhimin Qiao, Jinjia Wang, Bo Xiong

机构 * Yanshan University(雁山大学) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对光场显微成像中传统算法分辨率低、伪影重、计算成本高,以及现有学习方法重建精度和泛化能力不足的问题,提出一种基于三步条件扩散的高保真三维重建方法,通过确定性三步采样和轻量条件U-Net实现快速准确重建,并引入类间检测模块增强稳定性。

Comments 10 pages, 6 figures. Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24870 2026-05-26 cs.CV 79%

Trajectory-Consistent Calibration for Cache-Accelerated Diffusion Models

轨迹一致校准用于缓存加速扩散模型

Mingyu Liang, Dingkun Xu, Jingwei Xu

机构 * Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对缓存加速扩散模型中表示偏差导致生成质量下降的问题,提出无训练的轨迹一致校准方法,通过离线迭代校准缓存表示,在PixArt-alpha和DiT-XL/2上持续改善FID。

Comments 23 pages, 8 figures, 8 tables. Code is available at https://github.com/NJUDeepEngine/TCC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24674 2026-05-26 cs.CV 79%

Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing

推理对齐:扩散Transformer在视频编辑中的隐式推理

Yan Li, Lin Liu, Xiaopeng Zhang, Qi Tian

机构 * The Hongkong University of Science and Technology(香港科技大学) Huawei Inc.(华为公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对指令式视频编辑中条件信号未分化及交叉注意力监督不足的问题,提出RVEDiT框架,通过粒度路由令牌条件和参考锚定注意力对齐实现粗到细编辑与内部推理正则化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24630 2026-05-26 cs.CV 79%

DexSIM: Real-time Dexterous Simulation with Unified Causal Video Diffusion

DexSIM: 具有统一因果视频扩散的实时灵巧仿真

Adam Lee

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DexSIM框架,通过两阶段训练(双向视频扩散和自回归滚动训练)实现实时、长时一致的灵巧操作仿真,在像素相似度、运动保真度和手部投影精度上超越基线。

Comments World Model @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05791 2026-05-26 physics.med-ph cs.CV cs.LG math.PR 79%

Fast and Robust Diffusion Posterior Sampling for MR Image Reconstruction Using the Preconditioned Unadjusted Langevin Algorithm

使用预条件未调整朗之万算法实现快速且鲁棒的MR图像重建扩散后验采样

Moritz Blumenthal, Tina Holliber, Jonathan I. Tamir, Martin Uecker

机构 * Institute of Biomedical Imaging, Graz University of Technology, Graz, Austria Department of Radiology, Boston Children's Hospital, Harvard Medical School, Boston, USA Chandra Family Department of Electrical Engineering, University of Texas at Austin, USA Department of Diagnostic Medicine, Dell Medical School, University of Texas at Austin, USA

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对MR图像重建中扩散后验采样速度慢和参数调优问题,提出基于预条件未调整朗之万算法的精确似然方法,实现快速收敛且无需调参的鲁棒采样。

Comments Submitted to Magnetic Resonance in Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07343 2026-05-26 cs.GR cs.AI eess.IV 79%

Local MAP Sampling for Diffusion Models

扩散模型的局部MAP采样

Shaorong Zhang, Rob Brekelmans, Greg Ver Steeg

机构 * University of California, Riverside, CA, US(加州大学河滨分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 提出局部MAP采样(LMAPS)框架,通过沿扩散轨迹迭代求解局部MAP子问题,统一了优化方法与概率采样,在图像恢复和科学任务中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02730 2026-05-26 cs.LG cs.CV 79%

Dale meets Langevin: A Multiplicative Denoising Diffusion Model

Dale meets Langevin: 乘法去噪扩散模型

Nishanth Shetty, Madhava Prasath, Chandra Sekhar Seelamantula

机构 * Department of Electrical Engineering(电子工程系) Indian Institute of Science(印度科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出以几何布朗运动为前向噪声过程的乘法分数生成模型,推导反向时间SDE并设计两种乘法采样器,引入Hyvärinen分数和乘法去噪分数匹配目标,在图像数据集上验证生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01557 2026-05-26 cs.CV 79%

Real-Time Hardware-Free HIFU Interference Suppression via Teacher-Student Diffusion Framework

基于教师-学生扩散框架的实时无硬件HIFU干扰抑制

Dejia Cai, Ali Abdollahi, Xi Wang, Kun Yang, Zhaohui Guo, Xiaowei Zhou, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学计算机科学与工程系) State Key Laboratory of Ultrasound Engineering in Medicine, Chongqing Medical University, Chongqing 400016, China(重庆医科大学超声医学工程国家重点实验室) School of Microelectronics, Tianjin University, Tianjin 300072, China(天津大学微电子学院) Department of Chemical and Biological Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学化学与生物工程系) Division of Life Science, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学生命科学系) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute, The Hong Kong University of Science and Technology, Futian, Shenzhen, China(香港科技大学深圳-香港协同创新研究院) State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学神经系统疾病国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种无需专用硬件同步的图像域扩散框架mHC-Diff,通过教师-学生蒸馏实现实时高保真HIFU干扰抑制,在临床数据集上达到26.65 dB PSNR和~20 FPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24402 2026-05-26 cs.CV 79%

Dual Prototype-Conditioned Diffusion Model for Scalable Multi-Class Unsupervised Anomaly Detection in Large Category Spaces

面向大规模类别空间的可扩展多类无监督异常检测的双原型条件扩散模型

Yaoxuan Feng, Yuxin Li, Weijiang Lv, Zixuan Zhao, Yubiao Wang, Wenchao Chen, Bo Chen, Hongwei Liu

机构 * National Key Laboratory of Radar Signal Processing(雷达信号处理国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DPDiff-AD,一种通过局部和全局原型建模异构正态分布并利用扩散重建实现可扩展多类异常检测的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24192 2026-05-26 cs.LG cs.AI cs.CV 79%

Filtered Posterior Mean Collections: A Unified Framework for Analytical Models of Diffusion Generalization

滤波后验均值集合:扩散泛化分析模型的统一框架

Matthew Niedoba, Berend Zwartsenberg, Frank Wood

机构 * University of British Columbia(不列颠哥伦比亚大学) Inverted AI Alberta Machine Intelligence Institute(阿尔伯塔机器智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出滤波后验均值集合(FPMC)统一框架,通过查询精度向量、响应权重和源分布建模扩散模型去噪函数的泛化行为,并通过软松弛和源分布增强提升现有方法性能。

Comments 27 Pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24176 2026-05-26 cs.CV 79%

Loki: Representation over Architecture for Diffusion-Based Portrait Animation

Loki:基于表示而非架构的扩散肖像动画

Pouyan Navard, Sernam Lim

机构 * The Ohio State University(俄亥俄州立大学) University of Central Florida(中央佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Loki方法,通过使用参数化人脸模型解耦身份与表情/姿态,并利用轻量级键值注入保持身份,在减少参数和训练数据的同时提升扩散肖像动画的驱动跟随性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20273 2026-05-26 cs.DC cs.CV 79%

SwiftFusion: Scalable Sequence Parallelism for Distributed Inference of Diffusion Transformers on GPUs

SwiftFusion: 面向GPU上扩散Transformer分布式推理的可扩展序列并行

Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, Gennady Pekhimenko

机构 * University of Toronto \&\ Institute Amazon University of Toronto \& Vector Institute \& NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散Transformer推理中序列并行方法的通信和同步瓶颈,提出拓扑感知的StreamFusion引擎,通过Torus Attention和单边通信实现平均1.35倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21489 2026-05-25 cs.LG cs.AI cs.CV stat.CO stat.ML 79%

Variance Reduction for Expectations with Diffusion Teachers

具有扩散教师的期望方差缩减

Jesse Bettencourt, Xindi Wu, Matan Atzmon, James Lucas, Jonathan Lorraine

机构 * NVIDIA University of Toronto(多伦多大学) Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CARV框架,通过分层蒙特卡洛估计器(摊销上游计算、时间步重要性采样和分层逆CDF构造)降低扩散模型作为冻结教师时的梯度方差,在文本到3D和蒸馏实验中实现2-3倍有效计算乘数。

Comments Project page: https://research.nvidia.com/labs/sil/projects/CARV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00560 2026-05-25 cs.RO cs.CV 79%

Using Ensemble Diffusion to Estimate Uncertainty for End-to-End Autonomous Driving

使用集成扩散估计端到端自动驾驶的不确定性

Florian Wintel, Sigmund H. Høeg, Gabriel Kiss, Frank Lindseth

机构 * Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出EnDfuser系统,利用扩散模型作为轨迹规划器,通过集成扩散从单一感知帧生成候选轨迹分布,实现不确定性感知决策,在LAV基准上驾驶评分提升1.7%。

Comments Accepted at NLDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22420 2026-05-22 cs.CV cs.AI cs.RO 79%

Diffusion-guided Generalizable Enhancer for Urban Scene Reconstruction

基于扩散的通用增强器用于城市场景重建

Henry Che, Jingkang Wang, Yun Chen, Ze Yang, Sivabalan Manivasagam, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GenRe,一种基于扩散的通用增强器,用于城市场景重建,通过学习不同场景中的生成先验,高效地生成稳健且高保真的表示,能够可靠地泛化到挑战性的未见过的视角,从而在自动驾驶中实现鲁棒和可扩展的传感器模拟。

Comments ICRA 2026. Project page: https://waabi.ai/genre

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22311 2026-05-22 cs.CV 79%

PIU: Proximity-guided Identity Unlearning in ID-Conditioned Diffusion Models

PIU:基于接近性的身份去学习在ID条件化的扩散模型中

Jose Edgar Hernandez Cancino Estrada, Mauro Díaz Lupone, Žiga Emeršič, Vitomir Štruc, Peter Peer, Darian Tomašević

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学系) University of Ljubljana, Faculty of Electrical Engineering(卢布尔雅那大学电子工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了在ID条件化的扩散模型中身份去学习的问题,提出了一种基于接近性的身份去学习框架PIU,通过在学习的身份空间中重新分配源身份到选定的锚身份来实现身份移除,并结合基于ArcFace表示几何的锚点选择策略,通过局部微调少量身份敏感的交叉注意力层实现有效的去学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22017 2026-05-22 cs.CV 79%

Diverse Yet Consistent: Context-Guided Diffusion with Energy-Based Joint Refinement for Multi-Agent Motion Prediction

多样且一致:基于能量的联合细化的上下文引导扩散用于多智能体运动预测

Lei Chu, Yuhuan Zhao

机构 * University of Southern California(南加州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散的框架,通过利用历史轨迹中的丰富上下文信息来改进多智能体运动预测,通过引导机制增强预测动作的多样性和表达性,并引入基于能量的公式来细化联合轨迹分布,同时保持个体轨迹的合理性,实验表明该方法在多个基准数据集上均优于现有方法。

Comments MEIS-- CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏