arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70196 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70196 篇

2512.05991 2025-12-12 cs.CV 79%

EmoDiffTalk:Emotion-aware Diffusion for Editable 3D Gaussian Talking Head

EmoDiffTalk:面向可编辑3D高斯说话头的情绪感知扩散

Chang Liu, Tianjiao Jing, Chengcheng Ma, Xuanqi Zhou, Zhengxuan Lian, Qin Jin, Hongliang Yuan, Shi-Sheng Huang

机构 * Beijing Normal University(北京师范大学) Renmin University of China(中国人民大学) Tencent AI Lab(腾讯AI实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EmoDiffTalk通过情绪感知高斯扩散实现细粒度面部动画与多模态情绪编辑,提升3D说话头的情绪表达精度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09871 2025-12-11 cs.CV 79%

Diffusion Posterior Sampler for Hyperspectral Unmixing with Spectral Variability Modeling

具有光谱变异性建模的扩散后验采样器用于超光谱解混

Yimin Zhu, Lincoln Linlin Xu

机构 * Department of Geomatics Engineering, University of Calgary, Calgary, Canada(测绘工程系,卡尔加里大学,卡尔加里,加拿大)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DPS4Un通过扩散后验采样器和超像素技术,改进超光谱解混中的光谱变异性建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09477 2025-12-11 cs.CV cs.AI 79%

Color encoding in Latent Space of Stable Diffusion Models

扩散模型潜在空间中的颜色编码

Guillem Arias, Ariadna Solà, Martí Armengod, Maria Vanrell

机构 * Computer Vision Center / Universitat Autònoma de Barcelona(计算机视觉中心 / 巴塞罗那自治大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了Stable Diffusion模型中颜色在潜在空间中的编码机制,揭示了颜色、亮度和形状在不同潜在通道中的表示方式,为生成模型的理解与改进提供了新视角。

Comments 6 pages, 8 figures, Color Imaging Conference 33

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09418 2025-12-11 cs.CV 79%

Label-free Motion-Conditioned Diffusion Model for Cardiac Ultrasound Synthesis

无标签的运动条件化扩散模型用于心脏超声合成

Zhe Li, Hadrien Reynaud, Johanna P Müller, Bernhard Kainz

机构 * Department AIBE, FAU Erlangen-Nürnberg(AIBE部门,埃尔朗根-纽伦堡大学) Department of Computing, Imperial College London(计算系,伦敦帝国理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出无标签的运动条件化扩散模型,通过自监督运动特征生成逼真的心脏超声视频,无需手动标注。

Comments Accepted at MICAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09660 2025-12-11 cs.LG cs.AI cs.CV 79%

Learning What Matters: Steering Diffusion via Spectrally Anisotropic Forward Noise

学习关键要素:通过频谱各向异性前向噪声引导扩散

Luca Scimeca, Thomas Jiralerspong, Berton Earnshaw, Jason Hartford, Yoshua Bengio

机构 * Mila - Quebec AI Institute and Université de Montréal(蒙特利尔大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出频谱各向异性高斯扩散(SAGD),通过调整前向噪声的频谱特性,提升扩散模型对目标分布的适应能力,并在多个视觉数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08999 2025-12-11 cs.CV 79%

Diffusion Model Regularized Implicit Neural Representation for CT Metal Artifact Reduction

扩散模型正则化的隐式神经表示用于CT金属伪影抑制

Jie Wen, Chenhe Du, Xiao Wang, Yuyao Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种结合扩散模型和隐式神经表示的框架,用于改进CT图像中金属伪影的抑制效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08922 2025-12-10 cs.CV 79%

Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration

统一扩散变压器用于高质量文本感知图像恢复

Jin Hyeon Kim, Paul Hyunbin Cho, Claire Kim, Jaewon Min, Jaeeun Lee, Jihye Park, Yeji Choi, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Samsung Electronics(三星电子)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniT通过整合扩散变压器、视觉-语言模型和文本识别模块,实现高质量文本感知图像恢复,有效抑制文本幻觉并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08897 2025-12-10 cs.CV 79%

UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation

UniLayDiff: 一种统一的扩散变换器用于内容感知的布局生成

Zeyang Liu, Le Wang, Sanping Zhou, Yuxuan Wu, Xiaolong Sun, Gang Hua, Haoxiang Li

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) Amazon.com, Inc.(亚马逊公司) Pixocial Technology(Pixocial技术)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniLayDiff通过统一的扩散变换器框架,首次实现了内容感知布局生成任务的端到端统一生成,提升了布局质量和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08747 2025-12-10 cs.CV 79%

A Scalable Pipeline Combining Procedural 3D Graphics and Guided Diffusion for Photorealistic Synthetic Training Data Generation in White Button Mushroom Segmentation

可扩展的管道结合程序化3D图形和引导扩散用于白蘑菇分割的逼真合成训练数据生成

Artúr I. Károly, Péter Galambos

机构 * Antal Bejczy Center for Intelligent Robotics(安塔尔·贝茨奇智能机器人中心) Research and Innovation Center of Obuda University(奥布达大学研究与创新中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结合程序化3D图形和引导扩散模型,生成高逼真合成数据以提升白蘑菇分割性能。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08547 2025-12-10 cs.CV 79%

An Iteration-Free Fixed-Point Estimator for Diffusion Inversion

无迭代固定点估计器用于扩散反向

Yifei Chen, Kaiyu Song, Yan Pan, Jianxing Yu, Jian Yin, Hanjiang Lai

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) School of Artificial Intelligence, Sun Yat-sen University(人工智能学院,中山大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种无迭代的固定点估计器用于扩散反向,通过误差近似方法提高重建性能,无需额外迭代或训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08506 2025-12-10 cs.CV 79%

OCCDiff: Occupancy Diffusion Model for High-Fidelity 3D Building Reconstruction from Noisy Point Clouds

OCCDiff:基于点云的高保真3D建筑重建的占用扩散模型

Jialu Sui, Rui Liu, Hongsheng Zhang

机构 * Department of Geography, Faculty of Social Science, the University of Hong Kong(地理系,社会科学学院,香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OCCDiff通过潜在扩散和函数自动编码器生成高保真3D建筑重建,结合点编码器与多任务训练提升鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08330 2025-12-10 cs.CV 79%

PointDico: Contrastive 3D Representation Learning Guided by Diffusion Models

PointDico: 通过扩散模型引导的对比3D表示学习

Pengbo Li, Yiding Sun, Haozhe Cheng

机构 * International School Beijing University of Posts(国际学校 北京邮电大学) School of Software Engineering Xi'an Jiaotong University Xi'an, China(软件工程学院 西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PointDico通过融合扩散模型和对比学习的方法,实现了3D表示学习的突破,达到了ScanObjectNN和ShapeNetPart上的新高精度。

Comments Accepted by IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08329 2025-12-10 cs.CV cs.AI cs.LG 79%

Interpreting Structured Perturbations in Image Protection Methods for Diffusion Models

在扩散模型图像保护方法中解释结构扰动

Michael R. Martin, Garrick Chan, Kwan-Liu Ma

专题命中 扩散模型 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 本研究通过分析扩散模型图像保护机制的结构化扰动,揭示其在特征层面的变形特性,为防御和检测策略设计提供新视角。

Comments 32 pages, 17 figures, 1 table, 5 algorithms, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08153 2025-12-10 cs.LG cs.AI cs.CV 79%

TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models

TreeGRPO:基于树优势的在线强化学习后训练扩散模型

Zheng Ding, Weirui Ye

机构 * UC San Diego(圣迭戈大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TreeGRPO通过树结构提升扩散模型后训练效率,实现2.4倍加速并优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06670 2025-12-10 cs.CV 79%

Video Dataset Condensation with Diffusion Models

视频数据集压缩与扩散模型

Zhe Li, Hadrien Reynaud, Mischa Dombrowski, Sarah Cechnicka, Franciskus Xaverius Erick, Bernhard Kainz

机构 * Department AIBE FAU Erlangen-Nürnberg(FAU埃尔朗根-纽伦堡AIBE部门) Department of Computing Imperial College London(伦敦帝国理工学院计算系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型和VST-UNet的视频数据集压缩方法,结合训练免费聚类算法,有效提升视频数据集蒸馏性能,达到10.61%的性能提升。

Comments Accepted at BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07745 2025-12-09 cs.CV 79%

DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving

DiffusionDriveV2: 结束到结束自动驾驶中的强化学习约束截断扩散建模

Jialv Zou, Shaoyu Chen, Bencheng Liao, Zhiyu Zheng, Yuehao Song, Lefei Zhang, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * School of Electronic Information and Communications, Huazhong University of Science & Technology(华中科技大学电子信息与通信学院) Institute of Artificial Intelligence, Huazhong University of Science & Technology(华中科技大学人工智能研究院) Horizon Robotics(地平线科技) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffusionDriveV2通过强化学习约束和探索,解决了自动驾驶中截断扩散模型在多样性和高质量之间的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07480 2025-12-09 cs.CV 79%

Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance

单步扩散视频编码与语义-时间引导

Naifu Xue, Zhaoyang Jia, Jiahao Li, Bin Li, Zihan Zheng, Yuan Zhang, Yan Lu

机构 * Communication University of China(中国通信大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 S2VC通过单步扩散与语义-时间引导,实现低比特率下的高质量视频编码,比特率节省达52.73%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07251 2025-12-09 cs.CV 79%

See More, Change Less: Anatomy-Aware Diffusion for Contrast Enhancement

看得更多,改变更少:面向对比增强的解剖感知扩散模型

Junqi Liu, Zejun Wu, Pedro R. A. S. Bassi, Xinze Zhou, Wenxuan Li, Ibrahim E. Hamamci, Sezgin Er, Tianyu Lin, Yi Luo, Szymon Płotka, Bjoern Menze, Daguang Xu, Kai Ding, Kang Wang, Yang Yang, Yucheng Tang, Alan L. Yuille, Zongwei Zhou

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Copenhagen(哥本哈根大学) University of Virginia(弗吉尼亚大学) University of Bologna(博洛尼亚大学) Italian Institute of Technology(意大利理工学院) University of Zurich(苏黎世大学) ETH AI Center(ETH人工智能中心) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Jagiellonian University(雅盖隆大学) NVIDIA(NVIDIA公司) Johns Hopkins Medicine(约翰霍普金斯医学) University of California, San Francisco(旧金山大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SMILE是一种解剖感知扩散模型,通过结构感知监督和统一推理,在医学图像对比增强中实现更准确且临床有价值的图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07201 2025-12-09 cs.CV cs.LG 79%

Understanding Diffusion Models via Code Execution

通过代码执行理解扩散模型

Cheng Yu

机构 * School of Artificial Intelligence, Chongqing University of Technology, Chongqing , China(人工智能学院,重庆理工大学,重庆,中国) DiAi Corporation, China(迪爱公司,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文通过代码实现从代码执行角度解释扩散模型,保留核心组件并去除冗余细节,为研究人员提供实践层面的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01267 2025-12-09 cs.CV 79%

Diffusion-based Adversarial Purification from the Perspective of the Frequency Domain

基于频域视角的扩散对抗净化

Gaozheng Pei, Ke Ma, Yingfei Sun, Qianqian Xu, Qingming Huang

机构 * School of Electronic, Electrical and Communication Engineering, UCAS, Beijing.(电子、电气与通信工程学院,中国科学院大学,北京) Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, CAS, Beijing.(智能信息处理重点实验室,计算技术研究所,中国科学院,北京) School of Computer Science and Technology, UCAS, Beijing.(计算机科学与技术学院,中国科学院大学,北京) Key Laboratory of Big Data Mining and Knowledge Management, UCAS, Beijing.(大数据挖掘与知识管理重点实验室,中国科学院大学,北京)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于频域视角的扩散对抗净化方法,通过频域成分分离和针对性处理,有效消除对抗扰动并保留图像内容与结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18723 2025-12-09 eess.IV cs.CV cs.LG 79%

MRI Reconstruction with Regularized 3D Diffusion Model (R3DM)

利用正则化的3D扩散模型(R3DM)进行MRI重建

Arya Bangun, Zhuo Cao, Alessio Quercia, Hanno Scharr, Elisabeth Pfaehler

机构 * IAS-8 INM-4 Forschungszentrum Jülich(INM-4 研究中心) RWTH Aachen University(亚琛工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于正则化3D扩散模型的MRI重建方法,通过结合优化方法提升图像质量与保真度,实验表明其在欠采样数据下的重建性能优于现有方法。

Comments Accepted to WACV 2025,17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05754 2025-12-08 cs.CV 79%

USV: Unified Sparsification for Accelerating Video Diffusion Models

USV:统一稀疏化以加速视频扩散模型

Xinjian Wu, Hongmei Wang, Yuan Zhou, Qinglin Lu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 USV通过统一稀疏化策略提升视频扩散模型的效率,实现去噪速度提升83.3%和端到端加速22.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05240 2025-12-08 cs.CV 79%

IE2Video: Adapting Pretrained Diffusion Models for Event-Based Video Reconstruction

IE2Video: 适配预训练扩散模型以实现事件视频重建

Dmitrii Torbunov, Onur Okuducu, Yi Huang, Odera Dim, Rebecca Coles, Yonggang Cui, Yihui Ren

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 IE2Video通过适配预训练扩散模型,实现从单帧和事件数据重建RGB视频,提升视频重建质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05134 2025-12-08 cs.CV cs.DC cs.LG 79%

InvarDiff: Cross-Scale Invariance Caching for Accelerated Diffusion Models

InvarDiff:跨尺度不变性缓存用于加速扩散模型

Zihao Wu

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 InvarDiff通过利用扩散模型中时间步和层尺度的跨尺度不变性,实现无需训练的加速方法,显著提升推理速度并保持图像保真度。

Comments 8 pages main, 8 pages appendix, 16 figures, 5 tables. Code: https://github.com/zihaowu25/InvarDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04926 2025-12-08 cs.CV 79%

Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion

语义优先:通过异步潜在扩散和谐统一语义与纹理建模

Yueming Pan, Ruoyu Feng, Qi Dai, Yuqi Wang, Wenfeng Lin, Mingyu Guo, Chong Luo, Nanning Zheng

机构 * IAIR, Xi’an Jiaotong University(西安交通大学IAIR) Microsoft Research Asia(微软亚洲研究院) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SFD通过异步方式优先生成语义,提升潜在扩散模型在图像生成中的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01826 2025-12-08 cs.CV 79%

GLDiTalker: Speech-Driven 3D Facial Animation with Graph Latent Diffusion Transformer

GLDiTalker: 基于图潜在扩散变换器的语音驱动3D面部动画

Yihong Lin, Zhaoxin Fan, Xianjia Wu, Lingyu Xiong, Liang Peng, Xiandong Li, Wenxiong Kang, Songju Lei, Huang Xu

机构 * South China University of Technology(南方科技大学) Beihang University(北航) Huawei Cloud(华为云) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GLDiTalker通过图潜在扩散变换器解决语音驱动3D面部动画中的模态不一致问题,提升唇形同步精度和运动多样性。

Comments 9 pages, 5 figures

Journal ref the 34th International Joint Conference on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05000 2025-12-05 cs.CV cs.AI 79%

Reflection Removal through Efficient Adaptation of Diffusion Transformers

通过高效适应扩散变换器实现反射去除

Daniyar Zakarin, Thiemo Wandel, Anton Obukhov, Dengxin Dai

机构 * ETH Zürich(苏黎世联邦理工学院) HUAWEI Bayer Lab(华为拜耳实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散变换器的高效反射去除方法,通过物理驱动的数据合成和LoRA适应,实现了高保真的反射去除性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04699 2025-12-05 cs.CV 79%

OmniScaleSR: Unleashing Scale-Controlled Diffusion Prior for Faithful and Realistic Arbitrary-Scale Image Super-Resolution

OmniScaleSR: 解锁受控扩散先验以实现高保真和逼真任意尺度图像超分辨率

Xinning Chai, Zhengxue Cheng, Yuhong Zhang, Hengsheng Zhang, Yingsheng Qin, Yucai Yang, Rong Xie, Li Song

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) College of Information, Mechanical and Electrical Engineering, Shanghai Normal University(上海师范大学信息、机械与电气工程学院) Transsion in China(中国Transsion) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OmniScaleSR通过显式扩散控制机制和多领域保真度增强,实现高保真和逼真任意尺度图像超分辨率。

Comments Accepted as TCSVT, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04504 2025-12-05 cs.CV 79%

UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers

UltraImage: 重新思考图像扩散变换器中的分辨率外推

Min Zhao, Bokai Yan, Xue Yang, Hongzhou Zhu, Jintao Zhang, Shilong Liu, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, Tsinghua University(计算机科学与技术系,北京理工大学中心,清华大学) ShengShu(盛书) Gaoling School of Artificial Intelligence, Renmin University of China(光明人工智能学院,中国人民大学) Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UltraImage通过修正主导频率和自适应注意力集中,解决了图像扩散变换器在高分辨率外推中的内容重复和质量下降问题,实现了高达6K*6K的生成能力。

Comments Project page: https://thu-ml.github.io/ultraimage.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04459 2025-12-05 cs.CV 79%

dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning

dVLM-AD:通过可控推理增强扩散视觉语言模型以实现驾驶

Yingzi Ma, Yulong Cao, Wenhao Ding, Shuibai Zhang, Yan Wang, Boris Ivanovic, Ming Jiang, Marco Pavone, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 dVLM-AD通过可控推理提升扩散视觉语言模型,实现更一致的驾驶推理与规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏