arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2603.26759 2026-03-31 cs.CV 79%

Physics-Aware Diffusion for LiDAR Point Cloud Densification

面向激光雷达点云密集化的物理感知扩散模型

Zeping Zhang, Robert Laganière

机构 * University of Ottawa(渥太华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Scanline-Consistent Range-Aware Diffusion模型,通过概率细化提升激光雷达点云密集度,以156ms实现高保真结果,采用Ray-Consistency损失和Negative Ray增强技术抑制物理幻觉,提升3D检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26509 2026-03-30 cs.CV 79%

Conditional Diffusion for 3D CT Volume Reconstruction from 2D X-rays

基于条件扩散的3DCT体积重建从2DX光

Martin Rath, Morteza Ghahremani, Yitong Li, Ashkan Taghipour, Marcus Makowski, Christian Wachinger

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Western Australia (UWA)(西澳大利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AXON框架,通过多阶段扩散模型直接从真实X光重建高保真3DCT体积,采用粗到细策略和ControlNet优化,支持双平面X光输入并提升诊断分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26263 2026-03-30 cs.CV cs.RO 79%

DRUM: Diffusion-based Raydrop-aware Unpaired Mapping for Sim2Real LiDAR Segmentation

DRUM:基于扩散的反射率感知无配对映射用于Sim2Real激光雷达分割

Tomoya Miyawaki, Kazuto Nakashima, Yumi Iwashita, Ryo Kurazume

机构 * Kyushu University(九州大学) Jet Propulsion Laboratory, California Institute of Technology(喷气推进实验室,加州理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DRUM通过利用未标记真实数据预训练的扩散模型,结合反射强度和射线丢失噪声特性,提升Sim2Real激光雷达分割性能。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26211 2026-03-30 cs.CV cs.AI 79%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26117 2026-03-30 eess.IV cs.CV 79%

FINDER: Zero-Shot Field-Integrated Network for Distortion-free EPI Reconstruction in Diffusion MRI

FINDER:用于扩散磁共振成像中无失真EPI重建的零样本场积分网络

Namgyu Han, Seong Dae Yun, Chaeeun Lim, Sunghyun Seok, Sunju Kim, Yoonhwan Kim, Yohan Jun, Tae Hyung Kim, Berkin Bilgic, Jaejin Cho

机构 * Sejong University(世宗大学) Forschungszentrum Jülich(于利希研究中心) Athinoula A. Martinos Center for Biomedical Imaging(Athinoula A. Martinos生物医学成像中心) Harvard Medical School(哈佛医学院) Hongik University(弘益大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FINDER网络,通过联合优化图像和B0场图,解决EPI重建中的几何失真问题,提升扩散成像质量。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26071 2026-03-30 cs.CV cs.LG 79%

MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality

MUST:一种模态特定表示感知的Transformer,用于具有缺失模态的扩散增强生存预测

Kyungwon Kim, Dosik Hwang

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MUST通过分解模态特定和跨模态上下文化组件,提高生存预测的准确性,在缺失模态情况下仍能保持稳健预测。

Comments Accepted to CVPR 2026. 10 pages, 5 figures, supplementary included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19692 2026-03-30 cs.CV 79%

Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models

Interact2Ar:通过自回归扩散模型生成全身体态的人与人交互

Pablo Ruiz-Ponce, Sergio Escalera, José García-Rodríguez, Jiankang Deng, Rolandos Alexandros Potamias

机构 * Universidad de Alicante(阿利坎特大学) Universitat de Barcelona and Computer Vision Center(巴塞罗那大学与计算机视觉中心) Imperial College London(伦敦帝国理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Interact2Ar,首个基于文本条件的自回归扩散模型,用于生成全身体态的人与人交互,通过专用并行分支实现详细手部运动,结合新颖的记忆技术提升适应性,支持多场景应用。

Comments Project Page: https://pabloruizponce.com/papers/Interact2Ar

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16928 2026-03-30 cs.CV 79%

Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features

重新思考基于扩散模型的视频超分辨率:利用对齐特征的密集引导

Jingyi Xu, Meisong Zheng, Ying Chen, Minglang Qiao, Xin Deng, Mai Xu

机构 * Beihang University(北京航空航天大学) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DGAF-VSR方法,通过优化对齐和补偿机制提升视频超分辨率的感知质量、保真度和时间一致性。

Comments Accepted by CVPR 2026,20pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26014 2026-03-30 eess.IV cs.CV 79%

Cone-Beam CT Image Quality Enhancement Using A Latent Diffusion Model Trained with Simulated CBCT Artifacts

使用基于伪CBCT伪影训练的条件潜变量扩散模型进行锥束CT图像质量增强

Naruki Murahashi, Mitsuhiro Nakamura, Megumi Nakao

机构 * Graduate School of Medicine, Kyoto University(京都大学医学研究科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于条件潜变量扩散模型的锥束CT图像质量增强方法,利用伪CBCT图像进行自监督学习,有效提升图像质量并保持解剖结构,实验表明其在处理速度和图像改善性能上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25977 2026-03-30 cs.CV 79%

Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)

具有扩散空间旋转位置嵌入的扩散磁共振成像变换器(D-RoPE)

Gustavo Chau Loo Kung, Mohammad Abbasi, Camila Blank, Juze Zhang, Alan Q. Wang, Sophie Ostmeier, Akshay Chaudhari, Kilian Pohl, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出D-RoPE以解决扩散磁共振成像中空间、扩散加权和方向依赖性的建模问题,通过自监督预训练提升模型在多种任务中的表现,实现更稳健的跨设置表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25758 2026-03-30 cs.CV cs.AI cs.LG eess.IV 79%

A-SelecT: Automatic Timestep Selection for Diffusion Transformer Representation Learning

A-SelecT:扩散变换器表示学习中的自动时间步选择

Changyu Liu, James Chenhao Liang, Wenhao Yang, Yiming Cui, Jinghao Yang, Tianyang Wang, Qifan Wang, Dongfang Liu, Cheng Han

机构 * University of Missouri–Kansas City(密苏里大学堪萨斯城分校) U. S. Naval Research Laboratory(美国海军研究实验室) Lamar University(拉马尔大学) University of Florida(佛罗里达大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德河谷分校) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Meta AI Rochester Institute of Technology(罗切斯特理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出A-SelecT方法,通过动态选择扩散变换器中最信息丰富的时间步,提升训练效率和表示能力,在分类和分割任务中优于现有扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15132 2026-03-27 cs.CV 79%

WiT: Waypoint Diffusion Transformers via Trajectory Conflict Navigation

WiT:通过轨迹冲突导航实现方式点扩散变换

Hainuo Wang, Mingjia Li, Xiaojie Guo

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出WiT,通过分解连续向量场中的语义方式点,解决像素空间中的轨迹冲突问题,提升扩散生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02193 2026-03-27 cs.CV 79%

SSI-DM: Singularity Skipping Inversion of Diffusion Models

SSI-DM:扩散模型的奇点跳过反演

Chen Min, Enze Jiang, Jishen Peng, Zheng Ma

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SSI-DM方法,通过在标准反演前添加小噪声跳过奇点,实现具有自然高斯性质的噪声反演,提升扩散模型的重建和插值性能。

Comments A complete revision is needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18822 2026-03-27 cs.CV 79%

DiP: Taming Diffusion Models in Pixel Space

DiP:在像素空间中驯服扩散模型

Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Xiaobin Hu, Hanzhen Zhao, Chengjie Wang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiP提出一种高效的像素空间扩散框架,通过解耦生成过程为全局和局部阶段,结合Diffusion Transformer和轻量级Patch Detailer Head,在不依赖VAE的情况下实现高效生成,推理速度提升10倍,FID分数达1.79。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24938 2026-03-27 cs.CV 79%

Infinite Gaze Generation for Videos with Autoregressive Diffusion

视频无限 gaze 生成的自回归扩散模型

Jenna Kang, Colin Groth, Tong Wu, Finley Torrens, Patsorn Sangkloy, Gordon Wetzstein, Qi Sun

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种自回归扩散模型,用于生成任意长度视频的无限 horizon 原始 gaze,通过在 saliency-aware 视觉潜在空间中条件化,提升长程时空准确性和轨迹真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24764 2026-03-27 cs.CV cs.LG 79%

Synthetic Cardiac MRI Image Generation using Deep Generative Models

利用深度生成模型合成心脏MRI图像

Ishan Kumarasinghe, Dasuni Kawya, Madhura Edirisooriya, Isuri Devindi, Isuru Nawinne, Vajira Thambawita

机构 * Department of Computer Engineering(计算机工程系) University of Peradeniya(珀德尼亚大学) University of Maryland(马里兰大学) Department of Holistic Systems(整体系统系) SimulaMet Oslo, Norway(挪威奥斯陆)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文综述了通过深度生成模型生成合成心脏MRI图像的方法,探讨了在保真度、实用性和隐私方面现有技术的局限性,并强调了需要集成评估驱动框架以确保临床工作流程的可靠性。

Comments 12 pages, 2 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20951 2026-03-27 cs.CV cs.AI 79%

See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis

查看并修复缺陷:通过代理数据合成使VLMs和扩散模型能够理解视觉缺陷

Jaehyun Park, Minyoung Ahn, Minkyu Kim, Jonghyun Lee, Jae-Gil Lee, Dongmin Park

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学) KRAFTON

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ArtiAgent,通过代理数据合成生成真实与带缺陷图像对,有效减少视觉缺陷,提升模型对视觉缺陷的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24407 2026-03-26 cs.CV 79%

Teacher-Student Diffusion Model for Text-Driven 3D Hand Motion Generation

基于文本驱动的3D手部运动生成的教师-学生扩散模型

Ching-Lam Cheng, Bin Zhu, Shengfeng He

机构 * Singapore Management University(新加坡管理大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TSHaMo模型,通过文本生成逼真3D手部运动,利用教师-学生扩散框架提升运动质量和多样性,支持多种辅助输入。

Comments 5 pages, accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24260 2026-03-26 cs.CV cs.AI 79%

Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep

通过异构缓存加速基于扩散的视频编辑:超越采样去噪时间步的全计算

Tianyi Liu, Ye Lu, Linfeng Zhang, Chen Cai, Jianjun Gao, Yi Wang, Kim-Hui Yap, Lap-Pui Chau

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HetCache框架,通过利用扩散基于掩码视频到视频生成中的异构性,减少冗余注意力运算,提升视频编辑效率与质量。

Comments 10 pages, 6 figures, accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21591 2026-03-26 cs.CV 79%

CADC: Content Adaptive Diffusion-Based Generative Image Compression

CADC: 基于内容自适应的扩散生成图像压缩

Xihua Sheng, Lingyu Zhu, Tianyu Zhang, Dong Liu, Shiqi Wang, Jing Wang

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CADC,通过三种创新方法解决现有图像压缩在内容自适应中的不足,实现动态对齐图像语义与结构特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21542 2026-03-26 cs.RO cs.AI cs.CV cs.LG 79%

E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion

E0: 通过 Tweedie 离散扩散增强 VLA 模型的泛化能力与细粒度控制

Zhihao Zhan, Jiaying Zhou, Likui Zhang, Qinhan Lv, Hao Liu, Jusheng Zhang, Weizheng Li, Ziliang Chen, Tianshui Chen, Ruifeng Zhai, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出 E0 框架,通过离散扩散方法提升 VLA 模型在多任务和多视角下的泛化能力,并实现精细可控的动作生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23874 2026-03-26 cs.CV 79%

EnvSocial-Diff: A Diffusion-Based Crowd Simulation Model with Environmental Conditioning and Individual-Group Interaction

EnvSocial-Diff: 一种基于扩散的群体模拟模型,包含环境条件和个体-群体交互

Bingxue Zhao, Qi Zhang, Hui Huang

机构 * VCC, College of Computer Science and Software Engineering, Shenzhen University(VCC,计算机科学与软件工程学院,深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出EnvSocial-Diff模型,结合社会物理和环境条件,通过环境编码模块和个体-群体交互模块提升群体模拟的现实性,实验表明其优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23845 2026-03-26 cs.CV 79%

3D-LLDM: Label-Guided 3D Latent Diffusion Model for Improving High-Resolution Synthetic MR Imaging in Hepatic Structure Segmentation

3D-LLDM:基于标签的3D潜在扩散模型用于提高肝结构分割的高分辨率合成MR影像

Kyeonghun Kim, Jaehyeok Bae, Youngung Han, Joo Young Bae, Seoyoung Ju, Junsu Lim, Gyeongmin Kim, Nam-Joon Kim, Woo Kyoung Jeong, Ken Ying-Kai Liao, Won Jae Lee, Pa Hong, Hyuk-Jae Lee

机构 * OUTTA, Republic of Korea(韩国OUTTA) Stanford University(斯坦福大学) Seoul National University(首尔国立大学) Sangmyung University(Sangmyung大学) Chung-Ang University(Chung-Ang大学) Samsung Medical Center(三星医疗中心) NVIDIA Sungkyunkwan University School of Medicine(成均馆大学医学院) Samsung Changwon Hospital(三星昌原医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出3D-LLDM模型,通过标签引导生成高质量合成MR影像,提升肝结构分割的精度,实验表明其在数据增强中提升了肝细胞癌分割的Dice得分。

Comments Accepted to ISBI 2026 (Oral). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18719 2026-03-26 cs.CV cs.AI 79%

Ontology-Guided Diffusion for Zero-Shot Visual Sim2Real Transfer

基于本体引导的扩散模型用于零样本视觉sim2real迁移

Mohamed Youssef, Mayar Elfares, Anna-Maria Meer, Matteo Bortoletto, Andreas Bulling

机构 * University of Stuttgart, Germany(斯图加特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OGD框架,通过本体引导扩散模型实现零样本sim2real迁移,利用知识图谱和符号规划器提升图像真实感识别与生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20592 2026-03-26 cs.LG cs.CV 79%

Latent Diffusion Inversion Requires Understanding the Latent Space

潜在扩散倒置需要理解潜在空间

Mingxing Rao, Bowen Qu, Daniel Moyer

机构 * Vanderbilt University(范德比大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散模型在潜在空间中的记忆现象,发现潜在空间中记忆分布不均,提出通过排序潜在维度来提升模型性能,实验显示在多个数据集上性能提升显著。

Comments 14 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00430 2026-03-26 cs.LG cs.AI cs.CV 79%

PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼

Suhyeon Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。

Comments CVPR26 poster. 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23499 2026-03-25 cs.CV 79%

DA-Flow: Degradation-Aware Optical Flow Estimation with Diffusion Models

DA-Flow:基于扩散模型的降质感知光流估计

Jaewon Min, Jaeeun Lee, Yeji Choi, Paul Hyunbin Cho, Jin Hyeon Kim, Tae-Young Lee, Jongsik Ahn, Hwayeong Lee, Seonghyun Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Hanwha Systems(韩华系统)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DA-Flow,通过融合扩散模型与卷积特征,提升在真实世界降质视频中的光流估计精度,优于现有方法。

Comments Project page: https://cvlab-kaist.github.io/DA-Flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23246 2026-03-25 cs.CV 79%

GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models

GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染

Zekai Gu, Shuoxuan Feng, Yansong Wang, Hanzhuo Huang, Zhongshuo Du, Chengfeng Zhao, Chengwei Ren, Peng Wang, Yuan Liu

机构 * HKUST(香港科技大学) VAST(中国航空无线电电子研究所) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) ShanghaiTech University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。

Comments Project page: https://igl-hkust.github.io/GO-Renderer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22509 2026-03-25 cs.CV 79%

Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation

Sketch2CT:多模态扩散用于结构感知的3D医学体积生成

Delin An, Chaoli Wang

机构 * University of Notre Dame(诺特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Sketch2CT通过结合用户提供的2D草图和文本描述,利用多模态扩散框架生成结构一致的3D医学体积,提升生成质量与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22458 2026-03-25 cs.CV 79%

MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding

MinerU-Diffusion:通过扩散解码重新思考文档OCR作为逆向渲染

Hejun Dong, Junbo Niu, Bin Wang, Weijun Zeng, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MinerU-Diffusion,通过扩散解码替代自回归解码,提升文档OCR的鲁棒性和效率,实验表明其在长序列推理中速度提升3.2倍,且在视觉OCR能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏