arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

DAMamba-UNet3D:一种用于3D医学图像分割的参数高效的Mamba状态空间U-Net,采用动态自适应扫描

DAMamba-UNet3D: A Parameter-Efficient Mamba State Space U-Net with Dynamic Adaptive Scan for 3D Medical Image Segmentation

Mohammad Arafat Hussain, Ellen Grant, Yangming Ou

arXiv 2607.22718首次发表:更新:

发表机构

Boston Children’s Hospital; Harvard Medical School(波士顿儿童医院; 哈佛医学院)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

该研究针对3D医学图像分割,提出DAMamba-UNet3D混合编码器-解码器,在编码器特定阶段集成三平面3D-DAS块,降低参数成本,通过实验对比展示其在分割性能上的优势,表明学习的三平面DAS在混合U-Net中有竞争力。

AI 中文摘要

我们提出了基于状态空间模型(SSM)的参数高效U-Net架构用于3D医学图像分割。卷积U-Net每层有O(n)的局部混合,但缺乏显式全局上下文;变压器以O(n^2)的序列长度成本提供全局推理。Mamba等状态空间模型每个块提供O(n)的全局传播。然而,现有的医学SSM分割器依赖固定扫描模式和大量参数预算。动态自适应扫描(DAS)在选择性扫描前学习数据相关的重新排序,尚未应用于医学成像或扩展到3D体积。我们提出DAMamba-UNet3D,一种混合编码器-解码器,在编码器阶段E2-E4集成三平面3D-DAS块,其他地方保留卷积(约530万个参数)。在BraTS 2020五折交叉验证中,DAMamba-UNet3D以比SegMamba低约13倍的参数成本实现平均Dice 0.815±0.013(全体积逐例评估)。在可比规模下,DAMamba-L(约70M),一种仅编码器为DAMamba且有卷积瓶颈的宽DAS原生变体,达到0.829±0.012,比重新训练的SegMamba高0.5个百分点。组件消融表明仅编码器的DAS放置至关重要,因为瓶颈和解码器SSM块会降低Dice。结果表明,混合U-Net中学习的三平面DAS与SegMamba在BraTS 2020上的固定三向Mamba(ToM)扫描具有竞争力,在我们的大规模设计下可能有所改进。

英文摘要

We propose parameter-efficient SSM-based U-Net architectures for 3D medical image segmentation. Convolutional U-Nets afford O(n) local mixing per layer but lack explicit global context; transformers provide global reasoning at O(n^2) cost in sequence length $n$. State-space models (SSMs), such as Mamba, offer $O(n)$ global propagation per block. Yet, existing medical SSM segmenters rely on fixed scan patterns and large parameter budgets. Dynamic Adaptive Scan (DAS), which learns data-dependent reordering before selective scan, has not been applied to medical imaging or extended to 3D volumes. We propose DAMamba-UNet3D, a hybrid encoder-decoder that integrates tri-plane 3D-DAS blocks at encoder stages E2-E4 while retaining convolutions elsewhere (~5.3M parameters). On BraTS 2020 five-fold cross-validation, DAMamba-UNet3D achieves mean Dice 0.815+/-0.013 (full-volume per-case evaluation) at ~13x lower parameter cost than SegMamba (0.824+\-0.014, ~70M). At comparable scale, DAMamba-L (~70M), a wide DAS-native variant with encoder-only DAMamba and a convolutional bottleneck, reaches 0.829+\-0.012, surpassing retrained SegMamba by 0.5pt. Component ablations show that encoder-only DAS placement is critical as bottleneck and decoder SSM blocks lower Dice. Together, the results suggest that learned tri-plane DAS in a hybrid U-Net is competitive with, and under our large-scale design may improve upon, SegMamba's fixed Tri-orientated Mamba (ToM) scanning on BraTS 2020. Code: https://github.com/marafathussain/DAMamba-UNet3D.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑