首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >MV-Swin-T | 纯Transformer架构引入新型移位窗口注意力完成多视图空间特征的交互

MV-Swin-T | 纯Transformer架构引入新型移位窗口注意力完成多视图空间特征的交互

作者头像
集智书童公众号
发布2024-03-11 11:53:11
发布2024-03-11 11:53:11
1.4K0
举报
文章被收录于专栏:集智书童集智书童

传统的深度学习方法在乳腺癌分类上主要集中于单视图分析。然而,在临床实践中,放射科医生会同时检查乳房摄影检查中的所有视图,利用这些视图之间的内在相关性有效地检测肿瘤。认识到多视图分析的重要性,一些研究引入了独立处理乳房X线照片视图的方法,要么通过不同的卷积分支,要么通过简单的融合策略,无意中导致关键视图间相关性的丧失。 在本文中,作者提出了一种创新的多视图网络,该网络完全基于 Transformer 来解决乳房摄影图像分类的挑战。作者的方法引入了一种新颖的移位窗口式动态注意力块,促进多视图信息的有效整合,并在空间特征图层面推动这些信息在视图间的连贯传递。此外,作者使用CBIS-DDSM和Vin-Dr Mammo数据集,对基于 Transformer 的模型在不同设置下的性能和有效性进行了全面比较分析。 代码:https://github.com/prithuls/MV-Swin-T

1 Introduction

乳腺癌在全球范围内是导致女性癌症相关死亡的第二大主要原因,也是影响女性最常见的癌症[1]。早期检测主要依赖于筛查式乳房X光摄影,包括四张图像——每侧乳房从不同角度拍摄两张:从侧面的斜位(MLO)和从上方的头尾位(CC)。尽管传统的深度学习方法在乳腺癌分类中主要关注单一视角的分析,但放射科医生在乳房X光检查中同时评估所有视角,认识到提供关键肿瘤信息的重要相关性。这突显了在医疗保健中跨视角数据分析识别异常和做出诊断的重要性,以及基于多视角或多图像的计算机辅助诊断(CAD)方案相对于基于单图像的CAD方案的优势。在乳腺癌分类和检测的最新研究中,应用了深度学习技术,取得了有希望的结果。许多当前的研究[2, 3, 4]旨在融合多视角架构,这些架构受到放射科医生多视角分析的启发,从而为更强大、性能更高的模型做出贡献。

通过利用深度神经网络(DNNs)将多视角整合到乳腺癌筛查中的努力,源自Carneiro等人[5]的工作。他们分别对MLO和CC视图上的模型进行单独训练,然后使用最终的全连接层的特征来训练一个多项逻辑斯蒂回归模型。在平行的工作中,Sridevi等人[6]提出了一种利用CC和MLO视图的分类策略。他们的方法包括初始图像标准化、胸大肌去除,以及随后通过卷积和池化层进行特征提取,提取的特征被连接起来。在[7]中,Khan等人引入了一个两阶段的分类策略,涉及从四个乳房X线摄影视图中提取的ROI。各种卷积神经网络被用作特征提取器,所有视图提取的特征通过早期融合策略进行连接,最终通过分类器层产生最终的输出。

近来,由于关注机制在各个领域的广泛应用,它已成为深度学习中的一个核心概念。在这种背景下,关注机制的目标是让模型能够选择性地聚焦于相关的局部输入区域和特征通道,从而避免对所有位置和特征进行同等处理。在医学图像分析中,由于诊断往往依赖于特定的关注区域,最近的研究探索了将关注机制整合到多视角乳房摄影分析中。然而,这些尝试仍然部分依赖于卷积方法,并未完全发挥关注机制的内在潜力。自我关注机制,是 Transformer 模型固有的,它使模型能够动态地识别应关注的位置和内容,利用相关的图像区域或特征来提升任务性能。借助自我关注机制,视觉 Transformer [8]在捕捉输入序列中的长距离依赖方面表现出色。

尽管 Transformer 在建模长程依赖关系方面具有明显的潜力,但在多视角乳房X光片分析中的应用仍然相对未探索。一些研究,如[9],采用了结合 Transformer 和CNN的混合模型,引入了全局跨视角转换块以融合来自CC和MLO视角的中间特征图。另一项值得注意的工作是[10],该研究采用基于 Transformer 的模型进行乳腺癌分割检测。然而,它们在网络的后阶段处理多视角,错过了捕捉视角间局部相关性的机会,并且未在公开可用的数据集上提供结果,从而限制了与现有文献的可比性。

为了充分利用多视角的洞察力,作者提出了一种基于Transformer的新型多视角网络MV-Swin-T,该网络基于Swin Transformer [11] 架构,用于乳房摄影图像的分类。

作者的贡献包括:

  1. 设计一种完全基于Transformer架构的新型多视角网络,利用Transformer操作的优势以提升性能。
  2. 一种新颖的“多头动态注意力块(MDA)”通过固定和移位的窗口特征,实现了同一乳房的CC视图和MLO视图之间的自我信息和跨视图信息融合。
  3. 应对有效结合来自多个视角或模态数据的挑战,尤其是在图像可能无法正确对齐的情况下。
  4. 作者展示了使用公开可获得的CBIS-DDSM和VinDr-Mammo数据集的结果。
  5. 此外,为了理解 Transformer (transformers)和各种相关模块的影响,作者在训练过程中引入了各种结构上的变化,分析它们对整个网络的总体影响。关于这些分析的详细见解将在3.2节中提供。

2 Methodology

作者的方法专注于开发一种基于Swin Transformer架构的专用网络,特别用于分类未注册的多视角乳腺摄影对。为了增强模型的容量,作者引入了新颖的全息注意力转换块,其中包括先进的多元动态注意力机制以及常规和偏移窗口配置。

强调一点,作者的实验重点仅限于同侧视角,故意排除了双侧视角。同侧分析基于同一乳房的CC和MLO视图进行诊断,而双侧分析则整合了来自双乳房对应视图的发现。这种刻意的选择与临床规范相一致,在这些规范中,放射学家通常采用同侧分析来分类乳腺肿瘤肿块,并利用双侧分析中的对称性信息来检测不对称性,如[12]中强调的。由于作者的架构缺少标准的 Backbone 结构,作者避免了使用预训练,并选择了独特的方法。

全能注意力转换块:全能注意力转换块是通过将文献[11]中提出的窗口和偏移窗口的多头自注意力(MSA)模块替换为常规和偏移窗口的多头动态注意力(W-MDA和SW-MDA)模块来构建的,同时在其他层保持一致性。架构修改如Figure 2所示。每个多头动态注意力(MDA)模块后面都跟着一个带有修正线性单元(ReLU)非线性激活的两层多层感知机(MLP)。

值得注意的是,与Swin Transformer论文中的选择相反,作者选择了ReLU非线性而不是GELU非线性。为了增强稳定性和促进收敛,在每个MDA模块和每个MLP之前应用了一个层归一化(LayerNorm,LN)层,并在每个模块后应用了残差连接。

多头动态注意力机制: 在每个W-MDA模块中,作者融合了自注意力和跨注意力机制,用于处理CC和MLO视图,这些计算在局部窗口内进行。

这些窗口策略性地以非重叠方式均匀分割图像,对于224

\times

224的图像,窗口的固定大小为7;对于384

\times

384的图像,窗口大小为12。自注意力和跨注意力的计算过程是相同的,关键区别在于自注意力机制中,

Q

K

V

矩阵来自相同的视图。相比之下,对于跨视图注意力,

K

矩阵来自另一个视图,而

Q

V

矩阵则源自原始视图,如图1所示。

DA_{CC}=[\text{Linear}(\sigma(\frac{Q_{CC}K_{CC}^{T}}{\text{scale}})\,\,\oplus \,\sigma(\frac{Q_{CC}K_{MLO}^{T}}{\text{scale}}))]V_{CC} \tag{1}
W\text{-}MDA/SW\text{-}MDA=\langle DA_{CC},DA_{MLO}\rangle \tag{2}

方程1展示了从输入的CC视图中的动态注意力。这里的

Q

K

V

分别代表相应输入的 Query 、键和值,而

\sigma

代表softmax操作。作者在方程中将全连接层表示为线性。

W

-

MDA

SW

-

MDA

可以分别用相应的动态注意力

DA_{CC},DA_{MLO}

构建。

在方程3中,作者描述了全息注意力 Transformer 的第一个子块,它包括一个层归一化(LN)层、一个多头动态注意力模块(W-MDA)以及带有ReLU非线性的2层多层感知机(MLP)。在这里,

l

表示层数,

Z

代表特征图。

\begin{split}&\hat{Z}^{l}=W\text{-}MDA(LN(Z^{l-1}))+Z^{l-1},\\ & Z^{l}=MLP(LN(\hat{Z}^{l}))+\hat{Z}^{l}.\end{split} \tag{3}
\begin{split}&\hat{Z}^{l+1}=SW\text{-}MDA(LN(Z^{l}))+Z^{l},\\ & Z^{l+1}=MLP(LN(\hat{Z}^{l+1}))+\hat{Z}^{l+1}.\end{split} \tag{4}

移位窗口多头动态注意力: 基于固定窗口的动态注意力模块缺乏窗口间的连接,从而限制了其建模能力。为了在不重叠窗口的计算效率基础上引入跨窗口连接,作者采用了类似于[11]的移位窗口划分方法。公式4展示了Swin Transformer的第二个子块,它包括一个LN层、一个移位窗口多头动态注意力模块(SW-MDA)以及一个带有ReLU激活的MLP。

所提出的MV-Swin-T架构将Omni-Attention模块整合到网络的最初两个阶段中。在第二个阶段之后,来自不同视角的输出被连接起来,并通过一个全连接层进行传递,以保持与单视角乳房X光片的尺寸一致。处理后的输出随后在第三和第四阶段通过Swin Transformer模块,最终产生最终的输出。

3 Experiments and Results

Dataset & Implementation Setting

作者使用数字乳房筛查摄影数据库的精选乳腺影像子集(CBIS-DDSM)和VinDr-Mammo数据集对作者的 Proposal 架构进行了评估。CBIS数据集包含来自1231名女性的2462张乳腺摄影图像,为大多数案例提供了CC和MLO视图。在数据准备之后,作者使用了509个患者数据记录进行训练和151个进行测试,排除了那些两种视图都缺失的案例。

此外,作者还结合了DDSM数据集中的钙化数据,最终用于训练的总图像数为1062张,用于测试的为253张。VinDr-Mammo数据集包含5000个四视图检查,当考虑到同一乳房的CC和MLO视图时,训练图像有8000张,测试图像有2000张。

为了增强模型的鲁棒性,作者采用了数据增强技术,包括对所有图像进行随机水平翻转和垂直翻转,以及随机旋转。此外,在将图像输入模型之前,作者将所有图像的大小调整为224

\times

224和384

\times

384。在预处理方面,对于CBIS数据集,作者遵循了与[15]中讨论的类似流程,而对于VinDr-Mammo数据集,作者使用了OpenCV Python包进行图像的归一化和增强。对于VinDr-Mammo数据集,作者将BIRADS值为1至3的病例分类为良性,4至6的病例分类为恶性。

作者使用PyTorch开发了该模型,并采用Adam优化器进行训练,初始学习率衰减设置为0.0001,权重衰减为0.001。对于该数据集,作者使用了二元交叉熵损失,并采用0.5的阈值来决定类别分配。作者的训练进行了100个周期,使用了ReduceLROnPlateau学习率调度器和早停机制。值得注意的是,在所有实验中,最佳结果通常在不到50个周期就一致性地实现了。

Results and Analysis

作者探索了各种配置,并在图2中展示了具有跨视图注意力机制的最优模型。表1对不同架构设置进行了比较分析,特别关注“融合阶段”一列,它代表了在阶段 Level 上CC和MLO视图的融合。

作者的实验表明,在第二个阶段后进行融合,在不同数据集上均能一致地获得最佳效果。这种参数减少显著提高了模型的效率,防止过拟合并降低计算复杂度,特别是在处理有限数量的训练图像时尤其有利。同时,在第二个阶段后早期整合确保了全面的表示,考虑到两种视图,从而提高了模型的上下文理解能力和整体性能。

“注意力融合”一栏说明了如何在MDA模块中将CC视图和MLO视图的注意力进行结合。为此,作者进行了加权加法和拼接的实验。在加权加法方法中,作者测试了从0.9到0.5的各种权重值。然而,作者只展示了权重值为0.9和0.1的结果,其中0.9与同一视图相乘,0.1与交叉视图相乘,因为这一设置在所有值集中得到了最佳结果。尽管如此,拼接方法取得了整体最佳效果。

此外,作者检查了两种图像尺寸(224×224和384×384),并将训练数据集多样化以包括肿块和质量-钙化。模型在384×384的图像尺寸上能获得更好的结果。作者得出结论,分类任务的成功不仅依赖于精确的肿块定位,还在于有效地关注肿块边界,增加图像尺寸增强了网络理解肿块边界的能力。

表2对作者的提出的MV-Swin-T架构与基于单视图操作的 Baseline Swin-T架构进行了比较分析。结果显示,作者提出的模型在所有数据集上均表现出卓越的性能。这进一步强化了基于多视图融合评估可以有效地从两个视图整合相关信息,减轻单视图的噪声干扰,并产生更准确的预测的观点。该模型特别是在VinDr-Mammo数据集上展现了最优的结果。作者将这种性能差距归因于两个数据集之间图像质量的差异。此外,VinDr数据集较大的规模也可能是性能优越的原因之一,因为深度学习模型通常从较大的数据集中受益以获得最佳结果。

4 Discussion and Conclusion

Transformer结构近年来因能有效捕获长距离依赖而受到关注。然而,在多视角乳腺X线分析领域,其潜力仍有待进一步挖掘。在这项研究中,作者提出了一种基于纯Transformer的多视角网络,用于乳腺癌的分类,该网络设计旨在模仿放射科医生解读多视角乳腺X线片并利用同侧视图中的信息。作者引入了一种新颖的多头动态注意力(MDA)模块,它隐式地学习强调与癌症相关的局部异常,并通过探索两个乳腺X线片视图之间的跨视角信息来突出关键特征。

本研究进行了广泛的实验,探索了多个数据集中的不同配置。在结论部分,作者展示了与单视角方法相比,作者的多视角方法的性能。结果表明,多视角方法具有优越性,强调了它在提高整体性能方面的有效性。作者相信,作者的方法在这个研究领域中代表了重要的突破,为处理医学影像检查的新技术铺平了道路,使分析过程更类似于放射科医生的方式。探索将多视角方法扩展到更大数据集的策略,可能会为模型的泛化能力提供额外的见解和改进。

参考

[1].MV-Swin-T: Mammogram Classification with Multi-View Swin Transformer.

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2024-03-10,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 1 Introduction
  • 2 Methodology
  • 3 Experiments and Results
    • Dataset & Implementation Setting
    • Results and Analysis
  • 4 Discussion and Conclusion
  • 参考
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档