摘要 本文介绍了SqueezeViT(压缩视觉变换器),这是一种基于视觉变换器(ViT)的紧凑而有效的架构,旨在用于胸部X光(CXR)图像分类。与传统的ViT架构相比,传统架构计算要求高,SqueezeViT采用了一种新颖的压缩程序,有效地降低了令牌维度,而没有妨碍重要的视觉组件,从而加快了推理速度并减少了内存消耗。设计的模型在两个常用的公共数据集上进行了测试,NIH胸部X光和CheXpert,涵盖了多种胸部病理。与基线MobileViT相比,SqueezeViT减少了43.2%的参数数量,而与其他最先进(SOTA)模型相比减少了多达95.4%。与SOTA模型相比,建议的模型在接收器操作特征曲线下面积(AUROC)方面提供了高达16.5%的改进,并且在许多任务中总体上优于基线和有效的卷积神经网络CNNs。这样的发展使得提出的SqueezeViT方法成为各种应用的一个有吸引力的选择。结果表明,SqueezeViT在保持轻量级模型架构的同时超越了当前的SOTA分类器。这些结果强调了在计算资源可能受到限制的实际临床环境中使用SqueezeViT的可能性。
Maurya等(周四)研究了这个问题。