La segmentación meticulosa de imágenes médicas requiere obtener información detallada espacial tanto local como global. El modelo U-Net convencional destaca en la extracción de características espaciales locales a través de bloques de convolución residual, pero tiene dificultades para capturar características globales. Para resolver este problema, proponemos el marco del modelo vision transformer U-NeT (ViTUNet), que combina el mecanismo de autoatención del transformer de visión (ViT) para capturar información global mientras mantiene la extracción de características locales mediante U-NeT. Esta arquitectura propuesta introduce transformadores de visión en los bloques de convolución residual existentes en la ruta del codificador U-Net, capturando así características locales y globales. La ruta del decodificador reconstruye esta información en mapas de segmentación de alta calidad con límites/contornos resaltados con precisión. Este modelo se utiliza para segmentar lesiones cariosas en radiografías interproximales dentales. Estas imágenes se procesan previamente utilizando aumentación, operaciones morfológicas y segmentación para identificar los límites/contornos de las regiones de interés (caries/cavidad). El método propuesto se evalúa en un conjunto de datos aumentado que contiene 3000 pares de imagen-máscara. Se entrenó con 2400 imágenes de entrenamiento y se probó con 600 imágenes de prueba. Los resultados experimentales ejemplificaron mejoras significativas en el rendimiento de la segmentación, logrando una precisión de validación del 98.45%, un coeficiente Dice de validación del 97.88% y puntuaciones métricas de intersección sobre unión (IoU) de validación del 95.87%. Estos resultados son superiores en comparación con otros modelos U-NeT convencionales y de última generación, destacando así el impacto de las arquitecturas híbridas basadas en transformadores en la mejora de las tareas de segmentación de imágenes médicas.
Majanga et al. (2026) estudiaron esta cuestión.