Los puntos clave no están disponibles para este artículo en este momento.
El preentrenamiento de modelos de aprendizaje profundo con grandes conjuntos de datos de imágenes naturales, como ImageNet, se ha convertido en el estándar para el análisis de imágenes endoscópicas. Este enfoque es generalmente superior al entrenamiento desde cero, debido a la escasez de imágenes médicas de alta calidad y etiquetas. Sin embargo, aún no se sabe si las características aprendidas en imágenes naturales proporcionan un punto de partida óptimo para las tareas de imagen médica endoscópica posteriores. Intuitivamente, el preentrenamiento con imágenes más cercanas al dominio objetivo podría llevar a representaciones de características mejor adaptadas. Este estudio evalúa si aprovechar el preentrenamiento en dominio en el análisis de imágenes endoscópicas gastrointestinales tiene beneficios potenciales en comparación con el preentrenamiento en imágenes naturales. Para ello, presentamos un conjunto de datos que comprende 5, 014, 174 imágenes endoscópicas gastrointestinales de ocho centros médicos diferentes (GastroNet-5M), y explotamos el aprendizaje auto-supervisado con SimCLRv2, MoCov2 y DINO para aprender características relevantes para tareas posteriores en dominio. Las características aprendidas se comparan con características aprendidas en imágenes naturales derivadas con múltiples métodos y cantidades variables de datos y/o etiquetas (por ejemplo, aprendizaje semi-debilmente supervisado a escala de miles de millones y aprendizaje supervisado en ImageNet-21k). Los efectos de la evaluación se realizan en cinco conjuntos de datos posteriores, diseñados específicamente para una variedad de tareas gastrointestinales, por ejemplo, GIANA para detección de angioplasia y Kvasir-SEG para segmentación de pólipos. Los hallazgos indican que el preentrenamiento auto-supervisado específico de dominio, específicamente usando el marco DINO, resulta en modelos de mejor rendimiento en comparación con cualquier preentrenamiento supervisado en imágenes naturales. En las arquitecturas ResNet50 y Vision-Transformer-small, la utilización de preentrenamiento auto-supervisado en dominio con DINO conduce a un aumento promedio de rendimiento del 1. 63% y 4. 62%, respectivamente, en los conjuntos de datos posteriores. Esta mejora se mide en comparación con el mejor rendimiento alcanzado a través del preentrenamiento en imágenes naturales dentro de cualquiera de los marcos evaluados. Además, los modelos preentrenados en dominio también exhiben una mayor robustez frente a perturbaciones de distorsión (ruido, contraste, desenfoque, etc.), donde el ResNet50 y el Vision-Transformer-small preentrenados en dominio con DINO lograron en promedio un 1. 28% y un 3. 55% más alto en las métricas de rendimiento, en comparación con el mejor rendimiento encontrado para modelos preentrenados en imágenes naturales. En general, este estudio destaca la importancia del preentrenamiento en dominio para mejorar la naturaleza genérica, escalabilidad y rendimiento del aprendizaje profundo para el análisis de imágenes médicas. Los pesos preentrenados de GastroNet-5M están disponibles públicamente en nuestro repositorio: huggingface. co/tgwboers/GastroNet-5MPretrainedWeights.
Boers et al. (Mon,) estudiaron esta cuestión.