Los puntos clave no están disponibles para este artículo en este momento.
Los informes narrativos de radiología a menudo describen características de la enfermedad de un paciente, incluyendo su ubicación, tamaño y forma. Motivados por el reciente éxito del aprendizaje multimodal, hipotetizamos que este texto descriptivo podría guiar los algoritmos de análisis de imágenes médicas. Propusimos un nuevo modelo de visión-lenguaje, ConTEXTual Net, para la tarea de segmentación de neumotórax en radiografías torácicas. ConTEXTual Net extrae características del lenguaje de informes radiológicos en forma libre generados por médicos utilizando un modelo de lenguaje preentrenado. Luego introdujimos la atención cruzada entre las características del lenguaje y las incrustaciones intermedias de una red neuronal convolucional de codificador-decodificador para permitir la guía del lenguaje para el análisis de imágenes. ConTEXTual Net fue entrenado en el conjunto de datos CANDID-PTX que consiste en 3196 casos positivos de neumotórax con anotaciones de segmentación de 6 médicos diferentes, así como informes clínicos de radiología. Usando validación cruzada, ConTEXTual Net alcanzó un puntaje de Dice de 0.716±0.016, que fue similar al grado de variabilidad interlector (0.712±0.044) calculado en un subconjunto de los datos. Superó a modelos solo de visión (Swin UNETR: 0.670±0.015, ResNet50 U-Net: 0.677±0.015, GLoRIA: 0.686±0.014, y nnUNet 0.694±0.016) y a un modelo de visión-lenguaje competidor (LAVT: 0.706±0.009). Los estudios de ablación confirmaron que fue la información textual la que condujo a las mejoras en el rendimiento. Adicionalmente, mostramos que ciertos métodos de aumento degradaron el rendimiento de segmentación de ConTEXTual Net al romper la concordancia entre imagen y texto. También evaluamos los efectos de usar diferentes modelos de lenguaje y funciones de activación en el módulo de atención cruzada, destacando la eficacia de nuestro diseño arquitectónico elegido.
Huemann et al. (Jue,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: