Los modelos tradicionales de análisis de imágenes de fondo se centran en tareas unimodales, ignorando la complementariedad de la modalidad de fondo, lo que limita su versatilidad. Recientemente, han surgido modelos de base retinal, pero la mayoría sigue siendo específica de la modalidad. Integrar múltiples modalidades de imagen de fondo en un solo modelo de base es valioso. Sin embargo, en entornos dinámicos, los datos de diferentes modalidades a menudo llegan de manera incremental, lo que requiere un preentrenamiento continuo. Para abordar esto, proponemos RetCoP, el primer marco de preentrenamiento continuo de visión-lenguaje en el dominio de fondo, que integra incrementalmente características de imagen y texto de diferentes modalidades de imagen en un solo modelo de base unificado. Para mitigar el olvido catastrófico en el preentrenamiento continuo, introducimos una estrategia de ensayo que utiliza pares representativos de imagen-texto y un enfoque de destilación de información fuera de la diagonal. La primera permite que el modelo revise conocimientos de etapas anteriores, mientras que la segunda preserva explícitamente la alineación entre las representaciones de imagen y texto. Los experimentos muestran que RetCoP supera todos los métodos comparados, logrando la mejor generalización y la tasa de olvido más baja. El código se puede encontrar en https://github.com/Yuang-Yao/RetCoP.
Yao et al. (Tue,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: