En el descubrimiento de fármacos y la investigación terapéutica, la predicción de asociaciones fármaco-enfermedad (DDAs) tiene un valor científico y clínico significativo. Las moléculas fármaco ejercen sus efectos identificando con precisión los objetivos biológicos relacionados con la enfermedad, modulando sistemáticamente todo el proceso farmacológico desde la absorción, distribución y metabolismo hasta la eficacia final. La predicción precisa de las asociaciones fármaco-enfermedad no solo facilita una comprensión profunda de los mecanismos moleculares de la acción del fármaco, sino que también proporciona bases teóricas críticas para la reposición de medicamentos y la medicina personalizada. Mientras que los métodos tradicionales de predicción basados en experimentos in vitro y estadísticas clínicas producen resultados fiables, presentan inconvenientes inherentes, como largos ciclos de desarrollo, consumo sustancial de recursos y baja capacidad de procesamiento. En contraste, las técnicas emergentes de aprendizaje automático ofrecen una solución prometedora a estos cuellos de botella, permitiendo el descubrimiento inteligente y eficiente de redes potenciales de asociaciones fármaco-enfermedad y mejorando significativamente la eficiencia del desarrollo de fármacos. Sin embargo, es importante destacar que los métodos actuales de aprendizaje automático aún enfrentan desafíos significativos en aplicaciones prácticas: la complejidad en la construcción de características eleva el umbral para el procesamiento de datos; la escasez de datos limita la profundidad de la minería de información; y el problema omnipresente del desequilibrio de muestras representa un desafío severo para la precisión predictiva y el rendimiento de generalización del modelo. En este estudio, desarrollamos un marco eficiente y preciso para la predicción de asociaciones fármaco-enfermedad denominado FKSUDDAPre. El modelo emplea una estrategia de fusión de características multimodal: por un lado, aprovecha un conjunto de Mol2vec y K-BERT para capturar profundamente las características semánticas de las huellas moleculares del fármaco; por otro lado, integra Medical Subject Headings (MeSH) con DeepWalk para reducir eficazmente la dimensionalidad de las características de la enfermedad al tiempo que preserva su estructura relacional. Para abordar el problema de desequilibrio de clases, FKSUDDAPre diseñó un algoritmo de optimización llamado AMDKSU, que combina agrupamiento con una estrategia mejorada de métrica de distancia, mejorando significativamente el poder discriminativo del conjunto de muestras. Para el procesamiento de datos, se empleó F-test para el ranking de importancia de características, reduciendo eficazmente la dimensionalidad de los datos y mejorando la generalización del modelo. Para la arquitectura predictiva, FKSUDDAPre propuso un nuevo marco conjunto compuesto por XGBoost, Árbol de Decisión, Bosque Aleatorio y HyperFast. Mediante una estrategia dinámica de asignación de pesos, este conjunto aprovecha eficazmente las fortalezas complementarias de estos modelos para lograr un rendimiento predictivo significativamente mejorado. La validación rigurosa demostró el destacado rendimiento del sistema en múltiples métricas de evaluación, con un AUC promedio de 0,9725, mejorando el AUC en aproximadamente un 3,88% en comparación con el mejor modelo base. En la predicción de la enfermedad de Alzheimer y la enfermedad de Parkinson, respectivamente, el 80% y el 60% de los 10 principales fármacos candidatos recomendados por FKSUDDAPre han sido confirmados en la literatura, demostrando el buen potencial de aplicación práctica del modelo. Además, realizamos un análisis de importancia de características basado en LIME sobre las predicciones del modelo, visualizando las correlaciones entre características y la variable objetivo para demostrar la interpretabilidad del modelo. También se desarrolló una herramienta de visualización multiplataforma y fácil de usar utilizando el framework PyQt5.
Zuo et al. (jue,) estudiaron esta cuestión.