La estructura secundaria de una proteína sirve como base para construir su estructura tridimensional (3D), que a su vez es crítica para determinar su función y papel en los procesos biológicos. Por lo tanto, predecir con precisión la estructura secundaria no solo facilita la comprensión de la conformación 3D de una proteína, sino que también proporciona información esencial sobre sus interacciones, mecanismos funcionales y aplicaciones potenciales en la investigación biomédica. Los modelos de aprendizaje profundo son particularmente efectivos en la predicción de la estructura secundaria de proteínas debido a su capacidad para procesar datos de secuencias complejas y extraer patrones significativos, aumentando así la precisión y eficiencia de la predicción. Este estudio propone un modelo combinado, ITBM-KD, que integra una red neuronal convolucional temporal (TCN) mejorada, una red neuronal recurrente bidireccional (BiRNN) y un perceptrón multicapa (MLP) para aumentar la precisión de la predicción de estructuras secundarias de proteínas para octapéptidos y tripéptidos. Al combinar codificación one-hot, representación de vectores de palabras de propiedades físico-químicas y destilación de conocimiento con el modelo ProtT5, el modelo propuesto logra un rendimiento excelente en múltiples conjuntos de datos. Para evaluar su efectividad, se utilizaron dos conjuntos de datos clásicos, TS115 y CB513, que contienen 115 y 513 conjuntos de datos de proteínas, respectivamente. Además, se utilizaron 15,078 puntos de datos de proteínas recopilados de la base de datos PDB desde el 6 de junio de 2018 hasta el 6 de junio de 2020, para verificar aún más la robustez y generalizabilidad del modelo. Este estudio mejora la precisión de la predicción y proporciona un modelo esencial para entender la estructura y función de las proteínas, especialmente en entornos con recursos limitados.
Zhao et al. (Sun,) estudió esta cuestión.