Los puntos clave no están disponibles para este artículo en este momento.
Presentamos embeddings SMILES derivados del estado interno del codificador de un modelo Transformer 1 entrenado para canonizar SMILES como un problema Seq2Seq. Usar una arquitectura CharNN 2 sobre los embeddings resulta en modelos QSAR/QSPR interpretables de mayor calidad en diversos conjuntos de datos de referencia que incluyen tareas de regresión y clasificación. El método Transformer-CNN propuesto utiliza la augmentación de SMILES para entrenamiento e inferencia, y por lo tanto, el pronóstico se basa en un consenso interno. Que tanto la augmentación como el aprendizaje por transferencia se basen en embeddings permite que el método proporcione buenos resultados para conjuntos de datos pequeños. Discutimos las razones de tal efectividad y esbozamos direcciones futuras para el desarrollo del método. El código fuente y los embeddings necesarios para entrenar un modelo QSAR están disponibles en https://github.com/bigchem/transformer-cnn. El repositorio también tiene un programa independiente para el pronóstico QSAR que calcula las contribuciones de átomos individuales, interpretando así el resultado del modelo. El entorno OCHEM 3 (https://ochem.eu) alberga la implementación en línea del método propuesto.
Karpov et al. (2020) estudiaron esta cuestión.