Resumen La efectividad de los modelos de aprendizaje automático depende en gran medida de la calidad y relevancia de las características extraídas de los datos en bruto. La Ingeniería de Características Automatizada (AutoFE) ofrece una solución escalable al generar grandes pools de características candidatas. Sin embargo, la expansión no filtrada de características introduce redundancia, agrava la sobrecarga computacional y puede perjudicar la generalización del modelo debido a la maldición de la dimensionalidad. Para abordar esto, proponemos el Olvido de Características, un mecanismo proactivo y dinámico de poda que descarta características redundantes o no informativas durante la fase de construcción de características. A diferencia de los métodos convencionales de selección de características post-hoc como Lasso o Eliminación Recursiva de Características, nuestro enfoque integra la evaluación de la relevancia de las características en el ciclo de generación utilizando información mutua, factor de inflación de varianza y entropía de Shannon. Las evaluaciones empíricas en tres conjuntos de datos de referencia —predicción de riesgo crediticio, análisis de abandono de clientes y diagnósticos de salud— revelan que el Olvido de Características puede reducir la dimensionalidad de características en hasta un 50%, reducir el tiempo de entrenamiento en un 40% y mejorar la precisión en la clasificación hasta en un 5%. Estos hallazgos respaldan la utilidad de la curaduría de características en tiempo real en la construcción de pipelines AutoML interpretables y eficientes.
Patankar et al. (Mié,) estudiaron esta cuestión.