Los puntos clave no están disponibles para este artículo en este momento.
En una tarea típica de análisis de datos supervisados, es necesario realizar las siguientes dos tareas: (a) seleccionar una combinación óptima de métodos de aprendizaje (por ejemplo, para selección de variables y clasificador) y ajustar sus hiperparámetros (por ejemplo, K en K-NN), también llamada selección de modelo, y (b) proporcionar una estimación del rendimiento del modelo final reportado. Combinar las dos tareas no es trivial porque al seleccionar el conjunto de hiperparámetros que parecen proporcionar el mejor rendimiento estimado, esta estimación es optimista (sesgada/sobreajustada) debido a realizar múltiples comparaciones estadísticas. En este artículo, discutimos las propiedades teóricas de la estimación de rendimiento cuando está presente la selección de modelo y confirmamos que la simple validación cruzada con selección de modelo es en efecto optimista (sobreestima el rendimiento) en escenarios de muestras pequeñas y debe ser evitada. Presentamos en detalle e investigamos las propiedades teóricas de la validación cruzada anidada y un método de Tibshirani y Tibshirani para eliminar el sesgo de estimación. En experimentos computacionales con conjuntos de datos reales, ambos protocolos proporcionan una estimación conservadora del rendimiento y deben ser preferidos. Estas afirmaciones son verdaderas incluso si se realiza la selección de características como preprocesamiento.
Tsamardinos et al. (Jue,) estudiaron esta cuestión.