Los puntos clave no están disponibles para este artículo en este momento.
AbstractMultiple regression analysis continues to be a quantitative tool used extensively in the ecological literature. Consequently, methods for model selection and validation are important considerations, yet ecologists appear to pay little attention to how the choice of method can potentially influence the outcome and interpretation of their results. In this study we review commonly employed model selection and validation methods and use a Monte Carlo simulation approach to evaluate their ability to accurately estimate variable inclusion in the final regression model and model prediction error. We found that all methods of model selection erroneously excluded or included variables in the final model and the error rate depended on sample size and the number of predictor variables. In general, forward selection, backward elimination and stepwise selection showed better performance with small sample sizes, whereas a modified bootstrap approach outperformed other methods with larger sample sizes. Model selection using all-subsets or exhaustive search was highly biased, at times never selecting the correct predictor variables. Methods for model validation were also highly biased, with resubstitution and data-splitting (i.e., dividing the data into training and test samples) techniques producing biased and variable estimates of model prediction error. In contrast, jackknife validation was generally unbiased. Using an empirical example we show that the interpretation of the ecological relationships between fish species richness and lake habitat is highly dependent on the type of model selection and validation method employed. The fact that model selection is frequently unsuited to determine correct ecological relationships, and that traditional approaches for model validation over-estimate the strength and value of our empirical models, is a major concern.RésuméL'analyse de régression multiple continue d'être un outil quantitatif très utilisé dans la littérature écologique. En conséquence, les méthodes de sélection et de validation de modèle sont d'une grande importance. Cependant, les écologistes semblent ne payer que peu d'attention au fait que le choix d'une méthode plutôt qu'une autre peut influencer les résultats obtenus ainsi que leur interprétation. Cette étude utilise des simulations de Monte Carlo afin d'évaluer la capacité des méthodes de sélection et de validation de modèle les plus couramment utilisées à estimer avec précision l'insertion d'une variable dans le modèle de régression final, ainsi que l'erreur inhérente au modèle de prédiction. Les résultats montrent que toutes les méthodes de sélection de modèle excluent ou incluent des variables de façon erronée dans le modèle final et que l'erreur dépend de la taille de l'échantillon et du nombre de variables prédictives. En général, la sélection progressive, l'élimination régressive et la sélection pas à pas montrent de meilleures performances avec de petits échantillons, tandis que l'approche bootstrap modifiée offre de meilleurs résultats avec les échantillons de tailles plus importantes. La sélection de modèle utilisant la recherche exhaustive est fortement biaisée, n'arrivant souvent pas à sélectionner les variables prédictives adéquates. Les méthodes de validation de modèle sont également fortement biaisées, les techniques de remplacement et de séparation de données (division des données en échantillons test et d'entraînement) produisant des estimations biaisées et variables de l'erreur de prédiction du modèle. Par ailleurs, la validation par jackknife est généralement non biaisée. À l'aide d'un exemple empirique, il est démontré que l'interprétation des relations écologiques entre la richesse spécifique de l'ichtyofaune et l'habitat est fortement dépendante du type de méthode de sélection et de validation de modèle qui est utilisé. Enfin, on devait s'inquiéter du fait que la sélection de modèle est souvent non appropriée pour déterminer les véritables relations écologiques et que les approches traditionnelles pour la validation de modèle surestiment la force et la valeur des modèles empiriques.Keywords:: Multiple regression analysisVariable selectionExplanatoryPredictive powerBiasBootstrapJackknifeCross validationMonte Carlo simulationsMots-clés: Analyse de régression multipleSélection de variablesExplicatifPuissance de prédictionBiaisBootstrapJackknifeValidation croiséeSimulations de Monte Carlo
Olden et al. (Sat,) studied this question.