Key points are not available for this paper at this time.
La modélisation précise des distributions géographiques des espèces est cruciale pour diverses applications en écologie et en conservation. Les techniques les plus performantes nécessitent souvent un ajustement de paramètres, ce qui peut prendre un temps prohibitif si fait séparément pour chaque espèce, ou être peu fiable pour des ensembles de données petits ou biaisés. De plus, même avec l'abondance de données de bonne qualité, les utilisateurs intéressés par l'application de modèles d'espèces peuvent ne pas avoir les connaissances statistiques requises pour un réglage détaillé. Dans de tels cas, il est souhaitable d'utiliser des « paramètres par défaut », ajustés et validés sur des ensembles de données divers. Maxent est une technique de modélisation récemment introduite, atteignant une grande précision prédictive et bénéficiant de plusieurs propriétés attrayantes supplémentaires. Les performances de Maxent sont influencées par un nombre modéré de paramètres. La première contribution de cet article est l'ajustement empirique de ces paramètres. Étant donné que de nombreux ensembles de données manquent d'informations sur l'absence d'espèces, nous présentons une méthode d'ajustement qui utilise des données de présence seulement. Nous évaluons notre méthode sur des données de présence-absence de haute qualité collectées indépendamment. En plus de l'ajustement, nous introduisons plusieurs concepts qui améliorent la précision prédictive et le temps d'exécution de Maxent. Nous introduisons des « caractères d'huitre » qui modélisent des relations plus complexes dans les données d'entraînement ; nous décrivons un nouveau format de sortie logistique qui donne une estimation de la probabilité de présence ; enfin, nous explorons des stratégies d'échantillonnage de « fond » qui font face au biais de sélection des échantillons et diminuent le temps de construction du modèle. Notre évaluation, basée sur un ensemble de données divers de 226 espèces provenant de 6 régions, montre : 1) des paramètres par défaut ajustés sur des données de présence seulement atteignent des performances presque aussi bonnes que s'ils avaient été ajustés sur les données d'évaluation elles-mêmes ; 2) les caractères d'huitre améliorent considérablement les performances du modèle ; 3) la sortie logistique améliore la calibration du modèle, de sorte que de grandes différences de valeurs de sortie correspondent mieux à de grandes différences de convenance ; 4) l'échantillonnage de fond « groupe cible » peut donner de bien meilleures performances prédictives que l'échantillonnage de fond aléatoire ; 5) l'échantillonnage de fond aléatoire entraîne une diminution spectaculaire du temps d'exécution, sans diminution des performances du modèle.
Phillips et al. (Fri,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: