Key points are not available for this paper at this time.
L'interprétation des expériences basées sur les données en génomique implique souvent une recherche de catégories biologiques enrichies pour les gènes répondants identifiés par les expériences. Cependant, les bases de connaissances telles que l'Ontology des Gènes (GO) contiennent des centaines ou des milliers de catégories avec un chevauchement très élevé entre les catégories. Ainsi, l'analyse d'enrichissement effectuée sur une catégorie à la fois retourne fréquemment un grand nombre de catégories corrélées, laissant le choix des plus pertinentes à l'interprétation de l'utilisateur. Ici, nous présentons l'analyse des ensembles de gènes basée sur des modèles (MGSA) qui analyse toutes les catégories simultanément en les intégrant dans un réseau bayésien, dans lequel la réponse des gènes est modélisée comme une fonction de l'activation des catégories biologiques. L'inférence probabiliste est utilisée pour identifier les catégories actives. L'approche de modélisation bayésienne prend naturellement en compte le chevauchement des catégories et évite la nécessité de corrections pour tests multiples rencontrées dans l'analyse d'enrichissement de catégorie unique. Sur des données simulées, MGSA identifie des catégories actives avec une précision allant jusqu'à 95 % à un rappel de 20 % pour des réglages de bruit modérés, menant à une amélioration de la précision par un facteur dix par rapport à l'analyse statistique d'enrichissement de catégorie unique. L'application à un ensemble de données d'expression génétique chez la levure démontre que la méthode fournit des vues résumées de haut niveau des processus biologiques fondamentaux et élimine correctement les associations confondantes.
Bauer et al. (ven,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: