Key points are not available for this paper at this time.
MOTIVATION : L'analyse des propriétés statistiques des séquences d'ADN est importante pour la biologie évolutive ainsi que pour les technologies de sondes d'ADN et de PCR. Ces technologies, à leur tour, peuvent être utilisées pour l'identification des organismes, ce qui implique des applications dans le diagnostic des maladies infectieuses, les études environnementales, etc. RÉSULTATS : Nous présentons les résultats de l'analyse de corrélation des distributions de présence/absence de courtes sous-séquences nucléotidiques de différentes longueurs (« n-mers », n = 5-20) dans plus de 1500 génomes microbiens et viraux, ainsi que dans cinq génomes d'organismes multicellulaires (y compris l'humain). Nous calculons si un n-mer donné est présent ou absent (fréquence de présence) dans un génome donné, ce qui n'est pas le nombre habituellement calculé d'apparitions de n-mers dans un ou plusieurs génomes (fréquence d'apparition). Pour les organismes qui ne sont pas étroitement apparentés, la présence/absence de différents 7-20mers dans leurs génomes n'est pas corrélée. Pour les organismes biologiquement proches, une certaine corrélation de la présence de n-mers dans cette gamme apparaît, mais n'est pas aussi forte qu'attendu. L'atténuation des corrélations parmi les n-mers présents dans différents génomes ouvre la possibilité d'utiliser des ensembles aléatoires de n-mers (avec un n judicieusement choisi) pour discriminer les génomes de différents organismes et éventuellement les génomes individuels de la même espèce, y compris l'humain, avec une faible probabilité d'erreur.
Fofanov et al. (Thu,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: