Key points are not available for this paper at this time.
L'avènement des technologies de séquençage de nouvelle génération (NGS) a ouvert de nouvelles perspectives pour déchiffrer les mécanismes génétiques sous-jacents aux maladies complexes. De nos jours, la quantité de données génomiques est massive et des efforts substantiels ainsi que de nouveaux outils sont nécessaires pour révéler l'information cachée dans ces données. Le portail de données des Genomic Data Commons (GDC) est une plateforme qui contient différentes études génomiques, y compris celles de The Cancer Genome Atlas (TCGA) et des initiatives Therapeutically Applicable Research to Generate Effective Treatments (TARGET), représentant plus de 40 types de tumeurs provenant de près de 30 000 patients. De telles plateformes, bien que très attrayantes, doivent s'assurer que les données stockées sont facilement accessibles et adéquatement harmonisées. De plus, elles se concentrent principalement sur le stockage des données en un seul endroit, sans fournir un ensemble d'outils complet pour l'analyse et l'interprétation des données. Pour répondre à ce besoin urgent, des méthodes computationnelles complètes mais facilement accessibles pour des analyses intégratives de données génomiques qui ne renoncent pas à un cadre statistique et théorique solide sont nécessaires. Dans ce contexte, le package R/Bioconductor TCGAbiolinks a été développé, offrant une variété de fonctionnalités en bioinformatique. Ici, nous introduisons de nouvelles fonctionnalités et améliorations de TCGAbiolinks en termes de i) pipelines plus précis et flexibles pour les analyses d'expression différentielle, ii) différentes méthodes pour l'estimation de la pureté tumorale et le filtrage, iii) intégration d'échantillons normaux provenant d'autres plateformes iv) support pour d'autres ensembles de données génomiques, ici illustré par les données TARGET. Des preuves ont montré que tenir compte de la pureté tumorale est essentiel dans l'étude de la tumorigenèse, car ces facteurs favorisent un comportement de confusion concernant l'analyse d'expression différentielle. Dans cet esprit, nous avons mis en œuvre ces procédures de filtrage dans TCGAbiolinks. De plus, une limitation de certains ensembles de données TCGA est l'indisponibilité ou la rareté des échantillons normaux correspondants. Nous avons donc intégré dans TCGAbiolinks la possibilité d'utiliser des échantillons normaux provenant du projet Genotype-Tissue Expression (GTEx), qui est un autre référentiel à grande échelle cataloguant l'expression génique chez des individus en bonne santé. Les nouvelles fonctionnalités sont disponibles dans la version 2.8 de TCGAbiolinks et supérieure, publiée dans la version 3.7 de Bioconductor.
Mounir et al. (Mar,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: