Key points are not available for this paper at this time.
Resumo A sequenciação de RNA (RNA-seq) tornou-se uma tecnologia chave na medicina de precisão, especialmente para prognóstico de câncer. No entanto, a alta dimensionalidade desses dados pode restringir métodos estatísticos clássicos, levantando assim a necessidade de aprender representações densas a partir deles. Modelos de Transformers exibiram capacidades em fornecer representações para sequências longas e, portanto, são bem adequados para dados transcriptômicos. Neste artigo, desenvolvemos um modelo de linguagem baseado em transformer pré-treinado por meio de aprendizado auto-supervisionado utilizando RNA-seq de bulk de tecidos não cancerígenos e cancerígenos, seguindo o método de mascaramento do BERT. Ao investigar as embeddings aprendidas do modelo ou utilizando ajuste fino eficiente em termos de parâmetros, construímos então modelos posteriores para classificação de tipos de câncer e previsão de tempo de sobrevida. Aproveitando o conjunto de dados TCGA, demonstramos o desempenho do nosso método, BulkRNABert, em ambas as tarefas, com melhoria significativa em comparação com métodos de ponta na configuração pan-câncer para classificação e análise de sobrevida. Também mostramos as capacidades de transferência do modelo na configuração de análise de sobrevida em coortes não vistas. Código disponível em https://github.com/instadeepai/multiomics-open-research
Gélard et al. (Sáb,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: