Key points are not available for this paper at this time.
O desafio BioCreative VI Track IV (mineração de interações entre proteínas e mutações para medicina de precisão) foi organizado em 2017 com o objetivo de aplicar métodos de mineração de texto biomédico para apoiar avanços nas abordagens de medicina de precisão. Como parte do desafio, um novo conjunto de dados foi introduzido com o propósito de construir um modelo de extração de relação supervisionado capaz de tomar um artigo de teste e retornar uma lista de pares de proteínas interagindo identificados por seus IDs de Gene Entrez. Especificamente, tais pares representam proteínas que participam de uma relação de interação proteína-proteína binária onde a interação é adicionalmente afetada por uma mutação genética - referida como relação PPIm. Neste estudo, exploramos uma abordagem de ponta a ponta para extração de relações PPIm, utilizando um pipeline de três componentes que envolve modelos de reconhecimento de entidade nomeada e classificação de relação baseados em aprendizado profundo, juntamente com uma abordagem baseada em conhecimento para normalização de genes. Propomos várias melhorias focadas em recall para nossa entrada original ao desafio que ficou em segundo lugar ao combinar com o ID de Gene Entrez (correspondência exata) e no ID de HomoloGene. Em correspondência exata, o sistema aprimorado alcançou novos resultados competitivos de teste de 37.78% micro-F1 com uma precisão de 38.22% e recall de 37.34%, o que corresponde a uma melhoria de aproximadamente três pontos micro-F1 em relação ao melhor sistema anterior. Ao combinar IDs de HomoloGene, relatamos resultados competitivos de teste semelhantes em 46.17% micro-F1 com precisão e recall de 46.67 e 45.59%, respectivamente, correspondendo a uma melhoria de mais de oito pontos micro-F1 em relação ao resultado anterior. O código para nosso sistema de aprendizado profundo está disponível publicamente em https://github.com/bionlproc/biocppiextraction.
Tran et al. (Mon,) estudaram esta questão.