Los puntos clave no están disponibles para este artículo en este momento.
ANTECEDENTES: La información funcional genómica es valiosa para la investigación biomédica. Sin embargo, tal información frecuentemente necesita ser extraída de la literatura científica y estructurada para ser explotada por sistemas automáticos. El procesamiento de lenguaje natural se utiliza cada vez más para este propósito, aunque inherentemente implica errores. Se propone y evalúa una estrategia de posprocesamiento que selecciona las relaciones más propensas a ser correctas en la salida de SemGen, un sistema que extrae predicaciones semánticas sobre la etiología de las enfermedades genéticas. Basándonos en el número de frases intervinientes entre un argumento y su predicado, definimos una estrategia heurística para filtrar las relaciones semánticas extraídas de acuerdo con su probabilidad de ser correctas. También aplicamos esta estrategia a las relaciones identificadas con el procesamiento de coocurrencia. Finalmente, explotamos las predicaciones posprocesadas de SemGen para investigar la base genética de la enfermedad de Parkinson. RESULTADOS: El procedimiento de filtrado para aumentar la precisión se basa en la intuición de que los argumentos que ocurren cerca de su predicado son más fáciles de identificar que aquellos que están a distancia. Por ejemplo, si se filtran las relaciones gen-gene para argumentos a una distancia de 1 frase del predicado, la precisión aumenta del 41.95% (línea base) al 70.75%. Dado que este filtrado por proximidad se basa en la estructura sintáctica, aplicarlo a los resultados del procesamiento de coocurrencia es útil, pero no tan efectivo como cuando se aplica a la salida del procesamiento de lenguaje natural. En un esfuerzo por aprovechar las predicaciones de SemGen sobre la etiología de las enfermedades después de aumentar la precisión con el posprocesamiento, se derivó una lista de genes a partir de la información extraída mejorada con filtrado de posprocesamiento y se anotó automáticamente con GFINDer, una aplicación web que recupera dinámicamente información funcional y fenotípica de recursos biomoleculares estructurados. Dos de los genes en esta lista son probablemente relevantes para la enfermedad de Parkinson, pero no están asociados con esta enfermedad en varias bases de datos importantes sobre trastornos genéticos. CONCLUSIÓN: La información basada en el método de posprocesamiento por proximidad que sugerimos es de calidad suficiente para ser utilizada de manera provechosa en aplicaciones posteriores dirigidas a descubrir nuevo conocimiento biomédico. Aunque el filtrado por proximidad es solo marginalmente efectivo para mejorar la precisión de las relaciones extraídas con procesamiento de coocurrencia, es probable que beneficie a los métodos basados, incluso parcialmente, en la estructura sintáctica, independientemente de la relación.
Masseroli et al. (Jue,) estudiaron esta cuestión.