Key points are not available for this paper at this time.
A extração de Entidades Nomeadas (NE) é uma subtarefa importante do processamento de documentos, como extração de informações e resposta a perguntas. Um método típico utilizado para a extração de NE em textos japoneses é uma cascata de análise morfológica, etiquetagem de classes gramaticais (POS) e agrupamento. No entanto, existem alguns casos em que a granularidade da segmentação contradiz os resultados da análise morfológica e as unidades de construção das NEs, de modo que a extração de algumas NEs é inerentemente impossível nesse contexto. Para lidar com o problema da unidade, propomos um método de agrupamento baseado em caracteres. Primeiramente, a sentença de entrada é analisada de forma redundante por um analisador morfológico estatístico para produzir múltiplas respostas (n-melhores). Em seguida, cada caractere é anotado com seus tipos de caracteres e suas possíveis etiquetas de POS das melhores n respostas. Finalmente, um agrupador baseado em máquinas de vetor de suporte seleciona algumas partes da sentença de entrada como NEs. Este método introduz informações mais ricas para o agrupador do que os métodos anteriores que se baseiam em um único resultado de análise morfológica. Aplicamos nosso método à tarefa de extração de NE do IREX. O resultado da validação cruzada da medida F sendo 87.2 demonstra a superioridade e eficácia do método.
Asahara et al. (Qua,) estudaram esta questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: