Key points are not available for this paper at this time.
FUNDAMENTAÇÃO: A identificação de locais de ligação de fatores de transcrição (TFBSs) é um problema central em Bioinformática na regulação gênica. A descoberta de motivos de novo serve como uma maneira promissora de prever e compreender melhor os TFBSs para verificações biológicas. Os verdadeiros TFBSs de um motivo podem variar em suas larguras e graus de conservação dentro de um certo intervalo. Decidir uma única largura de motivo pelos modelos existentes pode ser tendencioso e enganoso. Além disso, múltiplos motivos candidatos, possivelmente sobrepostos, são desejados e necessários para a verificação biológica na prática. No entanto, as técnicas atuais proíbem TFBSs sobrepostos ou carecem de controle explícito sobre diferentes motivos. RESULTADOS: Propomos um novo modelo generalizado para lidar com as larguras dos motivos, considerando e avaliando simultaneamente uma faixa de largura de interesse, o que deve abordar melhor a incerteza da largura. Além disso, um framework de meta-convergência para algoritmos genéticos (GAs) é proposto para fornecer múltiplos motivos ótimos sobrepostos simultaneamente de maneira eficaz e flexível. Os usuários podem especificar facilmente a diferença entre os tipos de motivos esperados por meio de teste de similaridade. Incorporando o Algoritmo Genético com Filtragem Local (GALF) para busca, o novo algoritmo GALF-G (G para generalizado) é proposto com base no modelo generalizado e no framework de meta-convergência. CONCLUSÃO: O GALF-G foi testado extensivamente em mais de 970 conjuntos de dados sintéticos, reais e de referência, e geralmente é melhor do que os métodos de ponta. O modelo de faixa mostra um aumento na sensibilidade em comparação aos de largura única, enquanto fornece precisões competitivas no benchmark de E. coli. A eficácia pode ser mantida mesmo usando uma população muito pequena, exibindo uma eficiência muito competitiva. Ao descobrir múltiplos motivos sobrepostos em um conjunto de dados específico do fígado real, o GALF-G supera o MEME em até 73% nos escores F gerais. O GALF-G também ajuda a descobrir um motivo adicional que provavelmente não foi anotado no conjunto de dados.
Chan et al. (Quarta,) estudaram esta questão.