Describimos un programa de ensamblaje de genomas completos llamado PCAP para procesar decenas de millones de lecturas. El programa PCAP tiene varias características para abordar problemas de eficiencia y precisión en el ensamblaje. Se utilizan múltiples procesadores para realizar la mayoría de los cálculos que consumen tiempo en el ensamblaje. Se utiliza un método más sensible para evitar la falta de superposiciones causadas por errores de secuenciación. Las regiones repetitivas de las lecturas se detectan en función de muchas superposiciones con otras lecturas, en lugar de muchas coincidencias cortas de palabras con otras lecturas. Se identifican y eliminan las regiones de extremo contaminadas de las lecturas. La generación de una secuencia de consenso para un contig se basa en un alineamiento de las lecturas en el contig, en el que se utilizan tanto los valores de calidad de base como la información de cobertura para determinar cada base de consenso. El programa PCAP fue probado en un conjunto de datos de genoma completo de ratón de 30 millones de lecturas y un conjunto de datos del cromosoma 20 humano de 1.7 millones de lecturas. El programa está disponible de forma gratuita para uso académico.
Huang et al. (Mon,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: