Wir beschreiben ein Programm zur Ganzgenomassemblierung namens PCAP zur Verarbeitung von Zehntausenden von Millionen von Reads. Das PCAP-Programm verfügt über mehrere Funktionen, um Effizienz- und Genauigkeitsprobleme bei der Assemblierung anzugehen. Mehrere Prozessoren werden verwendet, um die zeitaufwändigsten Berechnungen während der Assemblierung durchzuführen. Eine empfindlichere Methode wird verwendet, um Überlappungen zu vermeiden, die durch Sequenzierungsfehler verursacht werden. Wiederholte Bereiche von Reads werden auf der Grundlage vieler Überlappungen mit anderen Reads identifiziert, anstatt auf vielen kürzeren Wortübereinstimmungen mit anderen Reads. Kontaminierte Endbereiche von Reads werden identifiziert und entfernt. Die Erzeugung einer Konsenssequenz für einen Contig basiert auf einer Ausrichtung von Reads im Contig, bei der sowohl Basisqualitätswerte als auch Abdeckungsinformationen verwendet werden, um jede Konsensbasis zu bestimmen. Das PCAP-Programm wurde an einem Maus-Ganzgenom-Datensatz von 30 Millionen Reads und einem menschlichen Chromosom 20-Datensatz von 1,7 Millionen Reads getestet. Das Programm ist für akademische Zwecke kostenlos verfügbar.
Huang et al. (Mon,) haben diese Frage untersucht.