Key points are not available for this paper at this time.
Mit der Entwicklung der Computertechnologie gibt es einen enormen Anstieg des Datenwachstums. Wissenschaftler sind von der ständig wachsenden Menge an Daten, die in jedem Wissensgebiet verarbeitet werden müssen, überwältigt. In verschiedenen Bereichen wurde ein großes Problem bei der optimalen Nutzung dieser großflächigen Daten festgestellt, die Entscheidungsfindung unterstützen. Data Mining ist die Technik, die neue Muster aus großen Datensätzen entdecken kann. Über viele Jahre wurde es in allen möglichen Anwendungsbereichen untersucht und somit wurden viele Data-Mining-Methoden entwickelt und in der Praxis angewendet. Aber in den letzten Jahren gab es einen enormen Anstieg der Datenmenge sowie ihrer Berechnung und Analyse. In dieser Situation sind die meisten klassischen Data-Mining-Methoden in der Praxis nicht mehr in der Lage, solche großen Datenmengen zu bewältigen. Effiziente parallele/nebenläufige Algorithmen und Implementierungstechniken sind der Schlüssel, um die Skalierbarkeit und Leistungsanforderungen zu erfüllen, die mit solchen großflächigen Data-Mining-Analysen verbunden sind. Eine Reihe paralleler Algorithmen wurde implementiert, indem verschiedene Parallelisierungstechniken verwendet wurden, die wie folgt aufgelistet werden können: Threads, MPI, MapReduce und Mash-up- oder Workflow-Technologien, die unterschiedliche Leistungs- und Benutzerfreundlichkeitsmerkmale bieten. Das MPI-Modell hat sich als effizient bei der Berechnung strenger Probleme erwiesen, insbesondere in der Simulation. Aber es ist in der Praxis nicht einfach zu verwenden. MapReduce wurde aus dem Datenanalyse-Modell des Informationsretrievals entwickelt und ist eine Cloud-Technologie. Bis jetzt wurden mehrere MapReduce-Architekturen entwickelt, um mit Big Data umzugehen. Die bekannteste ist Google. Eine weitere mit solchen Eigenschaften ist Hadoop, das beliebteste Open-Source-MapReduce-Software, das von vielen großen IT-Unternehmen wie Yahoo, Facebook, eBay usw. übernommen wurde. In diesem Papier konzentrieren wir uns speziell auf Hadoop und seine Implementierung von MapReduce für analytische Prozesse.
Maitrey et al. (Donnerstag) haben diese Frage untersucht.