Key points are not available for this paper at this time.
Le système de fichiers distribué Hadoop (HDFS) est conçu pour stocker des ensembles de données très volumineux de manière fiable et pour diffuser ces ensembles de données à large bande passante vers des applications utilisateurs. Dans un grand cluster, des milliers de serveurs hébergent à la fois un stockage directement connecté et exécutent des tâches d'applications utilisateurs. En distribuant le stockage et le calcul sur de nombreux serveurs, la ressource peut croître avec la demande tout en restant économique à toutes les tailles. Nous décrivons l'architecture de HDFS et rapportons notre expérience dans l'utilisation de HDFS pour gérer 25 pétaoctets de données d'entreprise chez Yahoo!.
Shvachko et al. (Sat,) ont étudié cette question.