Key points are not available for this paper at this time.
La provenance des données, ou lignage des données, décrit le cycle de vie des données. Dans les flux de travail scientifiques sur les systèmes HPC, les scientifiques recherchent souvent des informations de provenance diverses (par exemple, les origines des produits de données, les schémas d'utilisation des ensembles de données). Malheureusement, les solutions de provenance existantes ne peuvent pas répondre à ces défis en raison de l'incompatibilité de leurs modèles de provenance et/ou de leurs implémentations système. Dans cet article, nous analysons quatre flux de travail scientifiques représentatifs en collaboration avec les scientifiques du domaine afin d'identifier des besoins concrets en matière de provenance. Sur la base de cette analyse de première main, nous proposons un cadre de provenance appelé PROV-IO ^+, qui comprend un modèle de provenance centré sur les E/S pour décrire précisément les données scientifiques ainsi que les opérations d'E/S et les environnements associés. De plus, nous développons un prototype de PROV-IO ^+ afin de permettre une prise en charge de bout en bout de la provenance sur de véritables systèmes HPC avec un minimum d'efforts manuels. Le cadre PROV-IO ^+ peut prendre en charge des flux de travail conteneurisés et non conteneurisés sur différentes plateformes HPC, tout en offrant la flexibilité de sélectionner différentes classes de provenance. Nos expériences sur des flux de travail réalistes montrent que PROV-IO ^+ peut répondre efficacement aux besoins de provenance des scientifiques du domaine avec des performances raisonnables (par exemple, un surcoût de suivi inférieur à 3. 5% pour la plupart des expériences). De plus, PROV-IO ^+ surpasse un système de pointe (c'est-à-dire ProvLake) dans nos expériences.
Han et al. (Thu,) ont étudié cette question.