Key points are not available for this paper at this time.
Les organisations font face à un problème de découverte de données lorsque leurs analystes passent plus de temps à rechercher des données pertinentes qu'à les analyser. Ce problème est devenu courant dans les organisations modernes car : i) les données sont stockées dans plusieurs systèmes de stockage, des bases de données aux lacs de données, jusqu'au cloud ; ii) les data scientists n'opèrent pas dans les limites de schémas bien définis ou d'un petit nombre de sources de données - au lieu de cela, pour répondre à des questions complexes, ils doivent accéder à des données dispersées sur des milliers de sources de données. Pour résoudre ce problème, nous capturons les relations entre les ensembles de données dans un graphe de connaissances d'entreprise (EKG), ce qui aide les utilisateurs à naviguer parmi des sources disparates. La contribution de cet article est AURUM, un système pour construire, maintenir et interroger l'EKG. Pour construire l'EKG, nous introduisons un processus en deux étapes qui s'adapte à de grands ensembles de données et nécessite seulement un passage sur les données, évitant ainsi de surcharger les systèmes sources. Pour maintenir l'EKG sans relire toutes les données à chaque fois, nous introduisons une méthode de signature d'échantillonnage à faible consommation de ressources (RESS) qui fonctionne en n'utilisant qu'un petit échantillon des données. Enfin, pour interroger l'EKG, nous introduisons une collection de primitives composables, permettant ainsi aux utilisateurs de définir de nombreux types différents de requêtes de découverte. Nous décrivons notre expérience d'utilisation d'AURUM dans trois scénarios d'entreprise et effectuons une évaluation des performances de chaque composant.
Fernandez et al. (Sun,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: