Key points are not available for this paper at this time.
De nombreuses organisations passent à un paradigme de gestion des données appelé le "Lakehouse", qui implémente la fonctionnalité des entrepôts de données structurées au-dessus des lacs de données non structurées. Cela présente de nouveaux défis pour les moteurs d'exécution de requêtes. Le moteur doit offrir de bonnes performances sur les ensembles de données brutes et non curées, qui sont omniprésents dans les lacs de données, et d'excellentes performances sur les données structurées stockées dans des formats de fichiers colonnes populaires comme Apache Parquet. Pour atteindre ces objectifs, nous présentons Photon, un moteur de requête vectorisé pour les environnements Lakehouse que nous avons développé chez Databricks. Photon peut surpasser les entrepôts existants sur des charges de travail SQL et prend également en charge l'API Apache Spark. Nous discutons des choix de conception que nous avons faits dans Photon (par exemple, vectorisation contre génération de code) et décrivons son intégration avec nos environnements d'exécution SQL et Apache Spark existants, son modèle de tâches et son gestionnaire de mémoire. Photon a permis d'accélérer certaines charges de travail clients de plus de 10x et a récemment permis à Databricks de fixer un nouveau record de performance audité pour le benchmark officiel TPC-DS de 100 To.
Behm et al. (Ven,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: