Key points are not available for this paper at this time.
Einführung Hardware-Heterogenität wird im Bereich des Hochleistungsrechnens bestehen bleiben. Großsysteme sind derzeit mit mehreren GPU-Beschleunigern pro Rechenknoten ausgestattet und werden voraussichtlich mehr spezialisierte Hardware integrieren. Dieser Wandel im Rechenökosystem bietet viele Möglichkeiten zur Leistungsverbesserung; jedoch erhöht er auch die Komplexität der Programmierung für solche Architekturen. Methoden Diese Arbeit führt ein Laufzeitframework ein, das müheloses Programmieren für heterogene Systeme ermöglicht und gleichzeitig Hardware-Ressourcen effizient nutzt. Das Framework ist in ein verteiltes und skalierbares Laufzeitsystem integriert, um die Leistungstransferfähigkeit über heterogene Knoten hinweg zu erleichtern. Neben dem Design beschreibt dieser Artikel die Implementierung und durchgeführten Optimierungen, die bis zu 300 % Verbesserung auf einem einzelnen Gerät und lineare Skalierbarkeit auf einem Knoten mit vier GPUs erreichen. Ergebnisse Das Framework in einer verteilten Speicherumgebung bietet tragbare Abstraktionen, die eine effiziente Inter-Knoten-Kommunikation zwischen Geräten mit unterschiedlichen Fähigkeiten ermöglichen. Es liefert eine überlegene Leistung im Vergleich zu MPI+CUDA von bis zu 20 % bei großen Nachrichten, während die Overheads für kleine Nachrichten unter 10 % bleiben. Darüber hinaus zeigen die Ergebnisse unserer Leistungsevaluierung in einer verteilten Jacobi-Proxy-Anwendung, dass unsere Software minimale Overheads verursacht und eine Leistungsverbesserung von bis zu 40 % erreicht. Diskussion Dies wird durch die Optimierungen auf Bibliotheksebene und durch die Schaffung von Möglichkeiten zur Nutzung anwendungsspezifischer Optimierungen wie Überdekomposition erreicht.
Thomadakis et al. (2024) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: