Key points are not available for this paper at this time.
Multi-Query-Attention (MQA), die nur einen einzelnen Schlüssel-Wert-Kopf verwendet, beschleunigt die Dekodierer-Inferenz drastisch. MQA kann jedoch zu Qualitätsverlusten führen, und außerdem kann es unerwünscht sein, ein separates Modell nur für eine schnellere Inferenz zu trainieren. Wir (1) schlagen ein Rezept vor, um bestehende Multi-Head-Sprachmodell-Checkpts in Modelle mit MQA unter Verwendung von 5 % der ursprünglichen Vortraining-Rechenressourcen zu uptrainieren und (2) führen die Grouped-Query-Attention (GQA) ein, eine Verallgemeinerung der Multi-Query-Attention, die eine intermediäre Anzahl von Schlüssel-Wert-Köpfen (mehr als einen, weniger als die Anzahl der Abfrageköpfe) verwendet. Wir zeigen, dass uptrainierte GQA eine Qualität erreicht, die der Multi-Head-Attention nahekommt, mit vergleichbarer Geschwindigkeit zu MQA.
Ainslie et al. (Sun,) untersuchten diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: