Key points are not available for this paper at this time.
Die Aufgabe der Zusammenfassung kann in zwei Methoden kategorisiert werden: extraktiv und abstraktiv. Die extraktive Zusammenfassung wählt die wichtigen Sätze aus dem Originaldokument aus, um eine Zusammenfassung zu bilden, während die abstraktive Zusammenfassung das Originaldokument interpretiert und die Zusammenfassung mit eigenen Worten generiert. Die Aufgabe, eine Zusammenfassung zu erstellen, sei sie extraktiv oder abstraktiv, wurde in der Literatur mit verschiedenen Ansätzen untersucht, einschließlich statistischer, graphenbasierter und tiefen Lernansätze. Deep Learning hat im Vergleich zu klassischen Ansätzen vielversprechende Leistungen erzielt, und mit dem Fortschritt verschiedener neuronaler Architekturen wie dem Aufmerksamkeitsnetzwerk (allgemein bekannt als der Transformer) gibt es potenzielle Verbesserungsmöglichkeiten für die Zusammenfassungsaufgabe. Die Einführung der Transformer-Architektur und ihres Encodermodells „BERT“ führte zu einer verbesserten Leistung bei nachgelagerten Aufgaben in der NLP. BERT ist eine bidirektionale Encoder-Darstellung aus einem Transformer, der als Stapel von Encodern modelliert ist. Es gibt verschiedene Größen für BERT, wie BERT-base mit 12 Encodern und BERT-large mit 24 Encodern, aber wir konzentrieren uns für die Zwecke dieser Studie auf BERT-base. Das Ziel dieses Papiers ist es, eine Studie über die Leistung von Varianten von BERT-basierten Modellen zur Textzusammenfassung durch eine Reihe von Experimenten zu erstellen und „SqueezeBERTSum“ vorzuschlagen, ein trainiertes Zusammenfassungsmodell, das mit der SqueezeBERT-Encoder-Variante feinabgestimmt wurde und konkurrenzfähige ROUGE-Werte erzielt, wobei die Leistung des BERTSum-Basismodells um 98 % beibehalten und 49 % weniger trainierbare Parameter verwendet werden.
Abdel-Salam et al. (Fri,) haben diese Frage untersucht.