Eine zunehmende Anzahl wissenschaftlicher Publikationen schlägt neuartige Ansätze zur Integration von Semantic-Web- (SW) und Machine-Learning- (ML) Technologien vor,was das manuelle Lesen und die Kuratierung zunehmend erschwert. Diese Integrationen werden häufig mithilfe von Systemmustern beschrieben, die oft in Boxologie-Notation dargestellt werden. Derzeit existiert jedoch kein automatisierter Ansatz zur Extraktion solcher Systemmuster aus wissenschaftlichen Publikationen.Diese Arbeit begegnet dieser Lücke, indem sie einen automatischen Ansatz zur Systemmusterextraktion auf Basis vortrainierter encoder-basierter Sprachmodelle – insbesondere SciBERT – vorschlägt. Neben der Extraktion von Systemmustern zielt der vorgeschlagene Ansatz auch darauf ab, die einzelnen Komponenten zu identifizieren, aus denen diese Muster bestehen.Die experimentellen Ergebnisse zeigen, dass die vorgeschlagene Methode vielversprechend für die Systemmusterextraktion ist und einen F1-Score von 0,582 erzielt. Die Extraktion einzelner Komponenten hingegen bleibt ein anspruchsvolles und offenes Problem. Diese Arbeit stellt die untersuchten Ansätze, experimentellen Ergebnisse und aufgetretenen Herausforderungen vor und liefert damit Erkenntnisse für zukünftige Forschung zurautomatisierten Wissensextraktion aus wissenschaftlicher Literatur.
Dario Jugo (Wed,) studied this question.