Key points are not available for this paper at this time.
Historische Sprachen stellen die NLP-Community vor einzigartige Herausforderungen, wobei eine herausragende Hürde die begrenzten Ressourcen in ihren geschlossenen Korpora sind. Diese Arbeit beschreibt unsere Einreichung zum eingeschränkten Subtask der SIGTYP 2024 Shared Task, die sich auf PoS-Tagging, morphologisches Tagging und Lemmatisierung für 13 historische Sprachen konzentriert. Für PoS- und morphologisches Tagging passen wir eine hierarchische Tokenisierungs-Methode von Sun et al. (2023) an und kombinieren sie mit den Vorteilen der DeBERTa-V3-Architektur, die es unseren Modellen ermöglicht, effizient aus jedem Zeichen in den Trainingsdaten zu lernen. Wir zeigen auch die Effektivität von charakterbasierten T5-Modellen für die Lemmatizierungsaufgabe. Unsere Modelle, die von Grund auf mit begrenzten Daten vortrainiert wurden, erreichten den ersten Platz im eingeschränkten Subtask und erreichten nahezu die Leistungsniveaus des Gewinners der uneingeschränkten Aufgabe. Unser Code ist verfügbar unter https://github.com/bowphs/SIGTYP-2024-hierarchical-transformers
Riemenschneider et al. (Thu,) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: