Key points are not available for this paper at this time.
Code-Switching ist ein verbreitetes linguistisches Phänomen, bei dem mehrsprachige Personen nahtlos zwischen Sprachen wechseln. Trotz seiner weitverbreiteten Nutzung online und der aktuellen Forschungstrends in diesem Bereich stellt die Forschung zum Code-Switching einzigartige Herausforderungen dar, die hauptsächlich aus der Knappheit an beschrifteten Daten und verfügbaren Ressourcen resultieren. In dieser Studie untersuchen wir, wie vortrainierte Sprachmodelle mit code-wechselndem Text in drei Dimensionen umgehen: a) die Fähigkeit von PLMs, code-wechselnden Text zu erkennen, b) Variationen in den strukturellen Informationen, die PLMs zur Erfassung von code-wechselndem Text nutzen, und c) die Konsistenz der semantischen Informationsdarstellung in code-wechselndem Text. Um eine systematische und kontrollierte Bewertung der betreffenden Sprachmodelle durchzuführen, erstellen wir einen neuartigen Datensatz von wohlgeformtem naturalistischem code-wechselndem Text sowie parallelen Übersetzungen in die Quellsprachen. Unsere Ergebnisse zeigen, dass vortrainierte Sprachmodelle effektiv in der Verallgemeinerung auf code-wechselnden Text sind und Licht auf die Fähigkeiten dieser Modelle werfen, Darstellungen auf CS-Korpora zu verallgemeinern. Wir stellen unseren gesamten Code und Daten, einschließlich des neuartigen Korpus, unter https://github.com/francesita/code-mixed-probes zur Verfügung.
Leon et al. (2024) untersuchten diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: