Diese Arbeit dokumentiert die erfolgreiche Hybridisierung zweier einsprachiger Sprachmodelle ohne Neutrainierung. Jedes Modell wurde in einer anderen einzelnen Sprache trainiert. Die Methode verwendet Zero-Padding-Erweiterung für 2D-Tensoren und Wiederholung für 1D-Tensoren. Der RAM ist auf 4GB begrenzt. Die Tokenizer-Formate unterscheiden sich (tokenizer.json vs vocab.json) und erfordern eine manuelle Anpassung vor der Hybridisierung. Die Ergebnisse bestätigen, dass beide Originalsprachen erhalten bleiben, kein einzelnes Modell dominiert und auftretende cross-linguale Fähigkeiten beobachtet werden. Das hybride Modell kann durch weitere Hybridisierungen weiterentwickelt werden. Code ist auf GitHub verfügbar: https://github.com/mouad-tarif/Monolingual-Hybridization
Mouad Tarif (2026) untersuchte diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: