Key points are not available for this paper at this time.
Die maschinelle Übersetzung konzentriert sich hauptsächlich auf ressourcenreiche Sprachen (HRLs), während ressourcenarme Sprachen (LRLs) wie Taiwanesisches Hokkien relativ unerforscht sind. Diese Studie zielt darauf ab, diese Lücke zu schließen, indem ein Dualübersetzungsmodell zwischen Taiwanesischem Hokkien und sowohl traditionellem Mandarin-Chinesisch als auch Englisch entwickelt wird. Wir verwenden ein vortrainiertes LLaMA2-7B-Modell, das auf traditionelles Mandarin-Chinesisch spezialisiert ist, um die orthographischen Ähnlichkeiten zwischen Taiwanesischem Hokkien Han und traditionellem Mandarin-Chinesisch zu nutzen. Unsere umfassenden Experimente umfassen Übersetzungsaufgaben zwischen verschiedenen Schriftsystemen des Taiwanesischen Hokkien sowie zwischen Taiwanesischem Hokkien und anderen HRLs. Wir stellen fest, dass die Verwendung eines begrenzten monolingualen Korpus auch die Fähigkeiten des Modells in Taiwanesischem Hokkien weiter verbessert. Wir verwenden dann unser Übersetzungsmodell, um alle Schriftsysteme des Taiwanesischen Hokkien in Hokkien Han zu standardisieren, was zu weiteren Leistungsverbesserungen führt. Darüber hinaus führen wir eine Evaluierungsmethode ein, die Rückübersetzung und GPT-4 einbezieht, um eine zuverlässige Bewertung der Übersetzungsqualität auch für LRLs sicherzustellen. Die Studie trägt dazu bei, die Ressourcenlücke für Taiwanesisches Hokkien zu verringern und untersucht empirisch die Vor- und Nachteile des Vortrainings und des Feinabstimmens basierend auf LLaMA 2.
Lu et al. (Mon,) haben diese Frage untersucht.