Key points are not available for this paper at this time.
Dans cet article, nous décrivons un pipeline de traitement des données utilisé pour des corpus parlés annotés des langues ouraliennes créés dans le projet INEL (Langues autochtones de la partie nord de l'Eurasie). Avec ce pipeline de traitement, nous convertissons les données dans un format standard sans perte (ISO/TEI) pour une préservation à long terme tout en permettant simultanément une recherche puissante dans cette version des données. Pour chaque corpus, l'entrée avec laquelle nous travaillons est un ensemble de fichiers au format XML EXMARaLDA, qui contiennent des transcriptions, un alignement multimédia, une segmentation en morphèmes et d'autres types d'annotation. La première étape du traitement est la conversion des données en un certain sous-ensemble de TEI suivant la norme ISO 'Transcription de la langue parlée' à l'aide d'une transformation XSL. Le principal objectif de cette étape est d'obtenir une représentation de nos données dans un format standard, ce qui garantira son accessibilité à long terme. La deuxième étape est la conversion des fichiers ISO/TEI en un format JSON utilisé par la plateforme de recherche "Tsakorpus". Cette étape nous permet de rendre les corpus disponibles via une interface de recherche basée sur le web. De plus, l'existence d'un tel convertisseur permet à d'autres corpus parlés avec annotation ISO/TEI d'être rendus accessibles en ligne à l'avenir.
Arkhangelskiy et al. (Mar,) ont étudié cette question.