Objectif Les textes du patrimoine culturel (PC) contiennent une riche connaissance qu'il est difficile d'interroger systématiquement en raison des défis de la conversion d'un discours non structuré en graphes de connaissances (KG) structurés. Cet article introduit ATR4CH (Adaptive Text-to-RDF for Cultural Heritage), une méthodologie systématique en cinq étapes pour l'extraction de connaissances basée sur des modèles de langage large (LLM) à partir de documents PC. Nous validons la méthodologie à travers une étude de cas sur les débats d'évaluation de l'authenticité. Conception/méthodologie/approche ATR4CH combine des modèles d'annotation, des cadres ontologiques et une extraction basée sur LLM via un développement itératif : analyse fondamentale, développement de schémas d'annotation, architecture de pipeline, affinage d'intégration et évaluation complète. Nous démontrons l'approche en utilisant des articles de Wikipédia sur des éléments contestés (documents, artefacts, etc.), en mettant en œuvre un pipeline séquentiel avec trois LLM (Claude Sonnet 3.7, Llama 3.3 70B et GPT-4o-mini). Résultats La méthodologie extrait avec succès des connaissances complexes sur le patrimoine culturel : 0,96–0,99 F1 pour l'extraction de métadonnées, 0,7–0,8 F1 pour la reconnaissance d'entités, 0,65–0,75 F1 pour l'extraction d'hypothèses, 0,95–0,97 pour l'extraction de preuves et 0,62 G-EVAL pour la représentation du discours. Les modèles plus petits ont performé de manière compétitive, permettant un déploiement rentable. Limitations/implications de la recherche Le KG produit est limité aux articles de Wikipédia. Bien que les résultats soient encourageants, une supervision humaine est nécessaire lors du post-traitement. Originalité/valeur Au meilleur de la connaissance des auteurs, c'est la première méthodologie systématique pour coordonner l'extraction basée sur des LLM avec les ontologies du patrimoine culturel. ATR4CH fournit un cadre reproductible adaptable à travers les domaines du PC et les ressources institutionnelles. ATR4CH permet aux institutions du PC de convertir systématiquement les connaissances textuelles en KG interrogeables, soutenant l'enrichissement automatisé des métadonnées et la découverte de connaissances.
Schimmenti et al. (Fri,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: