Le sujet de ce mémoire porte sur l’enrichissement automatique de l’ontologie cardio- vasculaire CVDO (Cardiovascular Disease Ontology) fait à partir de textes de recom- mandations cliniques publiés par l’European Society of Cardiology (ESC). L’ontologie originale, malgré sa riche taxonomie de 853 classes, ne possédait aucune relation clinique spécifique au domaine cardiovasculaire. Pour combler cette lacune, nous proposons un pipeline hybride combinant l’architecture RAG (Retrieval Augmented Generation) avec trois LLMs (GPT-4o, DeepSeek-chat et Claude Haiku), ces trois modèles seront soumis à un mécanisme de consensus, un triplet sémantique n’est validé que si au moins deux modèles sur trois s’accordent sur son extraction. L’extraction se fait à partir de trois documents de recommandations portant sur les thèmes de l’hypertension, la fibrillation atriale et les pathologies cardiovasculaires liées au diabète de type 2. Notre pipeline a extrait 126 triplets sémantiques, ces triplets ont permis l’ajout de 93 nouvelles classes OWL, 5 object properties cliniques (hasRiskFactor, hasTreatment, hasSymptom, hasComplication, isMonitoredBy) et 126 axiomes SubClassOf. L’étape d’alignement a été divisée en trois niveaux, le premier reposant sur un matching exact, le second un matching partiel (nettoyage de suffixes ontologiques) et le dernier via la similarité cosinus via embeddings BioBERT. La consistance de l’ontologie post-enrichissement a été validée par le raisonneur HermiT qui n’a détecté aucune inconsistance. L’évaluation manuelle des triplets extraits indique une précision de 87,3%.
Salhi et al. (Fri,) studied this question.