AmaçBu çalışmanın amacı, İmplant Hastalıkları için Risk Değerlendirme Sistemi (IDRA) ile yapay zeka tabanlı dil modellerinin, bireyleri düşük, orta ve yüksek peri-implant hastalık riski kategorilerine sınıflandırmadaki uyum düzeyini değerlendirmektir.Gereç ve YöntemlerBu kesitsel karşılaştırmalı çalışmada, literatüre dayalı olarak farklı klinik durumları temsil edecek şekilde oluşturulan toplam 500 standartlaştırılmış implant vaka senaryosu analiz edilmiştir. Her bir senaryo; yaş, mevcut diş ve implant sayısı, sondalama derinliği, sondalamada kanama, kemik kaybı, periodontitis öyküsü ve destekleyici periodontal tedaviye uyum gibi klinik parametreleri içermektedir. Tüm vakalar, standart bir veri giriş formatı kullanılarak IDRA, ChatGPT ve DeepSeek platformlarında değerlendirmeye tabi tutulmuştur. Elde edilen risk sınıflandırmaları düşük, orta ve yüksek olarak kaydedilmiştir. Sistemler arasındaki uyum, lineer ağırlıklı Cohen’s kappa (κw) istatistiği ile değerlendirilmiştir.BulgularIDRA, vakaların %95.8’ini yüksek risk olarak sınıflandırırken, ChatGPT ve DeepSeek daha heterojen bir dağılım sergilemiştir (sırasıyla %72.4 ve %88.6 yüksek risk). ChatGPT ile DeepSeek arasındaki uyum orta düzeyde bulunmuştur (κw = 0.442). IDRA ile DeepSeek arasında daha yüksek düzeyde uyum saptanırken (κw = 0.532), en düşük uyum IDRA ile ChatGPT arasında gözlenmiştir (κw = 0.258).SonuçYapay zeka tabanlı dil modelleri ile yapılandırılmış peri-implant risk değerlendirme sistemleri arasında değişken düzeylerde uyum bulunmaktadır. Sınıflandırma eğilimlerindeki farklılıklar ve kategori dağılımlarındaki dengesizlikler, uyum sonuçlarını etkileyebilmektedir. Bu bulgular, sınıflandırma dağılımındaki farklılıkları yansıtmakta olup, tanısal doğruluk veya klinik geçerliliği göstermemektedir. Klinik uygulamaya yönelik çıkarımlar yapılmadan önce gerçek hasta verileri ile ileri doğrulama çalışmalarına ihtiyaç vardır.
Canpolat et al. (Wed,) studied this question.