Key points are not available for this paper at this time.
Eine rigorose Bewertung von Systemen der künstlichen Intelligenz (KI) zur Bilderklassifizierung ist entscheidend, bevor sie in der Gesundheitsversorgung, wie beispielsweise in Screening-Programmen, eingesetzt werden, um eine effektive und sichere Einführung zu gewährleisten. Ein wichtiger Schritt im Bewertungsprozess ist die externe Validierung der diagnostischen Leistung unter Verwendung eines Testsets von Bildern. Wir haben eine schnelle Literaturübersicht über Methoden zur Entwicklung von Testsets durchgeführt, die zwischen 2012 und 2020 auf Englisch veröffentlicht wurden. Mithilfe thematischer Analyse haben wir Themen identifiziert und die Prinzipien anhand des Rahmens Bevölkerung, Intervention, Comparator oder Referenzstandard, Ergebnis und Studiendesign codiert. Eine Gruppe von Experten für Screening und KI bewertete die evidenzbasierten Prinzipien auf Vollständigkeit und gab weitere Überlegungen ab. Von den hier empfohlenen 15 Prinzipien betreffen fünf die Bevölkerung, eines die Intervention, zwei den Comparator, eines den Referenzstandard und eines sowohl den Referenzstandard als auch den Comparator. Schließlich sind vier auf das Ergebnis anwendbar und eines auf das Studiendesign. Die Prinzipien aus der Literatur waren nützlich, um Verzerrungen von KI zu adressieren; berücksichtigten jedoch nicht die spezifischen Verzerrungen des Screenings, die wir nun einbeziehen. Die hier dargelegten Prinzipien sollten zur Unterstützung der Entwicklung und Verwendung von Testsets für Studien verwendet werden, die die Genauigkeit von KI innerhalb von Screening-Programmen bewerten, um sicherzustellen, dass sie ihren Zweck erfüllen und Verzerrungen minimieren.
Chalkidou et al. (Di,) untersuchten diese Frage.