Dieser wissenschaftliche Artikel liefert eine umfassende Analyse der Generierung synthetischer (künstlich erzeugter) Daten zur Schulung von Systemen der künstlichen Intelligenz (KI) und der Perspektiven dieses Ansatzes. Moderne KI-Modelle benötigen enorme Datenmengen für das Training, aber das Sammeln realer Daten ist oft teuer, zeitaufwendig oder aufgrund von Datenschutzbedenken unmöglich. Die Forschung untermauert wissenschaftlich die Methoden zur Erstellung künstlicher Daten, die realen Daten ähneln (generative Modelle, Simulationen), sowie deren Vorteile und Einschränkungen. Der Artikel untersucht die Verwendung synthetischer Daten zur Lösung von Datenschutzproblemen, zur Beseitigung von Datenengpässen und zur Ausbalancierung von Datensätzen. Die wissenschaftliche Neuheit des Artikels liegt darin, aufzuzeigen, dass synthetische Daten ein wichtiges Werkzeug für die Entwicklung von KI werden. Aus den Analysen ergeben sich Empfehlungen zur Anwendung dieser Technologien und deren Zuverlässigkeit.
Xudoyorov et al. (Mi,) haben diese Frage untersucht.