Key points are not available for this paper at this time.
Reinforcement Learning (RL) hat vielversprechende Ergebnisse für Echtzeitkontrollsysteme gezeigt, einschließlich des Bereichs der plasma-magnetischen Kontrolle. Es gibt jedoch nach wie vor erhebliche Nachteile im Vergleich zu traditionellen Feedback-Kontrollansätzen für die magnetische Einschluss. In dieser Arbeit gehen wir auf die Hauptnachteile der RL-Methode ein; wir erreichen eine höhere Kontrollgenauigkeit für die gewünschten Plasmaeigenschaften, reduzieren den stationären Fehler und verringern die benötigte Zeit, um neue Aufgaben zu lernen. Wir bauen auf Degrave et al. (2022) auf und präsentieren algorithmische Verbesserungen der Agentenarchitektur und des Trainingsverfahrens. Wir präsentieren Simulationsergebnisse, die eine Verbesserung der Formgenauigkeit um bis zu 65 % zeigen, erzielen eine erhebliche Reduktion der langfristigen Verzerrung des Plasmastroms und reduzieren zudem die erforderliche Trainingszeit zum Lernen neuer Aufgaben um das Drei- oder Mehrfache. Wir präsentieren neue Experimente mit den verbesserten RL-basierten Controllern am TCV-Tokamak, die die erzielten Simulationsergebnisse validieren und den Weg zur routinemäßigen Erreichung genauer Entladungen mit dem RL-Ansatz weisen.
Tracey et al. (Tue,) haben diese Frage untersucht.