Key points are not available for this paper at this time.
Es ist bekannt, dass die Standardmethode des stochastischen Gradientenabstiegs (SGD) sowie beschleunigte und adaptive SGD-Optimierungsmethoden wie der Adam-Optimierer nicht konvergieren, wenn die Lernraten nicht gegen null konvergieren (wie beispielsweise in der Situation konstanter Lernraten). Numerische Simulationen verwenden häufig vom Menschen abgestimmte deterministische Lernratenpläne oder kleine konstante Lernraten. Die Standard-Lernratenpläne für SGD-Optimierungsmethoden in Implementierungsrahmen für maschinelles Lernen wie TensorFlow und Pytorch sind konstante Lernraten. In dieser Arbeit schlagen wir einen lernratenadaptiven Ansatz für SGD-Optimierungsmethoden vor und untersuchen ihn, bei dem die Lernrate basierend auf empirischen Schätzungen der Werte der Zielfunktion des betrachteten Optimierungsproblems (der Funktion, die minimiert werden soll) angepasst wird. Insbesondere schlagen wir eine lernratenadaptive Variante des Adam-Optimierers vor und implementieren sie bei mehreren Lernproblemen mit neuronalen Netzwerken, insbesondere im Kontext von Deep-Learning-Näherungsverfahren für partielle Differentialgleichungen wie tiefen Kolmogorov-Methoden, physikinformierte neuronale Netzwerke und tiefe Ritz-Methoden. In jedem der präsentierten Lernprobleme reduziert die vorgeschlagene, lernratenadaptive Variante des Adam-Optimierers den Wert der Zielfunktion schneller als der Adam-Optimierer mit der Standard-Lernrate. Für eine einfache Klasse quadratischer Minimierungsprobleme beweisen wir auch rigoros, dass eine lernratenadaptive Variante der SGD-Optimierungsmethode zum Minimierer des betrachteten Minimierungsproblems konvergiert. Unser Konvergenzbeweis basiert auf einer Analyse der Gesetze der invariant gemessenen SGD-Methode sowie auf einer allgemeineren Konvergenzanalese für SGD mit zufälligen, aber vorhersehbaren Lernraten, die wir in dieser Arbeit entwickeln.
Dereich et al. (Thu,) haben diese Frage untersucht.