Gradientenbasierte Optimierung

Viele Lernverfahren formulieren Lernen als Optimierungsproblem. Eine Verlustfunktion misst, wie groß der Fehler des Modells auf den Trainingsdaten ist. Der Gradient zeigt dann an, in welche Richtung sich die Parameter besonders stark verändern müssen.

Gradientenbasierte Verfahren sind besonders wichtig für neuronale Netze. In diesem Unterkapitel sollen sie daher nicht in aller Allgemeinheit sondern mit der Zielrichtung des Trainings Neuronaler Feedforward-Netze (FNNs) eingeführt werden. Es wird aber auch auf Verfahren höherer Ordnung kurz eingegangen.

Im den weiteren Abschnitten des Kapitels diskutieren wir:

  1. Formulierung des FNN-Trainings als Optimierungsproblem, Definition der beteiligten Funktionen
  2. Das Gradientenabstiegsverfahren am Beispiel eines Neurons
  3. Verfahrensüberblick und Alternativen: Warum wird gerade das Gradientenabstiegsverfahren oft eingesetzt und welche Alternativen gibt es?
  4. Gradienten-Schätzung durch Minibatches und Verbesserungen durch verschiedene Optimizer
  5. Backpropagation: Wie können Gradienten effizient mit Dynamic Programming bestimmt werden?