Seite 2.1: Lineare Regression
Die lineare Regression ist eine der fundamentalsten und am weitesten verbreiteten Techniken im Bereich des überwachten Lernens. Sie dient dazu, eine lineare Beziehung zwischen einer (oder mehreren) unabhängigen Variablen (auch Prädiktoren oder Features genannt, oft als bezeichnet) und einer abhängigen Variablen (Zielvariable, oft ) zu modellieren und vorherzusagen.
Das Ziel ist es, eine Gerade (oder bei mehreren Features eine Hyperebene) zu finden, die die Datenpunkte am besten beschreibt.
Die Formel (Einfache lineare Regression)
Bei nur einer unabhängigen Variable wird die Beziehung durch eine einfache Geradengleichung beschrieben:
Dabei bedeuten die Terme:
- : Der vorhergesagte (oder geschätzte) Wert der abhängigen Variable.
- : Der Wert der unabhängigen Variable.
- : Der Achsenabschnitt (Intercept). Dies ist der erwartete Wert von y, wenn x = 0 ist. Er verschiebt die Gerade nach oben oder unten.
- : Die Steigung (Slope oder Regressionskoeffizient). Sie gibt an, um wie viele Einheiten sich y im Durchschnitt ändert, wenn x um eine Einheit erhöht wird.
- : Der Fehlerterm (Residuum oder Störterm). Er repräsentiert den Anteil von y, der nicht durch die lineare Beziehung mit x erklärt werden kann (zufällige Schwankungen, Messfehler, fehlende Variablen).
Ziel der linearen Regression: Die optimalen Werte für und zu finden, sodass die Gerade möglichst "nah" an den tatsächlichen Datenpunkten liegt. Dies geschieht typischerweise durch die Methode der kleinsten Quadrate (Ordinary Least Squares, OLS), bei der die Summe der quadrierten vertikalen Abstände (Fehler ) zwischen den tatsächlichen -Werten und den von der Geraden vorhergesagten -Werten minimiert wird.
Beispiel-Visualisierung:
Stellen wir uns vor, wir haben Datenpunkte für die Größe () und das Gewicht () von Personen. Die lineare Regression würde versuchen, die "beste" Gerade durch diese Punkte zu legen, um das Gewicht basierend auf der Größe vorhersagen zu können (dargestellt mit Plotly):
Die Linie (hier in Link-Farbe) repräsentiert das Ergebnis der linearen Regression – die bestmögliche lineare Annäherung an die Beziehung zwischen Größe und Gewicht in diesen Daten. Im nächsten Abschnitt sehen wir uns an, wie wir die Güte einer solchen Regression bewerten können.
