Multiple lineare Regression im Detail

Jan 31 2023
Multiple lineare Regression, Mathematik, Kostenfunktion
Im vorherigen Artikel haben wir die Grundkonzepte der linearen Regression definiert, einschließlich einfacher linearer Regression, Kostenfunktionen, Mathematik und der Leitliniengleichung einer geraden Linie. Wenn Sie diesen Artikel übersprungen haben, finden Sie weitere Informationen unter dem folgenden Link.

Im vorherigen Artikel haben wir die Grundkonzepte der linearen Regression definiert, einschließlich einfacher linearer Regression, Kostenfunktionen, Mathematik und der Leitliniengleichung einer geraden Linie. Wenn Sie diesen Artikel übersprungen haben, finden Sie weitere Informationen unter dem folgenden Link.

Lineare Regression im Detail

In diesem Artikel konzentrieren wir uns auf eine andere Art der linearen Regression, die als multiple lineare Regression bezeichnet wird. Die multiple lineare Regression ist eine statistische Technik, die zur Modellierung der Beziehung zwischen einer Antwortvariablen und mehreren Prädiktorvariablen verwendet wird. Die Antwortvariable wird auch als abhängige Variable bezeichnet und die Prädiktorvariablen werden als unabhängige Variablen bezeichnet. Mithilfe der multiplen linearen Regression können auf der Grundlage der Prädiktorvariablen Vorhersagen über die Antwortvariable getroffen werden.

Es ist jedoch wichtig zu beachten, dass die Annahmen der Linearität und Fehlerunabhängigkeit erfüllt sein müssen, damit das Modell gültig ist. Die multiple lineare Regression ist der einfachen linearen Regression ziemlich ähnlich, abgesehen von einigen Unterschieden, die wir in diesem Artikel besprechen werden. Das Ziel der multiplen linearen Regression besteht darin, die am besten passende Linie (oder Hyperebene in mehreren Dimensionen) zu finden, die die Beziehung zwischen der Antwortvariablen und den Prädiktorvariablen beschreibt. Die Beziehung zwischen der Antwortvariablen und den Prädiktorvariablen kann als mathematische Gleichung beschrieben werden:

Mathematische Gleichung für multiple lineare Regression

Wo:

  • y ist die Antwort oder abhängige Variable,
  • x_1, x_2, …, x_n sind der Prädiktor oder die unabhängigen Variablen,
  • x_0 ist der y-Achsenabschnitt oder bekannt als Bias,
  • und w_1, w_2, …, w_n sind die Koeffizienten für jede Prädiktorvariable,
  • Der linke Term der Gleichung (yhat) stellt den Wert dar, den wir basierend auf den Eingabevariablen (Prädiktorvariablen) x vorhersagen.
Multiple lineare Regressionsgleichung unter Verwendung des Vektors

Wo:

  • w^T ist die Transponierte des Vektors der Koeffizienten w (auch als „Gewichte“ bekannt),
  • x ist der Vektor der Prädiktorvariablen,
  • b ist der y-Achsenabschnitt oder bekannt als Bias,
  • Σ bezeichnet die Summe über alle Beobachtungen,
  • und der linke Term der Gleichung (yhat) stellt den Wert dar, den wir basierend auf den Eingabevariablen (Prädiktorvariablen) x vorhersagen.

Der Prozess der multiplen linearen Regression beinhaltet das Ermitteln der Werte von w und b. Um die Werte zu finden, müssen wir die Kostenfunktion für die multiple lineare Regression definieren und beachten, dass die Bezeichnung der Kostenfunktion durch den Buchstaben E ausgedrückt wird. Die Kostenfunktion ist definiert als:

Kostenfunktion für multiple lineare Regression

Ähnlich wie bei der einfachen linearen Regression müssen wir partielle Ableitungen der Kostenfunktion durchführen, um die optimalen Werte von w und b zu finden. Um jedoch Ausdrücke zum Finden der optimalen Werte abzuleiten, wäre es für uns einfacher, die Ableitung mithilfe von Optimierungstechniken wie dem Gradientenabstieg (GD), dem stochastischen Gradientenabstieg (SGD) oder der Newton-Methode (NM) durchzuführen. Wenn Sie mehr über Optimierungstechniken erfahren möchten, lesen Sie diesen Artikel.

Die Kostenfunktion des Gradientenabstiegs für die multiple lineare Regression ist definiert als:

Kostenfunktion von GD

Wo:

  • (y — Xw — b) ist ein (nx 1) Vektor von Residuen,
  • (Ausdruck)^T bezeichnet die Transponierte eines Vektors oder einer Matrix.
Ableitung der Kostenfunktion bezüglich des Parameters w

Nach dieser Ableitung können wir einen Ausdruck zum Ermitteln der Koeffizienten ableiten.

Ausdruck zum Finden der optimalen Koeffizienten

Es ist wichtig zu beachten, dass zur Implementierung die Umkehrung der X^TX-Matrix erforderlich ist. Wenn diese nicht invertierbar ist, können Regularisierungstechniken wie Ridge oder Lasso verwendet werden, um das Problem der Nichtinvertibilität zu überwinden. Zusätzlich zur Ermittlung des optimalen Werts für die Variablen w müssen wir einen Ausdruck finden, um den optimalen Wert der Verzerrung zu ermitteln. Der übliche Bias-Wert ist jedoch 1. Um diesen Artikel zu vervollständigen, führen wir eine partielle Ableitung der Kostenfunktion nach dem Parameter b durch, um den optimalen Wert zu finden.

Ausdruck zum Finden des optimalen Bias

Wo:

  • (1) ist ein (D x 1) Vektor von Einsen,
  • D ist die Anzahl der Einsen im Vektor.

import numpy as np

X = [[1, 2, 1], [2, 4, 1], [1, 2, 1], [1, 2, 1], [1, 4, 1]]
Y = [1, 2, 3, 4, 7]

X = np.array(X)
Y = np.array(Y)

w = np.linalg.solve(np.dot(X.T, X), np.dot(X.T, Y))
Yhat = np.dot(X, w)

d1 = Y - Yhat
d2 = Y - Y.mean()
r2 = 1 - d1.dot(d1) / d2.dot(d2)

from sklearn import linear_model
import numpy as np

Y = [1, 2, 3, 4, 7]
X = [[1, 2, 1], [2, 4, 1], [1, 2, 1], [1, 2, 1], [1, 4, 1]]

X = np.array(X)
Y = np.array(Y)

regr = linear_model.LinearRegression()
regr.fit(X, Y)

regr.score(X,Y)

predictedValue = regr.predict([[4, 5, 1]])

Logistische Regression

Wenn Ihnen der Artikel gefällt, folgen Sie mir unbedingt, um meine neuen Artikel zu sehen.