Bewertung der logistischen Regression

Aug 30 2020

Ich versuche also, ein logistisches Regressionsmodell auf einem Datensatz aufzubauen (vollständiges Notizbuch hier ).

Ich finde diesen Datensatz immer noch heraus, daher wollte ich eine logistische Regression auf den gesamten Datensatz anwenden und dann die Residuen auswerten, um die Stichproben zu analysieren, die mein Modell nicht richtig klassifizieren kann (möglicherweise prüfen, ob es sich um Ausreißer handelt oder nicht oder zu dem Schluss kommen, dass ein lineares Modell nicht geeignet ist und ich so etwas wie einen Baum oder wtv brauche).

Eines der Dinge, die ich tun möchte, ist zu sehen, wie sich die Residuen mit den Prädiktoren unterscheiden. Deshalb habe ich ein Diagramm für die kontinuierlichen Prädiktoren erstellt:

und auch kategoriale oder binäre Prädiktoren sowie das Label (Exited):

Meine Idee war es, die Punkte mit den höchsten Residuen zu identifizieren und zu verstehen, warum sie so klassifiziert werden (Vielleicht sind sie Ausreißer?).

Die Sache ist, ich kann den Wert dieser Residuen nicht verstehen. Warum habe ich Residuenwerte, die größer als 1 oder kleiner als 0 sind, da ich eine Binärspalte mit Nullen und Einsen vorhersagen möchte, und wie kommt es, dass ich in den fortlaufenden Darstellungen zwei unterschiedliche Zonen habe? Wie würden Sie diese Residuen (wenn überhaupt) interpretieren?

Zum Beispiel macht es mir in den kategorialen Darstellungen klar, dass Frauen und Einwohner in Deutschland schwieriger zu klassifizieren sind (sie haben höhere Kästchen).

Ist diese Art von Analyse etwas, das Sie?

Ich habe auch dieses Paket namens Effekte gefunden, das dies darstellen kann:

Bisher kann ich jedoch nicht verstehen, wie diese Effektdiagramme berechnet werden. Kann hier jemand erklären, wie solche Handlungen gemacht werden und was die größten Schlussfolgerungen sind, die Sie daraus ziehen können?

Wie ist Ihr Ansatz bei der Anpassung eines binären Klassifikators im Allgemeinen? Folgen Sie so etwas oder machen Sie es auf eine ganz andere Art und Weise?

Vielen Dank!

Antworten

3 MatthewDrury Aug 29 2020 at 23:35

Warum habe ich Residuenwerte, die größer als 1 oder kleiner als 0 sind, da ich eine Binärspalte mit Nullen und Einsen vorhersagen möchte?

Ich vermute, dass Ihre Vorhersagen logarithmische Gewinnchancen sind.

Normalerweise stellen Sie sich ein logistisches Regressionsmodell als Ausgabe einer Wahrscheinlichkeit vor $p$, die zwischen null und eins liegt. In diesem Fall würden Ihre Residuen zwischen liegen$-1 = 0 - 1$ und $1 = 1 - 0$.

Manchmal ist es sinnvoll, stattdessen mit den Log-Quoten zu argumentieren $log(\frac{p}{1-p})$und mein Verdacht ist, dass Ihr Code einen Fehler aufweist, der diesen Wert erzeugt, wenn Sie nach Vorhersagen von Ihrem Modell fragen. Dies ist ein häufiges Problem in R, da es das Standardverhalten ist (oder zumindest schon einige Zeit her ist, seit ich R verwendet habe).

Wie kommt es, dass ich zwei unterschiedliche Zonen in den fortlaufenden Darstellungen habe?

Sie haben mindestens einen binären Prädiktor, der einen sehr starken Effekt hat (sieht so aus, als ob er benannt ist excited). Ich vermute, dass das Streifenverhalten in Ihren Restplots durch diese Funktion verursacht wird. Wenn Sie Ihre Restdiagramme mit dem Wert von färben excited, können Sie versuchen, dies zu bestätigen.

Wie ist Ihr Ansatz bei der Anpassung eines binären Klassifikators im Allgemeinen? Folgen Sie so etwas oder machen Sie es auf eine ganz andere Art und Weise?

Dies sind alles vernünftige Dinge, die zu tun sind, aber ich würde den Log-Odds-Fehler beheben und Ihre Vorhersagen auf der Wahrscheinlichkeitsskala abrufen, da dies direkt mit Ihrer vergleichbar ist $y$ Etikette.