Valutazione della regressione logistica
Quindi sto cercando di costruire un modello di regressione logistica su un set di dati (quaderno completo qui ).
Sto ancora cercando di capire questo set di dati, quindi ho voluto adattare una regressione logistica sull'intero set di dati e quindi valutare i residui per analizzare i campioni che il mio modello non è in grado di classificare correttamente (magari controllare se sono valori anomali o o giungere alla conclusione che un modello lineare non è appropriato e che ho bisogno di qualcosa come un albero o wtv).
Una delle cose che voglio fare è vedere come variano i residui con i predittori, quindi ho creato un grafico per i predittori continui:
e anche predittori categoriali o binari, nonché l'etichetta (Exited):
La mia idea era quella di identificare i punti con i residui più alti e cercare di capire perché sono stati così classificati (forse sono valori anomali?).
Il fatto è che non riesco a capire il valore di questi residui. Perché ho valori residui che sono maggiori di 1 o minori di 0, dato che quello che sto cercando di prevedere è una colonna binaria con zeri e uno, e com'è che ho due zone distinte nei grafici continui? Come interpreteresti questi residui (se non del tutto)?
Ad esempio, nelle trame categoriali mi è chiaro che le donne e i residenti in Germania sono più difficili da classificare (hanno caselle più alte).
Questo tipo di analisi è qualcosa che ti interessa?
Ho anche trovato questo pacchetto chiamato effetti che possono tracciare questo:
Tuttavia, finora non sono in grado di capire come vengono calcolati questi grafici degli effetti. Qualcuno qui può spiegare come sono fatti questi complotti e quali sono le maggiori conclusioni che puoi trarne?
In termini generali, qual è il tuo approccio nell'adattare un classificatore binario? Segui qualcosa del genere o lo fai in un modo completamente diverso?
Grazie!
Risposte
Perché ho valori residui maggiori di 1 o minori di 0, dato che quello che sto cercando di prevedere è una colonna binaria con zero e uno?
Sospetto che le tue previsioni siano log-odds.
Di solito si pensa a un modello di regressione logistica che fornisce una probabilità $p$, che varia tra zero e uno. In questo caso, i tuoi residui sarebbero compresi tra$-1 = 0 - 1$ e $1 = 1 - 0$.
A volte ha senso ragionare invece con le probabilità del registro $log(\frac{p}{1-p})$, e il mio sospetto è che il tuo codice abbia un bug che produce questo valore quando chiedi previsioni dal tuo modello. Questo è un problema comune in R, poiché è (o, almeno, era, è passato del tempo da quando ho usato R) il comportamento predefinito.
com'è che ho due zone distinte nelle trame continue?
Hai almeno un predittore binario che ha un effetto molto forte (sembra che abbia un nome excited). la mia ipotesi è che il comportamento di banding nei tuoi grafici residui sia causato da questa caratteristica. Se colori le tue trame residue del valore di excited, puoi provare a confermarlo.
In termini generali, qual è il tuo approccio nell'adattare un classificatore binario? Segui qualcosa del genere o lo fai in un modo completamente diverso?
Queste sono tutte cose ragionevoli da fare, ma correggerei il bug di log-odds e otterrei le tue previsioni sulla scala delle probabilità, poiché questo è ciò che è direttamente comparabile $y$ etichetta.