Avaliando Regressão Logística
Portanto, estou tentando construir um modelo de regressão logística em um conjunto de dados (caderno completo aqui ).
Ainda estou descobrindo esse conjunto de dados, então queria ajustar uma regressão logística em todo o conjunto de dados e, em seguida, avaliar os resíduos para analisar as amostras que meu modelo não é capaz de classificar corretamente (talvez verifique se são outliers ou ou chegar à conclusão de que um modelo linear não é apropriado e que preciso de algo como uma árvore ou wtv).
Uma das coisas que quero fazer é ver como os resíduos variam com os preditores, então fiz um gráfico para os preditores contínuos:
e também preditores categóricos ou binários, bem como o rótulo (Exited):
Minha ideia era identificar os pontos com os maiores residuais e tentar entender por que eles estão sendo tão classificados (talvez sejam outliers?).
A questão é que não consigo entender o valor desses resíduos. Por que tenho valores residuais maiores que 1 ou menores que 0, dado que o que estou tentando prever é uma coluna binária com zeros e uns, e como é que tenho duas zonas distintas nos gráficos contínuos? Como você interpretaria esses resíduos (se houver)?
Por exemplo, nos gráficos categóricos, fica claro para mim que as mulheres e os residentes na Alemanha são mais difíceis de classificar (eles têm caixas mais altas).
Esse tipo de análise é algo seu?
Eu também encontrei este pacote chamado efeitos que podem traçar isso:
No entanto, até agora não consigo entender como esses gráficos de efeitos são calculados. Alguém aqui pode explicar como esses enredos são feitos e quais as maiores conclusões que você pode tirar deles?
Em termos gerais, como é a sua abordagem ao ajustar um classificador binário? Você segue algo assim ou o faz de uma maneira totalmente diferente?
Obrigado!
Respostas
Por que tenho valores residuais maiores que 1 ou menores que 0, visto que o que estou tentando prever é uma coluna binária com zeros e uns?
Eu suspeito que suas previsões são probabilidades logísticas.
Normalmente, você pensa em um modelo de regressão logística como a saída de uma probabilidade $p$, que varia entre zero e um. Neste caso, seus resíduos variariam entre$-1 = 0 - 1$ e $1 = 1 - 0$.
Às vezes, faz sentido, em vez disso, raciocinar com as probabilidades de log $log(\frac{p}{1-p})$, e minha suspeita é que seu código tem um bug que está produzindo esse valor quando você pede previsões do seu modelo. Este é um problema comum em R, pois é (ou, pelo menos, era, já faz algum tempo que não usei R) o comportamento padrão.
como é que eu tenho duas zonas distintas nas parcelas contínuas?
Você tem pelo menos um preditor binário que tem um efeito muito forte (parece que tem um nome excited). meu palpite é que o comportamento de bandas em seus gráficos residuais é causado por esse recurso. Se você colorir seus gráficos residuais pelo valor de excited, você pode tentar confirmar isso.
Em termos gerais, como é a sua abordagem ao ajustar um classificador binário? Você segue algo assim ou o faz de uma maneira totalmente diferente?
Todas essas são coisas razoáveis a se fazer, mas eu consertaria o bug das probabilidades de log e obteria suas previsões na escala de probabilidade, uma vez que isso é o que é diretamente comparável ao seu $y$ rótulo.