Treinar/teste tamanho e viés

Aug 31 2020

Estou executando um classificador (regressão logística). As informações do meu conjunto de dados são as seguintes:

dataset size= 279 observations 

(regra 80/20)

train size= 233
test size = 56

# of events in train = 31
# of events in test = 8

Acho que meu classificador e resultados podem ser afetados devido a essa proporção não igual. Existe alguma maneira de evitar problemas de viés e melhorar a precisão? O que você acha pessoalmente desses dados?

Respostas

4 BenjiAlbert Aug 31 2020 at 07:08

Se você está se referindo ao fato de que seu conjunto de dados é pequeno:

  • Você deve usar a validação cruzada k-fold . Isso permitirá que você avalie seu modelo em todas as 279 instâncias

Se você está se referindo ao desequilíbrio de classe sendo 31:202 no treino e 8:48 no teste:

  • Use AUROC e PRC para eliminar o viés no limiar
  • Veja também MCC
1 Surya Aug 31 2020 at 07:07

Eu acho que no caso de tais dados assimétricos, onde a saída é superada por uma das classes. Recall seria uma boa escolha de medida do que de precisão. O recall nos dá a porcentagem da classe relevante realmente prevista pelo modelo.

1 etiennedm Aug 31 2020 at 13:53

Para completar a resposta do @BenjiAlbert, em caso de conjunto de dados desequilibrado, também é recomendável usar k-fold estratificado para preservar as frequências de classe relativas em cada dobra. Você pode encontrar mais detalhes no sklearnguia do usuário aqui .