Treinar/teste tamanho e viés
Estou executando um classificador (regressão logística). As informações do meu conjunto de dados são as seguintes:
dataset size= 279 observations
(regra 80/20)
train size= 233
test size = 56
# of events in train = 31
# of events in test = 8
Acho que meu classificador e resultados podem ser afetados devido a essa proporção não igual. Existe alguma maneira de evitar problemas de viés e melhorar a precisão? O que você acha pessoalmente desses dados?
Respostas
Se você está se referindo ao fato de que seu conjunto de dados é pequeno:
- Você deve usar a validação cruzada k-fold . Isso permitirá que você avalie seu modelo em todas as 279 instâncias
Se você está se referindo ao desequilíbrio de classe sendo 31:202 no treino e 8:48 no teste:
- Use AUROC e PRC para eliminar o viés no limiar
- Veja também MCC
Eu acho que no caso de tais dados assimétricos, onde a saída é superada por uma das classes. Recall seria uma boa escolha de medida do que de precisão. O recall nos dá a porcentagem da classe relevante realmente prevista pelo modelo.
Para completar a resposta do @BenjiAlbert, em caso de conjunto de dados desequilibrado, também é recomendável usar k-fold estratificado para preservar as frequências de classe relativas em cada dobra. Você pode encontrar mais detalhes no sklearnguia do usuário aqui .