Dimensioni e bias del treno/test
Sto eseguendo un classificatore (regressione logistica). Le informazioni sul mio dataset sono le seguenti:
dataset size= 279 observations
(regola 80/20)
train size= 233
test size = 56
# of events in train = 31
# of events in test = 8
Penso che il mio classificatore e i risultati potrebbero essere influenzati a causa di questa proporzione non uguale. C'è un modo per evitare problemi di bias e migliorare la precisione? Cosa ne pensi personalmente di tali dati?
Risposte
Se ti riferisci al fatto che il tuo set di dati è piccolo:
- Dovresti usare la convalida incrociata k-fold . Ciò ti consentirà di valutare il tuo modello su tutte le 279 istanze
Se ti riferisci allo squilibrio di classe che è 31:202 in treno e 8:48 in test:
- Utilizzare AUROC e PRC per eliminare la distorsione nella soglia
- Vedi anche Centro clienti
Penso nel caso di dati così asimmetrici, in cui l'output è più numeroso di una delle classi. Il richiamo sarebbe una buona scelta di misura rispetto alla precisione. Il richiamo ci fornisce la percentuale della classe rilevante effettivamente prevista dal modello.
Per completare la risposta di @BenjiAlbert, in caso di set di dati sbilanciato, si consiglia inoltre di utilizzare k-fold stratificato per preservare le frequenze di classe relative in ogni piega. Puoi trovare maggiori dettagli nella sklearnguida per l'utente qui .