Dimensioni e bias del treno/test

Aug 31 2020

Sto eseguendo un classificatore (regressione logistica). Le informazioni sul mio dataset sono le seguenti:

dataset size= 279 observations 

(regola 80/20)

train size= 233
test size = 56

# of events in train = 31
# of events in test = 8

Penso che il mio classificatore e i risultati potrebbero essere influenzati a causa di questa proporzione non uguale. C'è un modo per evitare problemi di bias e migliorare la precisione? Cosa ne pensi personalmente di tali dati?

Risposte

4 BenjiAlbert Aug 31 2020 at 07:08

Se ti riferisci al fatto che il tuo set di dati è piccolo:

  • Dovresti usare la convalida incrociata k-fold . Ciò ti consentirà di valutare il tuo modello su tutte le 279 istanze

Se ti riferisci allo squilibrio di classe che è 31:202 in treno e 8:48 in test:

  • Utilizzare AUROC e PRC per eliminare la distorsione nella soglia
  • Vedi anche Centro clienti
1 Surya Aug 31 2020 at 07:07

Penso nel caso di dati così asimmetrici, in cui l'output è più numeroso di una delle classi. Il richiamo sarebbe una buona scelta di misura rispetto alla precisione. Il richiamo ci fornisce la percentuale della classe rilevante effettivamente prevista dal modello.

1 etiennedm Aug 31 2020 at 13:53

Per completare la risposta di @BenjiAlbert, in caso di set di dati sbilanciato, si consiglia inoltre di utilizzare k-fold stratificato per preservare le frequenze di classe relative in ogni piega. Puoi trovare maggiori dettagli nella sklearnguida per l'utente qui .