Esecuzione di scikit-learn con grande volume

Nov 03 2020

Devo eseguire un processo Random Forest con scikit-learn. Per addestrare il modello, ho una tabella di database con 10 milioni di righe di funzioni. La domanda è: qual è il modo migliore per affrontare questo problema, devo caricare in memoria i 10 milioni di righe, ad esempio con numpy o panda o c'è un modo migliore per caricare i dati progressivamente a blocchi?

Risposte

3 vienna_kaggling Nov 03 2020 at 16:26

Ci sono molteplici possibilità dal crepuscolo, ad altri modelli ecc.

Ecco i miei 2 preferiti, per non perderti nel numero di possibilità:

  1. www.h5py.org/ "Ti consente di memorizzare enormi quantità di dati numerici e di manipolare facilmente tali dati da NumPy. Ad esempio, puoi suddividere in set di dati di più terabyte memorizzati su disco, come se fossero veri array NumPy. Migliaia di i set di dati possono essere archiviati in un unico file, classificati e contrassegnati come preferisci. "

  2. Prova l'apprendimento online con i modelli Cousin di foresta casuale ( light-gbm ). Ha capacità di apprendimento online.