Executando o scikit-learn com grande volume

Nov 03 2020

Preciso executar um processo Random Forest com scikit-learn. Para treinar o modelo, tenho uma tabela de banco de dados com 10 milhões de linhas de recursos. A questão é: qual é a melhor maneira de abordar isso, devo carregar na memória os 10 milhões de linhas, por exemplo com numpy ou pandas ou há uma maneira melhor de carregar os dados progressivamente por pedaços?

Respostas

3 vienna_kaggling Nov 03 2020 at 16:26

Existem várias possibilidades desde o anoitecer, até outros modelos, etc.

Aqui estão os meus 2 favoritos, para não te perder no número de possibilidades:

  1. www.h5py.org/ "Permite armazenar grandes quantidades de dados numéricos e manipular facilmente esses dados do NumPy. Por exemplo, você pode dividir em conjuntos de dados de vários terabytes armazenados no disco, como se fossem matrizes NumPy reais. Milhares de conjuntos de dados podem ser armazenados em um único arquivo, categorizados e marcados como você quiser. "

  2. Experimente o aprendizado online com os modelos de floresta aleatória do primo ( light-gbm ). Ele tem recursos de aprendizagem online.