Executando o scikit-learn com grande volume
Preciso executar um processo Random Forest com scikit-learn. Para treinar o modelo, tenho uma tabela de banco de dados com 10 milhões de linhas de recursos. A questão é: qual é a melhor maneira de abordar isso, devo carregar na memória os 10 milhões de linhas, por exemplo com numpy ou pandas ou há uma maneira melhor de carregar os dados progressivamente por pedaços?
Respostas
Existem várias possibilidades desde o anoitecer, até outros modelos, etc.
Aqui estão os meus 2 favoritos, para não te perder no número de possibilidades:
www.h5py.org/ "Permite armazenar grandes quantidades de dados numéricos e manipular facilmente esses dados do NumPy. Por exemplo, você pode dividir em conjuntos de dados de vários terabytes armazenados no disco, como se fossem matrizes NumPy reais. Milhares de conjuntos de dados podem ser armazenados em um único arquivo, categorizados e marcados como você quiser. "
Experimente o aprendizado online com os modelos de floresta aleatória do primo ( light-gbm ). Ele tem recursos de aprendizagem online.