Ejecutando scikit-learn con un gran volumen

Nov 03 2020

Necesito ejecutar un proceso de Random Forest con scikit-learn. Para entrenar el modelo, tengo una tabla de base de datos con 10 millones de filas de características. La pregunta es: ¿cuál es la mejor manera de abordar esto? ¿Debería cargar en la memoria los 10 millones de filas, por ejemplo, con numpy o pandas o hay una mejor manera de cargar los datos progresivamente por fragmentos?

Respuestas

3 vienna_kaggling Nov 03 2020 at 16:26

Hay múltiples posibilidades desde el anochecer, hasta otros modelos, etc.

Aquí están mis 2 favoritos, para no perderte en la cantidad de posibilidades:

  1. www.h5py.org/ "Le permite almacenar grandes cantidades de datos numéricos y manipular fácilmente esos datos desde NumPy. Por ejemplo, puede dividir en conjuntos de datos de varios terabytes almacenados en el disco, como si fueran matrices NumPy reales. Miles de los conjuntos de datos se pueden almacenar en un solo archivo, categorizar y etiquetar como desee ".

  2. Pruebe el aprendizaje en línea con los modelos Cousin de bosque aleatorio ( light-gbm ). Tiene capacidad de aprendizaje en línea.