Запуск scikit-learn с большим объемом
Мне нужно запустить процесс случайного леса с помощью scikit-learn. Для обучения модели у меня есть таблица базы данных с 10 миллионами строк функций. Возникает вопрос: как лучше всего подойти к этому, следует ли мне загружать в память 10 миллионов строк, например, с помощью numpy или pandas, или есть лучший способ загружать данные постепенно по кускам?
Ответы
Есть несколько вариантов от сумерек, до других моделей и т. Д.
Вот 2 моих любимых, чтобы не потерять вас в количестве возможностей:
www.h5py.org/ "Это позволяет вам хранить огромные объемы числовых данных и легко манипулировать этими данными из NumPy. Например, вы можете разрезать на многотерабайтные наборы данных, хранящиеся на диске, как если бы они были настоящими массивами NumPy. Тысячи наборы данных могут храниться в одном файле, сгруппированы по категориям и помечены, как вы хотите ».
Попробуйте онлайн-обучение с моделями Cousin случайного леса ( light-gbm ). У него есть возможности онлайн-обучения.