Запуск scikit-learn с большим объемом

Nov 03 2020

Мне нужно запустить процесс случайного леса с помощью scikit-learn. Для обучения модели у меня есть таблица базы данных с 10 миллионами строк функций. Возникает вопрос: как лучше всего подойти к этому, следует ли мне загружать в память 10 миллионов строк, например, с помощью numpy или pandas, или есть лучший способ загружать данные постепенно по кускам?

Ответы

3 vienna_kaggling Nov 03 2020 at 16:26

Есть несколько вариантов от сумерек, до других моделей и т. Д.

Вот 2 моих любимых, чтобы не потерять вас в количестве возможностей:

  1. www.h5py.org/ "Это позволяет вам хранить огромные объемы числовых данных и легко манипулировать этими данными из NumPy. Например, вы можете разрезать на многотерабайтные наборы данных, хранящиеся на диске, как если бы они были настоящими массивами NumPy. Тысячи наборы данных могут храниться в одном файле, сгруппированы по категориям и помечены, как вы хотите ».

  2. Попробуйте онлайн-обучение с моделями Cousin случайного леса ( light-gbm ). У него есть возможности онлайн-обучения.