Uruchamianie scikit-Learn z dużą objętością

Nov 03 2020

Muszę uruchomić proces Random Forest w programie scikit-learn. Aby wytrenować model, mam tabelę bazy danych z 10 milionami wierszy funkcji. Pytanie brzmi: jak najlepiej podejść do tego, czy powinienem załadować do pamięci 10 milionów wierszy, na przykład numpy lub pandas, czy jest lepszy sposób na stopniowe ładowanie danych fragmentami?

Odpowiedzi

3 vienna_kaggling Nov 03 2020 at 16:26

Istnieje wiele możliwości od zmierzchu do innych modeli itp.

Oto moje 2 ulubione, aby nie stracić Cię w liczbie możliwości:

  1. www.h5py.org/ „Pozwala na przechowywanie ogromnych ilości danych liczbowych i łatwą manipulację tymi danymi z NumPy. Na przykład możesz podzielić na wieloterabajtowe zestawy danych przechowywane na dysku, tak jakby były prawdziwymi tablicami NumPy. Tysiące zbiory danych mogą być przechowywane w jednym pliku, kategoryzowane i oznaczane w dowolny sposób ”.

  2. Wypróbuj naukę online z modelami losowego lasu Cousin ( light-GBm ). Ma możliwości uczenia się online.