Uruchamianie scikit-Learn z dużą objętością
Muszę uruchomić proces Random Forest w programie scikit-learn. Aby wytrenować model, mam tabelę bazy danych z 10 milionami wierszy funkcji. Pytanie brzmi: jak najlepiej podejść do tego, czy powinienem załadować do pamięci 10 milionów wierszy, na przykład numpy lub pandas, czy jest lepszy sposób na stopniowe ładowanie danych fragmentami?
Odpowiedzi
Istnieje wiele możliwości od zmierzchu do innych modeli itp.
Oto moje 2 ulubione, aby nie stracić Cię w liczbie możliwości:
www.h5py.org/ „Pozwala na przechowywanie ogromnych ilości danych liczbowych i łatwą manipulację tymi danymi z NumPy. Na przykład możesz podzielić na wieloterabajtowe zestawy danych przechowywane na dysku, tak jakby były prawdziwymi tablicami NumPy. Tysiące zbiory danych mogą być przechowywane w jednym pliku, kategoryzowane i oznaczane w dowolny sposób ”.
Wypróbuj naukę online z modelami losowego lasu Cousin ( light-GBm ). Ma możliwości uczenia się online.