Menjalankan scikit-learn dengan volume besar
Saya perlu menjalankan proses Random Forest dengan scikit-learn. Untuk melatih model, saya memiliki tabel database dengan 10 juta baris fitur. Pertanyaannya adalah: apa cara terbaik untuk mendekati ini, haruskah saya memuat ke memori 10 juta baris, misalnya dengan numpy atau panda atau ada cara yang lebih baik untuk memuat data secara progresif dengan potongan?
Jawaban
Ada beberapa kemungkinan dari senja, model lain, dll.
Berikut adalah 2 favorit saya, agar Anda tidak kehilangan sejumlah kemungkinan:
www.h5py.org/ "Ini memungkinkan Anda menyimpan data numerik dalam jumlah besar, dan dengan mudah memanipulasi data tersebut dari NumPy. Misalnya, Anda dapat mengiris ke dalam kumpulan data multi-terabyte yang disimpan pada disk, seolah-olah itu adalah array NumPy yang sebenarnya. Ribuan kumpulan data dapat disimpan dalam satu file, dikategorikan dan diberi tag sesuka Anda. "
Coba pembelajaran online dengan model Cousin of random forest ( light-gbm ). Dia memiliki kemampuan belajar online.