scikit-learnを大量に実行する
Nov 03 2020
でランダムフォレストプロセスを実行する必要がありscikit-learnます。モデルをトレーニングするために、1,000万行のフィーチャを含むデータベーステーブルがあります。問題は、これにアプローチするための最良の方法は何ですか?たとえば、numpyやpandasを使用して、1,000万行をメモリにロードする必要がありますか、それともチャンクごとにデータを段階的にロードするより良い方法がありますか?
回答
3 vienna_kaggling Nov 03 2020 at 16:26
夕暮れから他のモデルなど、複数の可能性があります。
これが私の2つのお気に入りです。可能性の数であなたを失うことはありません:
www.h5py.org/ "大量の数値データを保存し、NumPyからそのデータを簡単に操作できます。たとえば、ディスクに保存されている数テラバイトのデータセットに、実際のNumPy配列であるかのようにスライスできます。データセットは単一のファイルに保存し、必要に応じて分類およびタグ付けすることができます。」
ランダムフォレスト(light-gbm)のいとこモデルを使用してオンライン学習を試してください。彼はオンライン学習能力を持っています。