scikit-learnを大量に実行する

Nov 03 2020

でランダムフォレストプロセスを実行する必要がありscikit-learnます。モデルをトレーニングするために、1,000万行のフィーチャを含むデータベーステーブルがあります。問題は、これにアプローチするための最良の方法は何ですか?たとえば、numpyやpandasを使用して、1,000万行をメモリにロードする必要がありますか、それともチャンクごとにデータを段階的にロードするより良い方法がありますか?

回答

3 vienna_kaggling Nov 03 2020 at 16:26

夕暮れから他のモデルなど、複数の可能性があります。

これが私の2つのお気に入りです。可能性の数であなたを失うことはありません:

  1. www.h5py.org/ "大量の数値データを保存し、NumPyからそのデータを簡単に操作できます。たとえば、ディスクに保存されている数テラバイトのデータセットに、実際のNumPy配列であるかのようにスライスできます。データセットは単一のファイルに保存し、必要に応じて分類およびタグ付けすることができます。」

  2. ランダムフォレスト(light-gbm)のいとこモデルを使用してオンライン学習を試してください。彼はオンライン学習能力を持っています。