ใช้ scikit-learn ที่มีปริมาณมาก

Nov 03 2020

scikit-learnฉันจำเป็นต้องใช้กระบวนการสุ่มป่าด้วย ในการฝึกโมเดลฉันมีตารางฐานข้อมูลที่มีฟีเจอร์ 10 ล้านแถว คำถามคืออะไรคือวิธีที่ดีที่สุดในการเข้าถึงสิ่งนี้ฉันควรโหลด 10 ล้านแถวในหน่วยความจำเช่นด้วยตัวเลขหรือหมีแพนด้าหรือมีวิธีที่ดีกว่าในการโหลดข้อมูลทีละชิ้น

คำตอบ

3 vienna_kaggling Nov 03 2020 at 16:26

มีความเป็นไปได้หลายอย่างตั้งแต่ค่ำจนถึงรุ่นอื่น ๆ เป็นต้น

นี่คือรายการโปรด 2 รายการของฉันเพื่อไม่ให้คุณสูญเสียความเป็นไปได้:

  1. www.h5py.org/ "ช่วยให้คุณจัดเก็บข้อมูลตัวเลขจำนวนมหาศาลและจัดการข้อมูลนั้นจาก NumPy ได้อย่างง่ายดายตัวอย่างเช่นคุณสามารถแบ่งชุดข้อมูลหลายเทราไบต์ที่จัดเก็บไว้ในดิสก์ได้ราวกับว่าเป็นอาร์เรย์ NumPy จริงหลายพัน ชุดข้อมูลสามารถจัดเก็บเป็นไฟล์เดียวจัดหมวดหมู่และติดแท็กได้ตามที่คุณต้องการ "

  2. ลองเรียนรู้ออนไลน์ด้วยแบบจำลอง Cousin ของฟอเรสต์แบบสุ่ม ( light-gbm ) เขามีความสามารถในการเรียนรู้ออนไลน์