ใช้ scikit-learn ที่มีปริมาณมาก
scikit-learnฉันจำเป็นต้องใช้กระบวนการสุ่มป่าด้วย ในการฝึกโมเดลฉันมีตารางฐานข้อมูลที่มีฟีเจอร์ 10 ล้านแถว คำถามคืออะไรคือวิธีที่ดีที่สุดในการเข้าถึงสิ่งนี้ฉันควรโหลด 10 ล้านแถวในหน่วยความจำเช่นด้วยตัวเลขหรือหมีแพนด้าหรือมีวิธีที่ดีกว่าในการโหลดข้อมูลทีละชิ้น
คำตอบ
มีความเป็นไปได้หลายอย่างตั้งแต่ค่ำจนถึงรุ่นอื่น ๆ เป็นต้น
นี่คือรายการโปรด 2 รายการของฉันเพื่อไม่ให้คุณสูญเสียความเป็นไปได้:
www.h5py.org/ "ช่วยให้คุณจัดเก็บข้อมูลตัวเลขจำนวนมหาศาลและจัดการข้อมูลนั้นจาก NumPy ได้อย่างง่ายดายตัวอย่างเช่นคุณสามารถแบ่งชุดข้อมูลหลายเทราไบต์ที่จัดเก็บไว้ในดิสก์ได้ราวกับว่าเป็นอาร์เรย์ NumPy จริงหลายพัน ชุดข้อมูลสามารถจัดเก็บเป็นไฟล์เดียวจัดหมวดหมู่และติดแท็กได้ตามที่คุณต้องการ "
ลองเรียนรู้ออนไลน์ด้วยแบบจำลอง Cousin ของฟอเรสต์แบบสุ่ม ( light-gbm ) เขามีความสามารถในการเรียนรู้ออนไลน์