วิธีเปรียบเทียบ Random Forest กับรุ่นอื่น ๆ

Sep 04 2020

ฉันยังใหม่กับ Machine Learning และฉันกำลังพยายามที่จะไม่เข้าใจข้อผิดพลาด Out of Bag ใน Random Forests และการใช้งาน

สมมติว่าเรามีชุดข้อมูล อันดับแรกเราใช้ชุดข้อมูลทั้งหมด (โดยไม่แยก) เพื่อรับ Random Forest และข้อผิดพลาด Out of Bag จากนั้นเราแยกชุดข้อมูลฝึก Neural Network ในส่วนการฝึกอบรมและทดสอบในส่วนทดสอบของชุดข้อมูล

ฉันสามารถเลือกระหว่างสองรุ่นโดยเปรียบเทียบข้อผิดพลาด Out of Bag ของฟอเรสต์แบบสุ่มกับข้อผิดพลาดในการทดสอบทั้งหมดของ Neural Network ได้หรือไม่ มันเข้าท่าไหม?

คำตอบ

1 10xAI Sep 04 2020 at 00:55

โดยทั่วไปเราอาศัยการสุ่มตัวอย่างเพื่อตรวจสอบผลลัพธ์ของแบบจำลองของเรา
เราทำการฝึกอบรม / ทดสอบเพื่อทดสอบแบบจำลองบนชุดข้อมูลที่มองไม่เห็นแยกต่างหาก
หากเราทำการปรับแต่งไฮเปอร์พารามิเตอร์เราจะเก็บชุดอื่นไว้เป็นชุดการตรวจสอบความถูกต้องเพื่อตรวจสอบผลลัพธ์ของไฮเปอร์พารามิเตอร์ใหม่

สุ่มฟอเรสต์สร้างต้นไม้ใหม่แต่ละต้นบนตัวอย่างถุงจากตัวอย่างเดิม (ข้อมูลรถไฟ)
ห่อวิธีการสุ่มตัวอย่างจะทำด้วยการเปลี่ยนเช่นคุณเลือกจุดข้อมูลหนึ่งนำมันกลับมาแล้วรับต่อไปในกระบวนการนี้ข้อมูลที่ซ้ำกันจำนวนมากจะถูกสุ่มตัวอย่างและจุดข้อมูลจำนวนมากจะไม่ถูกสุ่มตัวอย่าง~ 63% ของจุดข้อมูลถูกเลือกอ่านที่นี่จุดข้อมูลอื่น ๆ ที่ "ไม่ได้เลือก" 37% เรียกว่าตัวอย่าง Out of Bag




ดังนั้นวิธีการออกแบบ Bagging และ RF เราจึงมีข้อมูลอีกชุดหนึ่งเพื่อทำการตรวจสอบความถูกต้องของเรา เป็นโอกาสในการตรวจสอบความถูกต้องกับตัวอย่างเหล่านี้

ความหมาย,

  • คุณได้รับคะแนนข้อมูล 37% เพื่อตรวจสอบโมเดลของคุณ
  • แต่ OOB ไม่ได้ทำกับ Ensemble ที่เติบโตเต็มที่ ทำได้โดยใช้ต้นไม้ทั้งหมดในชุดสุ่มฟอเรสต์ซึ่งจุดข้อมูลเฉพาะถูกละเว้นในระหว่างการฝึก อ่านที่นี่
  • ไม่เทียบเท่ากับ K-Fold หรือ Train / test บน RF ที่สร้างขึ้นอย่างสมบูรณ์ แต่ให้แนวคิดที่ดีเกี่ยวกับข้อผิดพลาดในการตรวจสอบที่กำลังจะมา