Cómo comparar Random Forest con otros modelos

Sep 04 2020

Soy nuevo en el aprendizaje automático y estoy tratando de comprender el error fuera de bolsa en los bosques aleatorios y su uso.

Digamos que tenemos un conjunto de datos. Primero usamos el conjunto de datos completo (sin dividirlo) para obtener un bosque aleatorio y su error Fuera de bolsa. Luego dividimos el conjunto de datos, entrenamos una red neuronal en la parte de entrenamiento y la probamos en la parte de prueba del conjunto de datos.

¿Puedo elegir entre los dos modelos comparando el error Fuera de bolsa del bosque aleatorio con el error de prueba total de la red neuronal? Tiene sentido ?

Respuestas

1 10xAI Sep 04 2020 at 00:55

Generalmente confiamos en el muestreo para validar el resultado de nuestro modelo.
Hacemos entrenamiento / prueba para probar un modelo en un conjunto de datos invisible separado.
Si estamos haciendo un ajuste de hiperparámetros, mantenemos otro conjunto como conjunto de validación para validar el resultado de nuevos hiperparámetros.

El bosque aleatorio crea cada árbol nuevo en una muestra empaquetada a partir de la muestra original (datos del tren).
El ensacado significa que el muestreo se realiza con reemplazo, es decir, usted elige un punto de datos, lo vuelve a colocar y luego elige el siguiente .

En este proceso, se muestrean muchos datos duplicados y muchos puntos de datos no se muestrean.
~ 63% de los puntos de datos están seleccionados Lea aquí
Los otros puntos de datos del 37% "no seleccionados" se denominan muestras fuera de bolsa.
Por lo tanto, la forma en que se diseñan las bolsas y la RF, obtuvimos otro conjunto de datos para hacer nuestra validación. Es una oportunidad para hacer un nivel de validación con estas muestras.

Lo que significa

  • Obtienes un 37% de puntos de datos para validar tu modelo
  • Pero OOB no termina con el Ensemble completamente desarrollado. Se hace usando todos los árboles en el conjunto de bosque aleatorio para el cual se omitió el punto de datos particular durante el entrenamiento. Leer aquí
  • No es equivalente a K-Fold o Train / test en RF completamente construido, pero da una idea decente sobre el error de validación que se avecina.