Comment comparer Random Forest avec d'autres modèles
Je suis nouveau dans le Machine Learning et j'essaie de supprimer l'erreur Out of Bag in Random Forests et son utilisation.
Disons que nous avons un ensemble de données. Tout d'abord, nous utilisons l'ensemble de données (sans le fractionner) pour obtenir une forêt aléatoire et son erreur Out of Bag. Ensuite, nous divisons l'ensemble de données, entraînons un réseau de neurones sur la partie formation et le testons sur la partie test de l'ensemble de données.
Puis-je choisir entre les deux modèles en comparant l'erreur Out of Bag de la forêt aléatoire avec l'erreur de test totale du réseau neuronal? Est-ce que ça fait du sens ?
Réponses
Nous nous appuyons généralement sur l'échantillonnage pour valider le résultat de notre modèle.
Nous faisons un train / test pour tester un modèle sur un ensemble de données invisible séparé.
Si nous effectuons un réglage d'hyperparamètres, nous conservons un autre ensemble comme ensemble de validation pour valider le résultat des nouveaux hyperparamètres.
Random forest construit chaque nouvel arbre sur un échantillon ensaché de l'échantillon d'origine (données de train).
L'ensachage signifie que l'échantillonnage est effectué avec remplacement, c'est-à-dire que vous choisissez un point de données, le remettez en place, puis le suivant .
Dans ce processus, de nombreuses données dupliquées sont échantillonnées et de nombreux points de données ne sont pas échantillonnés.
~ 63% des points de données sont sélectionnés Lire ici
Les autres points de données à 37% «non sélectionnés» sont appelés échantillons Out of Bag.
Par conséquent, la façon dont l'ensachage et la RF sont conçus, nous avons un autre ensemble de données pour effectuer notre validation. C'est l'occasion de faire un niveau de validation avec ces échantillons.
Ce que cela veut dire,
- Vous obtenez 37% de points de données pour valider votre modèle
- Mais OOB n'est pas terminé avec l'Ensemble entièrement développé. Cela se fait en utilisant tous les arbres de l'ensemble forestier aléatoire pour lesquels le point de données particulier a été omis pendant la formation Lire ici
- Ce n'est pas équivalent à K-Fold ou Train / test sur RF entièrement construit, mais cela donne une bonne idée de l'erreur de validation sur le point de se produire.