So vergleichen Sie Random Forest mit anderen Modellen

Sep 04 2020

Ich bin neu im maschinellen Lernen und versuche, den Out-of-Bag-Fehler in zufälligen Wäldern und seine Verwendung zu verstehen.

Nehmen wir an, wir haben einen Datensatz. Zuerst verwenden wir den gesamten Datensatz (ohne ihn zu teilen), um einen zufälligen Wald und seinen Out-of-Bag-Fehler zu erhalten. Dann teilen wir den Datensatz auf, trainieren ein neuronales Netzwerk im Trainingsteil und testen es im Testteil des Datensatzes.

Kann ich zwischen den beiden Modellen wählen, indem ich den Out-of-Bag-Fehler der zufälligen Gesamtstruktur mit dem Gesamttestfehler des neuronalen Netzwerks vergleiche? Macht das Sinn ?

Antworten

1 10xAI Sep 04 2020 at 00:55

Wir verlassen uns im Allgemeinen auf Stichproben, um das Ergebnis unseres Modells zu validieren.
Wir machen Zug / Test, um ein Modell auf einem separaten unsichtbaren Datensatz zu testen.
Wenn wir eine Hyperparameter-Optimierung durchführen, behalten wir einen anderen Satz als Validierungssatz bei, um das Ergebnis neuer Hyperparameter zu validieren.

Zufällige Gesamtstruktur erstellt jeden neuen Baum auf einer Bagged-Stichprobe aus der Originalstichprobe (Zugdaten).
Absacken bedeutet, dass die Probenahme durch Ersetzen erfolgt, dh Sie wählen einen Datenpunkt aus, legen ihn zurück und wählen dann den nächsten aus .

In diesem Prozess werden viele doppelte Daten abgetastet und viele Datenpunkte werden nicht abgetastet.
~ 63% der Datenpunkte sind ausgewählt Lesen Sie hier
Die anderen "nicht ausgewählten" 37% -Datenpunkte werden als Out-of-Bag-Proben bezeichnet.
Aufgrund der Art und Weise, wie Bagging und RF entworfen wurden, haben wir einen weiteren Datensatz für unsere Validierung erhalten. Es ist eine Gelegenheit, mit diesen Proben eine Validierungsstufe durchzuführen.

Was es bedeutet,

  • Sie erhalten 37% Datenpunkte, um Ihr Modell zu validieren
  • Aber OOB ist nicht mit dem ausgewachsenen Ensemble fertig. Es werden alle Bäume im zufälligen Waldensemble verwendet, für die der bestimmte Datenpunkt während des Trainings weggelassen wurde. Lesen Sie hier
  • Es ist nicht gleichbedeutend mit K-Fold oder Train / Test auf vollständig gebautem RF, aber es gibt eine anständige Vorstellung über den bevorstehenden Validierungsfehler.