Como comparar Random Forest com outros modelos

Sep 04 2020

Eu sou novo no aprendizado de máquina e estou tentando entender o erro fora do saco em florestas aleatórias e seu uso.

Digamos que temos um conjunto de dados. Primeiro, usamos todo o conjunto de dados (sem dividi-lo) para obter uma Random Forest e seu erro Out of Bag. Em seguida, dividimos o conjunto de dados, treinamos uma rede neural na parte de treinamento e a testamos na parte de teste do conjunto de dados.

Posso escolher entre os dois modelos comparando o erro Out of Bag da floresta aleatória com o erro de teste total da Rede Neural? Isso faz sentido ?

Respostas

1 10xAI Sep 04 2020 at 00:55

Geralmente contamos com a amostragem para validar o resultado do nosso modelo.
Fazemos treinamento / teste para testar um modelo em um conjunto de dados invisível separado.
Se estivermos fazendo um ajuste de hiperparâmetros, mantemos outro conjunto como um conjunto de validação para validar o resultado de novos hiperparâmetros.

A floresta aleatória constrói cada nova árvore em uma amostra ensacada da amostra original (dados de trem).
Bagging significa que a amostragem é feita com substituição, ou seja, você escolhe um ponto de dados, coloca-o de volta e escolhe o próximo .

Neste processo, muitos dados duplicados são amostrados e muitos pontos de dados não são amostrados.
~ 63% dos pontos de dados são selecionados Leia aqui
Os outros pontos de dados de 37% "não selecionados" são chamados de amostras fora do saco.
Conseqüentemente, da forma como Bagging e RF são projetados, temos outro conjunto de dados para fazer nossa validação. É uma oportunidade de fazer um nível de validação com essas amostras.

O que significa,

  • Você está recebendo 37% de pontos de dados para validar seu modelo
  • Mas OOB não é feito com o Ensemble totalmente desenvolvido. É feito usando todas as árvores no conjunto de floresta aleatório para o qual o ponto de dados particular foi omitido durante o treinamento Leia aqui
  • Não é equivalente a K-Fold ou Treinar / testar em RF totalmente construído, mas dá uma ideia decente sobre o erro de validação que está por vir.