DecisionTreeRegressor sous le capot de GradientBoostingClassifier

Oct 30 2020

J'inspecte les estimateurs faibles de mon modèle GradientBoostingClassifier. Ce modèle a été ajusté sur un ensemble de données de classe binaire.

J'ai remarqué que tous les estimateurs faibles sous ce classificateur d'ensemble sont des objets régresseurs d'arbre de décision. Cela me semble étrange intuitivement.

J'ai pris le premier arbre de décision de l'ensemble et je l'ai utilisé pour prédire indépendamment sur l'ensemble de mon ensemble de données. Les réponses uniques de l'ensemble de données étaient les suivantes:

array([-2.74, -1.94, -1.69, ...])

Ma question est la suivante: pourquoi et comment le classificateur de renforcement de gradient transforme-t-il les estimateurs faibles en tâches de régresseur (au lieu de tâches de classification) qui ne sont pas liées par 0 et 1? Finalement, le GradientBoostingClassifier produit une pseudo-probabilité entre 0 et 1: pourquoi l'ensemble des estimateurs faibles ne fait-il pas de même?

Réponses

OliverFoster Oct 30 2020 at 08:10

Après avoir lu plus de documentation, j'ai trouvé la section qui couvre le cas de classification. Il peut être trouvé ici . De plus, cette statquest a été très utile.

1.11.4.5.2. Classification

L'amélioration du gradient pour la classification est très similaire au cas de régression. Cependant, la somme des arbres n'est pas homogène à une prédiction: elle ne peut pas être une classe, puisque les arbres prédisent des valeurs continues.

Le mappage de la valeur à une classe ou à une probabilité dépend de la perte. Pour la déviance (ou la perte logarithmique), la probabilité qui appartient à la classe positive est modélisée comme où est la fonction sigmoïde. Pour la classification multiclasse, les arbres K (pour les classes K) sont construits à chacune des itérations. La probabilité qui appartient à la classe k est modélisée comme un softmax des valeurs.

Notez que même pour une tâche de classification, le sous-estimateur est toujours un régresseur, pas un classificateur. En effet, les sous-estimateurs sont formés pour prédire les gradients (négatifs), qui sont toujours des quantités continues.