Sur-ajustement dans les modèles agrégés: boosting versus simple ensachage

Sep 10 2020

Corrigeons une configuration d'ensachage, dans laquelle plusieurs modèles sont construits indépendamment et en quelque sorte agrégés. Il est intuitif que l'augmentation du nombre d'apprenants faibles (N) n'entraîne pas de surajustement (dans le sens où les propriétés de surajustement n'aggravent pas l'ajout d'un nombre arbitraire d'arbres). Ceci est également discuté ici pour la forêt aléatoire:

https://datascience.stackexchange.com/questions/1028/do-random-forest-overfit

Je me demandais si la situation était tout à fait inverse lorsque nous agrégons par relance. Dans l'algorithme AdaBoost, par exemplehttps://en.wikipedia.org/wiki/AdaBoost, les paramètres du prochain apprenant faible sont choisis de manière à améliorer la prédiction de l'étape précédente. Cela signifie-t-il qu'avec suffisamment d'apprenants faibles, on pourrait (sur) s'intégrer parfaitement à l'ensemble de données de formation et, a fortiori, provoquer une mauvaise généralisation?

La question se réfère au comportement asymtptotique (théorique) pour un grand N (le nombre d'apprenants faibles).

Réponses

1 Tylerr Sep 10 2020 at 20:02

Oui, si vous lui permettez d'apprendre parfaitement du modèle précédent. Mais, par exemple avec le renforcement de gradient, nous utilisons une régularisation LOURDE telle qu'un taux d'apprentissage et des procédures de sous-échantillonnage. Pour quelque chose comme les arbres, la profondeur de chaque arbre est généralement assez peu profonde (du moins auparavant, nous sommes maintenant en mesure de construire des arbres plus grands grâce à d'autres avancées de régularisation), il s'agit donc toujours d'un modèle de biais assez élevé. Nous essayons donc d'ajouter un biais à chaque apprenant faible afin que la prochaine itération n'ajoute pas trop de valeur à notre ensemble. Il est également courant d'arrêter d'itérer lorsque votre train / ensemble de test commence à montrer des signes de surajustement.

Même avec cela, nous pouvons utiliser des paramètres qui se surajustent mal, tout comme avec une forêt aléatoire ou un arbre ensaché.