Comprendre Bagging et forêts aléatoires
Moyenner des estimations indépendantes réduit la variance : la moyenne de nombreuses prédictions bruitées est plus stable que chacune d’elles. Le bagging, abréviation d’agrégation bootstrap, exploite cela sans avoir besoin de plusieurs jeux de données. Il tire des rééchantillons bootstrap répétés, chacun formé en tirant les données d’entraînement avec remise, ajuste un modèle à chacun, et moyenne les prédictions, ou prend un vote majoritaire en classification.
Le gain dépend entièrement de l’instabilité de l’apprenant de base. Moyenner de nombreux modèles quasi identiques n’apporte rien. Les arbres de décision complètement développés sont idéaux : biais faible et variance élevée, exactement le profil que le moyennage améliore, puisque la procédure supprime la variance en laissant le biais pratiquement intact.
Les forêts aléatoires s’attaquent à la faiblesse restante du bagging. Les rééchantillons bootstrap d’un même jeu de données se ressemblent : si un prédicteur est fortement dominant, presque tous les arbres divisent d’abord sur lui et les arbres finissent très corrélés. Or des erreurs corrélées ne se compensent pas. Le remède est de ne considérer qu’un sous-ensemble aléatoire de variables comme candidates à chaque division, ce qui force des arbres différents à s’appuyer sur des prédicteurs différents et abaisse leur corrélation.
L’ensemble fournit aussi une validation gratuite. Chaque rééchantillon bootstrap omet environ un tiers des observations, et chaque observation peut être prédite en n’utilisant que les arbres qui ne l’ont pas vue. Agréger ces prédictions hors-sac donne une estimation de l’erreur de test sans jeu de validation séparé. Le coût de l’approche est l’interprétabilité : un arbre unique se lit, des centaines non, et l’on recourt alors aux mesures d’importance et aux graphiques de dépendance partielle.
Exemple : Bagging et forêts aléatoires
Un arbre profond unique ajusté à un jeu de données peut atteindre 100 % d’exactitude à l’entraînement et 72 % en test, la signature classique du surapprentissage. Le bagging de 500 arbres de ce type relève typiquement l’exactitude de test de façon substantielle tout en laissant l’exactitude d’entraînement élevée, car le moyennage annule les erreurs idiosyncrasiques des arbres individuels.
Supposons qu’une variable soit bien plus prédictive que les autres. En bagging simple, presque chaque arbre divise sur elle à la racine : les arbres sont des quasi-copies et l’ensemble dépasse à peine un arbre unique. Une forêt aléatoire restreignant chaque division à un sous-ensemble aléatoire de variables force la plupart des arbres à trouver une structure alternative.
La taille de ce sous-ensemble est le principal réglage. Des sous-ensembles plus petits décorrèlent davantage mais donnent des arbres individuels plus faibles ; des sous-ensembles plus grands se rapprochent du bagging simple. Les valeurs par défaut usuelles sont la racine carrée du nombre de variables en classification et environ un tiers en régression, ajustées par validation croisée ou par l’estimation hors-sac.
Questions fréquentes
Ajouter davantage d’arbres provoque-t-il du surapprentissage ?
Non. L’erreur de test décroît puis se stabilise à mesure qu’on ajoute des arbres ; elle ne remonte pas. Le nombre d’arbres est un budget de calcul plutôt qu’un paramètre de complexité. Dans une forêt, le surapprentissage se contrôle par la profondeur des arbres et la taille du sous-ensemble de variables.
Qu’est-ce que l’estimation d’erreur hors-sac ?
Chaque rééchantillon bootstrap laisse de côté environ un tiers des observations. Prédire chaque observation à l’aide des seuls arbres qui ne l’ont pas vue à l’entraînement fournit une estimation de validation sans coût de calcul supplémentaire, ce qui rend souvent inutile une validation croisée séparée.
En quoi les forêts aléatoires diffèrent-elles du boosting ?
Les forêts aléatoires ajustent des arbres indépendants en parallèle et les moyennent, visant la variance. Le boosting ajuste des arbres séquentiellement, chacun corrigeant les erreurs de l’ensemble précédent, visant le biais. Le boosting peut atteindre une meilleure exactitude mais est plus sensible au bruit et aux hyperparamètres.
En résumé
Le bagging transforme l’instabilité des arbres profonds en avantage en moyennant sur des rééchantillons bootstrap, et les forêts aléatoires renforcent l’effet en décorrélant les arbres par des sous-ensembles aléatoires de variables. Il en résulte un choix par défaut robuste et peu exigeant, au prix de l’interprétabilité d’un arbre unique.