Aller au contenu
Kudos AI

Arbre de décision

Un modèle qui prédit en appliquant une suite de tests à seuil sur des variables isolées, divisant les données en groupes de plus en plus homogènes.

Aussi appelé : CART, Arbre de classification et de régression

Comprendre Arbre de décision

Un arbre de décision partitionne l’espace des variables en posant une question à la fois. Chaque nœud interne teste une seule variable contre un seuil, chaque branche suit une réponse, et chaque feuille émet une prédiction : la classe majoritaire en classification ou la réponse moyenne en régression. Prédire n’est qu’un cheminement de la racine à une feuille.

L’ajustement est glouton. À chaque nœud, l’algorithme examine des divisions candidates et retient celle qui améliore le plus la pureté des groupes obtenus, mesurée par le gain d’information, l’impureté de Gini ou la réduction de variance. Puis il recommence sur chaque enfant. Cette gloutonnerie compte : la division localement la meilleure n’appartient pas nécessairement au meilleur arbre global, et trouver l’arbre globalement optimal est computationnellement intraitable.

Laissée libre, la récursion se poursuit jusqu’à ce que chaque feuille soit pure, produisant un arbre qui mémorise les données d’entraînement et généralise mal. Le contrôle vient de la limitation de la profondeur, de l’exigence d’un nombre minimal d’observations par feuille, ou de la croissance complète suivie d’un élagage des branches qui ne se justifient pas sur des données mises de côté.

La limite plus profonde est l’instabilité. Comme une division proche de la racine détermine tout ce qui se trouve en dessous, un petit changement de l’échantillon d’entraînement peut sélectionner une autre division racine et produire un arbre entièrement différent. Cette variance élevée est précisément la faiblesse que les méthodes d’ensemble ont été conçues pour supprimer, en moyennant de nombreux arbres ajustés à des versions perturbées des données.

Exemple : Arbre de décision

Un arbre prédisant le défaut de remboursement pourrait d’abord tester si le revenu est inférieur à 30 000. Sur la branche des bas revenus, il pourrait ensuite tester si le ratio dette/revenu dépasse 0,4, aboutissant à une feuille prédisant le défaut. Sur la branche des hauts revenus, il testerait plutôt l’ancienneté de l’historique de crédit.

Le chemin lui-même est l’explication : « revenu inférieur à 30 000 et dette/revenu supérieur à 0,4 » est une règle qui se lit directement sur l’arbre et s’énonce à quelqu’un sans formation statistique. Très peu de familles de modèles offrent cela.

Notez que l’arbre a posé des secondes questions différentes sur chaque branche. C’est une véritable interaction : la pertinence du ratio dette/revenu dépend du niveau de revenu. Les arbres captent automatiquement de telles interactions, là où un modèle linéaire exigerait qu’elles soient spécifiées à l’avance comme termes produits explicites.

Avantages et inconvénients

Avantages

  • Directement interprétable : le chemin de décision est une règle lisible par un humain.
  • Traite ensemble variables numériques et catégorielles, sans mise à l’échelle.
  • Capte interactions et structure non linéaire sans ingénierie manuelle des variables.

Inconvénients

  • Variance élevée : de petits changements de données peuvent produire un arbre complètement différent.
  • Surapprend facilement si la profondeur n’est pas contrainte ou l’arbre élagué.
  • Un arbre unique est habituellement moins précis qu’un ensemble d’arbres.

Questions fréquentes

Quelle différence entre l’impureté de Gini et l’entropie comme critères de division ?

Toutes deux mesurent le mélange des classes en un nœud et toutes deux sont minimales pour les nœuds purs. L’entropie utilise un logarithme et Gini une somme de proportions au carré, Gini est donc légèrement moins coûteuse à calculer. En pratique, les deux produisent rarement des arbres réellement différents.

Pourquoi les arbres de décision n’ont-ils pas besoin de mise à l’échelle ?

Les divisions sont des comparaisons à un seuil sur une variable à la fois, et toute remise à l’échelle monotone laisse l’ordre inchangé, donc aussi les divisions disponibles. Cela contraste vivement avec les méthodes fondées sur des distances ou des pénalités, où l’échelle affecte directement le résultat.

Qu’est-ce que l’élagage ?

Faire croître délibérément un grand arbre puis retirer les branches qui ne méritent pas leur complexité, jugées sur des données mises de côté. Croître grand d’abord puis couper surpasse généralement l’arrêt précoce, car une division faible peut tout de même mener à une division forte en dessous d’elle.

En résumé

Un arbre de décision est une suite gloutonne de tests sur les variables, exceptionnellement facile à lire et exceptionnellement instable. Cette instabilité est précisément ce qu’exploitent les forêts aléatoires et le boosting, en moyennant de nombreux arbres pour conserver la souplesse en écartant la variance.