Aller au contenu
Kudos AI

Régularisation

Toute technique qui contraint la complexité effective d’un modèle afin de réduire la variance et d’améliorer la généralisation, typiquement en pénalisant les grandes valeurs de paramètres.

Aussi appelé : Régression ridge, Lasso, Décroissance des poids

La ridge tendant asymptotiquement vers zéro tandis que le lasso le franchit et y reste, et le même fait dessiné : un disque sans coins face à un losange qui en a.

Comprendre Régularisation

Ajuster un modèle en minimisant la seule erreur d’entraînement lui donne toutes les raisons de se contorsionner vers l’échantillon d’entraînement. La régularisation change l’objectif : au lieu de minimiser l’erreur seule, le modèle minimise l’erreur plus une pénalité qui croît avec la taille de ses paramètres. Les ajustements grands et alambiqués doivent désormais se justifier face à ce coût, et le modèle se contente d’un ajustement plus simple à moins que les données n’en soutiennent vraiment davantage.

Les deux pénalités classiques se comportent différemment. La pénalité L2, somme des coefficients au carré, donne la régression ridge. Son gradient est proportionnel au coefficient lui-même, elle rétrécit donc chaque coefficient de façon lisse vers zéro sans jamais l’atteindre ; les prédicteurs corrélés tendent à se partager l’influence. La pénalité L1, somme des valeurs absolues, donne le lasso. Son gradient a une amplitude constante, ce qui suffit à conduire des coefficients exactement à zéro : le modèle ajusté réalise une sélection de variables et produit un résultat parcimonieux, plus interprétable.

Les deux sont des expressions du compromis biais-variance. Rétrécir les coefficients loin de leurs valeurs des moindres carrés introduit du biais, puisque le modèle ajusté n’est plus le meilleur ajustement possible aux données d’entraînement. En échange, l’ajustement devient bien moins sensible aux observations qui ont été échantillonnées. Quand les prédicteurs sont nombreux ou colinéaires, cet échange est généralement très favorable.

L’idée se généralise bien au-delà des modèles linéaires. Dans les réseaux de neurones, la même pénalité L2 apparaît sous le nom de décroissance des poids, et d’autres dispositifs - dropout, arrêt précoce, augmentation de données - agissent comme régularisateurs sans ajouter de terme de pénalité explicite. Tous limitent la précision avec laquelle le modèle peut épouser son échantillon d’entraînement.

Comment calculer

minimize L(θ) + λ · P(θ), where P(θ) = Σⱼ θⱼ² (L2) or Σⱼ |θⱼ| (L1)

où

L(θ)
la perte ordinaire mesurée sur les données d’entraînement
P(θ)
la pénalité sur l’amplitude des paramètres
λ
la force de régularisation, qui contrôle le compromis

Exemple : Régularisation

Considérez une régression à nombreux prédicteurs, dont plusieurs fortement corrélés. Les moindres carrés ordinaires peuvent produire de grands coefficients de signes opposés qui s’annulent : l’ajustement est bon sur les données d’entraînement mais follement instable, puisqu’un échantillon légèrement différent donnerait des coefficients très différents.

Appliquer une pénalité L2 supprime ce comportement. De grands coefficients opposés coûtent cher, l’ajustement répartit donc l’influence plus uniformément entre les prédicteurs corrélés et les coefficients deviennent bien plus stables d’un échantillon à l’autre.

Appliquer une pénalité L1 de force comparable fait quelque chose de qualitativement différent : elle conduit à zéro exactement la plupart des coefficients des prédicteurs corrélés et en conserve un. Le résultat est plus parcimonieux et plus facile à interpréter, mais le prédicteur qui survit peut être quelque peu arbitraire quand le groupe corrélé est presque interchangeable.

Questions fréquentes

Comment choisit-on la force de la pénalité ?

Par validation croisée. La force ne peut pas être ajustée sur les données d’entraînement, car une pénalité plus grande augmente toujours l’erreur d’entraînement par construction. Une grille de valeurs candidates est évaluée par validation croisée et l’on retient celle qui minimise l’erreur de test estimée.

Faut-il pénaliser l’ordonnée à l’origine ?

Normalement non. L’ordonnée à l’origine représente le niveau de base de la réponse plutôt que l’influence d’un prédicteur, et la pénaliser ferait dépendre l’ajustement de l’endroit où la réponse se trouve centrée.

Pourquoi faut-il standardiser les variables avant de régulariser ?

La pénalité s’applique à l’amplitude des coefficients, et cette amplitude dépend des unités de la variable. Sans standardisation, une variable mesurée en petites unités reçoit un grand coefficient et se trouve plus lourdement pénalisée pour la seule raison de son échelle.

En résumé

La régularisation échange une quantité contrôlée de biais contre une réduction plus grande de la variance en rendant la complexité coûteuse. L2 rétrécit les coefficients de façon lisse et stabilise les prédicteurs corrélés ; L1 les annule et sélectionne des variables. Dans les deux cas la force est un hyperparamètre que seules des données mises de côté peuvent fixer.