Le compromis biais-variance
La décomposition exacte de l’erreur de test espérée en biais au carré, variance et bruit irréductible, démontrée numériquement par une simulation de 2 000 tirages où les trois termes sont mesurés séparément et vérifiés comme s’additionnant.
Prérequis : Qu’est-ce que l’apprentissage statistique ?
Qu’est-ce que l’apprentissage statistique ? a montré un polynôme de degré 15 ajustant son échantillon d’entraînement mieux que tout concurrent tout en se trompant catastrophiquement sur la fonction sous-jacente. C’était une démonstration. Cet article en donne le compte rendu : l’erreur de test espérée se scinde en exactement trois morceaux, dont deux que nous contrôlons et un que nous ne contrôlons pas, et les deux que nous contrôlons évoluent en sens inverse.
A. La décomposition
Prenons un point de test , et soit un modèle ajusté sur un échantillon d’entraînement aléatoire. L’erreur quadratique espérée en , moyennée sur tous les échantillons d’entraînement que nous aurions pu tirer, se décompose en
où le biais vaut .
C’est une égalité, non une approximation ni une heuristique. Chaque terme signifie quelque chose de concret :
- Le biais est l’erreur due à l’approximation d’un problème réel compliqué par un modèle plus simple. Une droite ajustée sur une courbe est biaisée partout, et aucune quantité de données supplémentaires ne l’enlève.
- La variance mesure de combien changerait si on le réajustait sur un autre échantillon d’entraînement de même taille. Une méthode qui oscille violemment d’un échantillon à l’autre a une variance élevée, et tout ajustement isolé est peu fiable.
- L’erreur irréductible est , le plancher de l’article précédent.
Comme le biais au carré et la variance sont tous deux positifs ou nuls, leur somme l’est aussi : l’erreur de test espérée ne peut jamais descendre au-dessous de . Le plancher est réel.
B. Pourquoi les deux termes s’affrontent
Le schéma général : à mesure qu’une méthode gagne en souplesse, le biais baisse et la variance monte.
Plus de souplesse signifie que le modèle peut se plier vers le vrai , donc qu’il est moins systématiquement faux - biais en baisse. Mais cela signifie aussi qu’il peut se plier vers le bruit particulier de cet échantillon, si bien qu’un autre échantillon produirait un ajustement sensiblement différent - variance en hausse.
L’erreur de test est la somme. Au début, la souplesse achète une forte réduction du biais pour une faible hausse de variance, et l’erreur totale baisse. Passé un certain point, l’échange s’inverse et l’erreur totale grimpe. Le meilleur modèle se situe là où les deux taux de variation se compensent.
La figure trace des courbes schématiques en unités arbitraires, et non la simulation sur ci-dessous ; son plancher de bruit est à 0,16, et non au 0,09 utilisé là-bas.
Interactif : le compromis biais-variance
Erreur d’entraînement contre erreur de test à mesure que la complexité augmente.
- Régime
- Bon ajustement
- Erreur d’entraînement
- 0.25
- Erreur de test
- 0.55
Proche du point idéal : l’erreur de test est proche de son minimum.
L’erreur d’entraînement diminue toujours à mesure que le modèle devient plus flexible : c’est donc un guide trompeur. L’erreur de test vaut biais² + variance + bruit irréductible : elle atteint son minimum là où les deux forces s’équilibrent, puis remonte lorsque le modèle s’ajuste au bruit. Ajoutez des données (augmentez la taille de l’échantillon) et le terme de variance diminue, déplaçant le point idéal vers une complexité plus élevée et abaissant toute la courbe de test.
C. Mesurer les trois termes
La décomposition est d’ordinaire présentée comme de la théorie parce qu’en pratique on ne peut pas la calculer - on ignore et on n’a qu’un seul échantillon d’entraînement. Mais dans une simulation nous contrôlons les deux, nous pouvons donc mesurer chaque terme séparément et vérifier qu’ils s’additionnent réellement.
Le cadre : , un bruit donc , des échantillons d’entraînement de 30 points, et un unique point de test . Nous réajustons 2 000 fois sur des échantillons neufs et observons ce que font les prédictions en .
S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.
Son exécution affiche :
true f(x0) = 0.8090, Var(eps) = 0.0900
degree 1: bias^2 0.2684 variance 0.0130 + noise 0.0900 = 0.3713
degree 3: bias^2 0.0059 variance 0.0105 + noise 0.0900 = 0.1064
degree 9: bias^2 0.0000 variance 0.0295 + noise 0.0900 = 0.1195
D. Lire le tableau
Chaque affirmation de la section B est visible ici sous forme de nombre.
Le biais s’effondre quand la souplesse augmente. Le degré 1 a un biais au carré de - une droite ne peut tout simplement pas passer près de en , et sa prédiction moyenne sur 2 000 ajustements valait contre une vraie valeur de . Au degré 3, le biais au carré tombe à , et au degré 9 il s’arrondit à zéro : en moyenne, le modèle souple est exactement juste.
La variance croît quand la souplesse augmente. Elle fait plus que doubler, de au degré 1 à au degré 9. L’ajustement de degré 9 est juste en moyenne, mais tout ajustement individuel s’en écarte visiblement, dans une direction qui dépend des 30 points qu’il a vus.
La somme est minimale au milieu. L’erreur totale suit . Le degré 3 l’emporte - non parce qu’il est le meilleur sur l’un ou l’autre terme pris isolément (le degré 9 a moins de biais) mais parce qu’il est le meilleur compromis.
Le plancher tient. Aucune configuration ne descend sous . Le meilleur total, , n’est qu’à au-dessus du bruit irréductible, et cet écart restant est l’erreur réductible encore disponible.
Une mise en garde sur la ligne du degré 9. Un biais au carré affiché à ne signifie pas que le modèle est non biaisé partout - seulement en ce particulier, et seulement à quatre décimales après moyennage sur 2 000 ajustements. Le biais est une fonction de ; en un point proche du bord de l’intervalle, le même modèle présenterait un biais substantiel, exactement pour la raison qui a fait exploser le polynôme de degré 15 dans l’article précédent.
E. La décomposition tient-elle vraiment ?
Les trois termes devraient sommer à l’erreur de test espérée, que nous pouvons mesurer directement en générant de nouvelles observations bruitées en et en moyennant les erreurs de prédiction au carré. En le faisant à côté de la décomposition, on obtient :
| degré | biais² + var + bruit | EQM de test mesurée |
|---|---|---|
| 1 | 0.3713 | 0.3764 |
| 3 | 0.1064 | 0.1072 |
| 9 | 0.1195 | 0.1171 |
Les deux colonnes concordent à quelques millièmes près - la différence résiduelle est l’erreur de Monte-Carlo due à l’usage de 2 000 simulations plutôt qu’une infinité. L’identité est exacte ; c’est notre estimation qui est simplement très bonne.
F. Ce que cela signifie en pratique
Vous ne pouvez pas calculer biais et variance sur des données réelles, car vous disposez d’un seul échantillon et d’aucun accès à . Ce que vous pouvez faire, c’est reconnaître leurs signatures :
| Symptôme | Cause probable | Réponse |
|---|---|---|
| Erreur d’entraînement élevée, erreur de test semblable | Biais élevé (sous-ajustement) | Modèle plus souple, meilleures variables |
| Erreur d’entraînement très faible, erreur de test bien plus élevée | Variance élevée (surajustement) | Régulariser, simplifier, plus de données |
| Les deux erreurs proches du plancher de bruit | Proche de l’optimum | S’arrêter |
Notez l’asymétrie des remèdes : davantage de données réduit la variance mais ne fait rien contre le biais. Doubler l’échantillon n’aidera pas une droite à ajuster une sinusoïde. Si votre modèle est biaisé, il vous faut un autre modèle, pas un jeu de données plus grand.
À retenir
- L’erreur de test espérée se décompose exactement en biais au carré, variance et bruit irréductible.
- Le biais baisse et la variance monte avec la souplesse ; la somme est en U et le meilleur modèle est le compromis, non l’extrême.
- En simulation, les termes sont mesurables : le degré 3 l’emporte avec un total de contre (biaisé) et (haute variance).
- L’erreur de test ne peut jamais descendre sous .
- Plus de données guérit la variance, pas le biais. Diagnostiquez lequel vous avez avant de choisir un remède.
La suite
Le tableau de diagnostic ci-dessus exige une estimation honnête de l’erreur de test, et l’erreur d’entraînement n’en est catégoriquement pas une. Obtenir cette estimation à partir des données dont vous disposez déjà - sans un jeu de test séparé que vous ne pouvez peut-être pas vous offrir - est le rôle de La validation croisée et le rééchantillonnage.
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.