Comprendre Compromis biais-variance
Pour une perte quadratique, l’erreur de test espérée en un point se décompose en trois morceaux additifs, et la décomposition est une identité, non une approximation. Le premier est le carré du biais : de combien la prédiction moyenne du modèle, sur tous les ensembles d’entraînement sur lesquels il aurait pu être ajusté, s’écarte de la vérité. Le deuxième est la variance : de combien la prédiction bouge quand l’ensemble d’entraînement change. Le troisième est le bruit irréductible inhérent aux données.
Le biais mesure l’erreur systématique introduite par les hypothèses du modèle. Un modèle linéaire appliqué à une relation réellement non linéaire est biaisé quelle que soit la quantité de données, car aucune droite ne peut représenter une courbe. La variance mesure l’instabilité. Un modèle assez souple pour poursuivre des observations individuelles produira un ajustement nettement différent sur un autre échantillon de la même population.
Les deux évoluent en sens contraires quand la souplesse augmente. Ajouter de la capacité permet au modèle de suivre la vraie fonction de plus près, ce qui abaisse le biais, tout en lui permettant de suivre le bruit, ce qui élève la variance. L’erreur de test décrit donc un U : elle baisse tant que la réduction du biais domine, atteint un minimum, puis remonte quand l’augmentation de variance l’emporte. L’erreur d’entraînement, elle, décroît de façon monotone, ce qui est exactement pourquoi elle ne peut pas servir à choisir la complexité.
Le terme irréductible fixe un plancher sous l’erreur espérée. Même un modèle qui retrouverait parfaitement la vraie fonction commettrait encore des erreurs, car les observations elles-mêmes contiennent de l’aléa. Une erreur mesurée sur un ensemble de test fini se disperse de part et d’autre de ce plancher : seule une exactitude annoncée qui le bat au-delà de ce bruit d’échantillonnage est le signe d’une fuite entre données d’entraînement et d’évaluation plutôt que d’un modèle supérieur.
Comment calculer
E[(y − f̂(x))²] = Bias[f̂(x)]² + Var[f̂(x)] + σ²
où
- f̂(x)
- la prédiction du modèle en x, elle-même aléatoire puisque l’ensemble d’entraînement l’est
- Bias[f̂(x)]
- E[f̂(x)] − f(x) : l’écart entre la prédiction moyenne et la vérité
- Var[f̂(x)]
- la variabilité de la prédiction sur les ensembles d’entraînement possibles
- σ²
- la variance irréductible du bruit dans y
Exemple : Compromis biais-variance
Opposez deux modèles extrêmes sur le même problème. Un modèle qui ignore complètement son entrée et prédit toujours une constante a une variance nulle, puisqu’un nouvel ensemble d’entraînement ne change rien, mais un biais très élevé, puisqu’il ne peut pas répondre à x du tout.
À l’autre extrême, un modèle qui interpole exactement chaque point d’entraînement a un biais moyen quasi nul mais une variance énorme : retirez un nouvel échantillon et la fonction ajustée change complètement de forme, parce qu’elle suit le bruit.
Aucun des deux n’est utile. Le modèle qui minimise l’erreur de test se situe entre eux, et sa position dépend de la quantité de données disponibles : quand l’échantillon grandit, le coût en variance d’une souplesse supplémentaire diminue, et l’optimum se déplace vers des modèles plus complexes. C’est pourquoi une classe de modèles qui surajuste gravement sur mille exemples peut être exactement la bonne sur un million.
Questions fréquentes
Un modèle peut-il avoir à la fois un biais élevé et une variance élevée ?
Oui. Un modèle mal spécifié peut être simultanément faux en moyenne et instable d’un échantillon à l’autre. Cela indique en général que la classe de modèles ne convient pas au problème, plutôt qu’un hyperparamètre à régler.
Pourquoi ne puis-je pas simplement calculer le biais et la variance de mon modèle ?
Les deux termes sont définis par rapport à la vraie fonction sous-jacente et à la distribution des ensembles d’entraînement possibles, dont aucun n’est observable en pratique. C’est pourquoi le compromis se navigue indirectement, en estimant l’erreur de test par validation croisée ou par un ensemble mis de côté.
Le compromis signifie-t-il que les modèles souples sont dangereux ?
Il signifie que la souplesse a un coût qu’il faut payer en données ou contraindre par régularisation. Avec assez de données, ou une pénalité efficace sur la complexité, des modèles très souples peuvent atteindre à la fois un faible biais et une variance maîtrisée.
En résumé
L’erreur espérée de tout modèle est le biais au carré plus la variance plus le bruit irréductible. Comme la souplesse réduit le premier en gonflant la seconde, la sélection de modèle est la recherche du point où leur somme est la plus petite, et ce point ne peut être localisé qu’avec des données tenues à l’écart de l’ajustement.