Estimateurs, biais et erreur type
Un estimateur comme variable aléatoire dotée de sa propre distribution, la décomposition de son erreur en biais et variance, et le cas travaillé où l'estimateur sans biais du manuel est le moins bon des deux.
Vous disposez d'un échantillon et vous voulez savoir quelque chose de la population dont il provient. Vous calculez un nombre. Tout ce parcours repose sur un déplacement dans la façon de lire ce nombre, et il vaut la peine de l'énoncer clairement avant toute chose.
Le nombre calculé n'est pas le nombre voulu
Supposons que vous vouliez la taille moyenne des adultes d'une ville et que vous mesuriez 40 personnes. Leur moyenne vaut cm. Ce chiffre est un fait concernant vos 40 personnes. Ce n'est pas un fait concernant la ville.
Mesurez-en 40 autres et vous obtiendrez autre chose - , ou . La quantité que vous voulez réellement, la moyenne de la population, est fixe et inconnue. Ce qui bouge, c'est votre estimation.
Un estimateur est la recette (« prendre la moyenne de l'échantillon »). Une estimation est ce que la recette renvoie sur un échantillon particulier. Comme l'échantillon est aléatoire, l'estimation est une variable aléatoire et possède une distribution - appelée distribution d'échantillonnage. Presque toute l'inférence est un énoncé sur cette distribution plutôt que sur votre unique nombre.
Deux caractéristiques comptent.
Le biais demande si la recette vise correctement. En répétant l'étude sans fin et en moyennant toutes les estimations, tomberiez-vous sur la vérité ? Si oui, l'estimateur est sans biais.
La variance demande à quel point les estimations se regroupent. Deux recettes peuvent viser juste toutes les deux alors que l'une se disperse bien plus que l'autre.
Visée et dispersion sont deux questions distinctes, et aucune ne suffit seule à dire si une estimation vaut quelque chose.
Pourquoi diviser par n est faux, précisément
La moyenne empirique est sans biais pour la moyenne de la population, ce qui n'étonne personne. La variance empirique est plus intéressante, car la recette évidente est fausse d'une manière que l'on peut quantifier exactement.
La recette évidente consiste à prendre la distance de chaque observation à la moyenne de l'échantillon, à l'élever au carré et à moyenner sur les observations. Elle produit des réponses systématiquement trop petites - et non d'un montant vague, mais du facteur exact
À , cela fait neuf dixièmes : en moyenne vous récupérez 90 % de la vraie variance, quel que soit le nombre d'études menées.
La raison mérite qu'on s'y arrête plutôt qu'on la mémorise. Vous avez mesuré des distances depuis la moyenne de l'échantillon. Or cette moyenne est, par construction, l'unique point qui rend ces distances au carré aussi petites que possible pour cet échantillon. La vraie moyenne est ailleurs, donc les distances à elle auraient été plus grandes. Vous avez mesuré la dispersion depuis un centre artificiellement commode.
Un degré de liberté a servi à localiser ce centre, et diviser par plutôt que par le restitue exactement. En simulant 400 000 échantillons de taille 10 issus d'une population de variance :
| recette | moyenne sur 400 000 échantillons | prédiction |
|---|---|---|
| diviser par | ||
| diviser par |
Juste en moyenne n'est pas la même chose que proche
C'est ici que le récit s'arrête d'habitude, et ici qu'il devient intéressant.
L'absence de biais est un énoncé sur une moyenne prise sur une infinité de répétitions. Vous obtenez un échantillon. Ce qui vous importe réellement, c'est la distance probable entre votre estimation et la vérité, et la mesure standard en est l'erreur quadratique moyenne :
La décomposition est exacte, et elle signifie qu'un estimateur peut échanger l'une contre l'autre. Acceptez un peu de biais, achetez une réduction plus grande de variance, et vous finissez globalement plus près de la vérité.
Ce n'est pas une hypothèse d'école. Pour les deux recettes à avec une vraie variance de et une population normale, les erreurs quadratiques moyennes exactes valent
L'estimateur biaisé est le plus proche de la vérité. Diviser par le plus grand nombre rétrécit légèrement chaque estimation vers zéro ; la variance ainsi économisée l'emporte sur le biais introduit.
Ce n'est pas une curiosité à ranger de côté. C'est le même arbitrage qui justifie la régression ridge, les estimateurs à rétrécissement et pour ainsi dire toute la régularisation : un biais délibéré et quantifié qui abaisse l'erreur totale. Le rencontrer ici, sur une formule que vous connaissez déjà, rend bien plus difficile de le prendre plus tard pour un compromis.
Ces quatre nombres ont tous une forme close, alors la figure ci-dessous les calcule au lieu de les simuler : 3,6 et 4 pour les deux recettes en moyenne, 3,04 et 3,5556 pour leurs erreurs quadratiques. Faire glisser la taille d'échantillon règle ce que cette section n'affirme qu'à une seule taille : pour des données normales, la recette biaisée est plus proche à TOUTE valeur de n, car (2n-1)(n-1) est inférieur à 2n au carré pour tout n, et l'avantage s'efface à mesure que l'échantillon grandit.
Interactif : la recette fausse et pourtant plus proche
Formes closes partout. La leçon les simule ; elles n’en ont pas besoin.
- Diviser par n, en moyenne
- 3.6000
- Diviser par n - 1
- 4.0000
- Son erreur quadratique
- 3.0400
- Celle de l’autre
- 3.5556
Diviser par n récupère en moyenne 3.6000 d’une variance vraie de 4, soit exactement 10 - 1 sur 10. Diviser par n - 1 rend le degré de liberté et tombe sur 4. Et pourtant la recette biaisée est PLUS PROCHE : son erreur quadratique vaut 3.0400 contre 3.5556, décomposée en un biais de -0.4000 et une dispersion de 2.8800. Faites glisser n : l’ordre ne s’inverse à aucune taille.
L'erreur type, et ce qu'elle coûte
L'écart-type de la distribution d'échantillonnage porte son propre nom - l'erreur type - parce qu'il est ce que signifie « à quel point cette estimation est-elle précise ? ». Pour une moyenne empirique :
La racine carrée gouverne l'économie de toute étude jamais conçue. Avec un écart-type de population de :
- à , l'erreur type vaut
- à , elle vaut
Diviser votre incertitude par deux vous a coûté quatre fois plus de données. Passer de à coûterait 300 observations de plus. La précision s'achète, mais le prix monte fort, et c'est pourquoi une étude sous-dimensionnée ne se rattrape pas en ajoutant quelques sujets - point que la troisième leçon rend quantitatif.
Ce que cela vous apporte
Trois idées, sur lesquelles repose le reste du parcours.
Une estimation est un tirage dans une distribution : la question honnête n'est donc jamais « quelle est la réponse ? » mais « comment cette recette se comporte-t-elle sur les échantillons que j'aurais pu tirer ? ».
L'erreur se décompose en visée et dispersion, et la décomposition est exacte. Améliorer un estimateur revient le plus souvent à arbitrer entre les deux plutôt qu'à éliminer l'une d'elles.
La précision progresse en : elle s'achète à un prix croissant et doit être budgétée avant la collecte plutôt qu'espérée après.
La leçon suivante attache une plage à une estimation, et découvre que la recette standard promet plus qu'elle ne délivre.
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.
Débloquez tout le parcours
Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.