Aller au contenu
Kudos AI
Read in English
Statistical Inference

Ce qu'un échantillon peut et ne peut pas vous dire

Les estimateurs comme variables aléatoires dotées de leur propre distribution, le cas où l'estimateur sans biais est le moins bon, ce qu'un intervalle de confiance promet réellement et l'intervalle standard qui délivre 87 % là où il en annonce 95, et ce dont une valeur p est la probabilité - chaque chiffre calculé exactement ou par simulation à graine fixée.

11 min de lectureKudos AI

Prérequis : Probability and Statistical Foundations

Une distribution d'échantillonnage se construisant une estimation à la fois, des intervalles de confiance s'empilant tandis qu'une fraction fixe manque la vraie valeur, et une valeur p émergeant comme l'aire de queue d'une loi sous l'hypothèse nulle.

Presque tout ce que vous lirez de quantitatif repose sur un même geste : quelqu'un a mesuré quelques choses et a dit quelque chose des nombreuses choses qu'il n'a pas mesurées. Un essai sur 200 patients devient une affirmation sur un traitement. Un sondage auprès de 1 000 électeurs devient un chiffre au journal.

Ce geste s'appelle l'inférence, et il n'a rien de magique. Il a des règles, il a un coût, et il comporte trois endroits où la conclusion est couramment énoncée plus fortement que l'arithmétique ne l'autorise. Cet article parcourt ces trois endroits, et chaque chiffre ci-dessous a été calculé avant d'être écrit - exactement lorsqu'une réponse exacte existe, et par simulation à graine déclarée sinon.

Une estimation est elle-même une chose aléatoire

Commençons par l'idée qui rend le reste possible. Quand vous calculez une moyenne sur un échantillon, cette moyenne n'est pas un fait sur le monde ; c'est un fait sur votre échantillon. Tirez-en un autre et vous obtenez un autre nombre. L'estimation possède donc une distribution qui lui est propre, et comprendre l'inférence, c'est penser à cette distribution plutôt qu'au nombre unique que vous avez obtenu.

Deux choses la décrivent. Le biais dit si l'estimateur est centré sur la vérité - si, moyenné sur tous les échantillons que vous auriez pu tirer, il tombe sur la bonne réponse. La variance dit à quel point il bouge d'un échantillon à l'autre.

L'illustration classique est la formule de la variance. Si vous mesurez la dispersion de vos données autour de la moyenne empirique et divisez par nn, vous obtenez une réponse systématiquement trop petite - du facteur exact (n−1)/n(n-1)/n, soit neuf dixièmes à n=10n = 10. La raison mérite une pause : la moyenne empirique est, par construction, le point le plus proche de vos données. Mesurer la dispersion depuis elle sous-estime donc la dispersion autour de la vraie moyenne, qui est ailleurs. Diviser par n−1n-1 restitue exactement ce qui a servi à localiser le centre.

Simuler 400 000 échantillons de taille 10 issus d'une population normale de variance 4 le confirme : la version 1/n1/n donne en moyenne 3,6009553,600955 contre une prédiction de 3,63,6, et la version 1/(n−1)1/(n-1) donne 4,0010624,001062.

Là où « sans biais » se révèle pire

Voici la partie que l'on saute d'habitude, et c'est la plus utile.

Être juste en moyenne n'est pas être proche. La mesure naturelle de « proche » est l'erreur quadratique moyenne, qui se décompose exactement en biais au carré plus variance. Sur ces mêmes 400 000 échantillons :

  • l'estimateur biaisé 1/n1/n a une erreur quadratique moyenne de 3,0456653,045665
  • l'estimateur sans biais 1/(n−1)1/(n-1) en a 3,5634933,563493

L'estimateur sans biais est le pire des deux, et pas de peu. Ce ne sont pas des artefacts de simulation - pour une population normale, les valeurs exactes sont σ4(2n−1)/n2=3,04\sigma^4(2n-1)/n^2 = 3,04 et 2σ4/(n−1)=3,5555562\sigma^4/(n-1) = 3,555556, et la simulation tombe à moins d'un quart de pour cent de chacune. Diviser par le plus grand nombre rétrécit légèrement chaque estimation vers zéro, et la variance ainsi achetée vaut davantage que le biais qu'elle coûte.

C'est le compromis biais-variance sous sa forme la plus pure, et c'est la raison pour laquelle les méthodes qui introduisent délibérément du biais - régression ridge, rétrécissement, presque toute la régularisation - ne sont pas des compromis mais des améliorations.

Autre conséquence de cette distribution : sa largeur décroît en 1/n1/\sqrt{n}. Avec un écart-type de population de 2, l'erreur type de la moyenne vaut 0,40,4 à n=25n = 25 et 0,20,2 à n=100n = 100. Diviser votre incertitude par deux coûte quatre fois plus de données. Ce seul fait gouverne le budget de toute étude jamais conçue.

Ces quatre nombres ont tous une forme close, alors la figure ci-dessous les calcule au lieu de les simuler : 3,6 et 4 pour les deux recettes en moyenne, 3,04 et 3,5556 pour leurs erreurs quadratiques. Faire glisser la taille d'échantillon règle ce que cette section n'affirme qu'à une seule taille : pour des données normales, la recette biaisée est plus proche à TOUTE valeur de n, car (2n-1)(n-1) est inférieur à 2n au carré pour tout n, et l'avantage s'efface à mesure que l'échantillon grandit.

Interactif : la recette fausse et pourtant plus proche

Formes closes partout. La leçon les simule ; elles n’en ont pas besoin.

320
Diviser par n, en moyenne
3.6000
Diviser par n - 1
4.0000
Son erreur quadratique
3.0400
Celle de l’autre
3.5556
(n - 1)/n = 0.900

Diviser par n récupère en moyenne 3.6000 d’une variance vraie de 4, soit exactement 10 - 1 sur 10. Diviser par n - 1 rend le degré de liberté et tombe sur 4. Et pourtant la recette biaisée est PLUS PROCHE : son erreur quadratique vaut 3.0400 contre 3.5556, décomposée en un biais de -0.4000 et une dispersion de 2.8800. Faites glisser n : l’ordre ne s’inverse à aucune taille.

Ce qu'un intervalle de confiance promet réellement

Un nombre isolé cache sa propre précision : on rapporte donc une plage. La promesse attachée à un intervalle de confiance à 95 % est précise, et ce n'est pas celle que l'on énonce le plus souvent.

La promesse porte sur la procédure : construisez des intervalles ainsi, échantillon après échantillon, et 95 % d'entre eux contiendront la vraie valeur. Ce n'est pas un énoncé sur l'intervalle affiché à votre écran. Une fois les données recueillies et les nombres fixés, votre intervalle contient la vérité ou non - il ne reste rien d'incertain. Dire « il y a 95 % de chances que la vraie valeur soit là-dedans » traite une inconnue fixe comme si elle était aléatoire.

Cette distinction paraît pédante jusqu'à ce que l'on voie ce qui arrive quand la procédure est légèrement fausse.

Deux façons dont la recette standard échoue

Utiliser le mauvais quantile. Quand vous ignorez la dispersion de la population et devez l'estimer sur le même petit échantillon, il y a deux sources d'incertitude, et le familier 1,9599641,959964 de la loi normale n'en couvre qu'une. À n=10n = 10, un intervalle bâti avec lui couvre la vérité 0,9183510,918351 du temps, pas 0,950,95. Ce chiffre est exact, non simulé, pour une population normale ; sur des données fortement asymétriques les deux quantiles ne sont que des approximations. La loi de Student existe précisément pour corriger cela, et son quantile à 9 degrés de liberté vaut 2,2621572,262157 - nettement plus large. À 29 degrés de liberté il est déjà retombé à 2,0452302,045230.

Dimensionner la largeur depuis le même faux pas. L'intervalle usuel pour une proportion est pire, et il échoue de façon instructive. Comme une binomiale a un nombre fini d'issues, sa couverture se calcule exactement en les énumérant toutes. À n=50n = 50 :

pp vraiintervalle usuelintervalle de Wilson
0,050,9198670,962224
0,100,8789170,970308
0,200,9375310,950701
0,500,9350910,935091

À p=0,1p = 0,1, les 95 % annoncés valent en réalité 87,9 %. Le mécanisme : le même échantillon malchanceux déplace le centre et dimensionne mal la largeur, si bien que les deux erreurs se renforcent au lieu de se compenser.

À p=0,01p = 0,01 il s'effondre complètement, couvrant 0,3948480,394848. La raison est nette : 0,6050060,605006 des échantillons de 50 ne contiennent aucun succès, et quand l'estimation vaut zéro l'erreur type estimée vaut zéro aussi : l'intervalle se réduit au point 00 - qui manque la cible.

La partie qui devrait clore les règles de pouce

On pourrait espérer que « vérifier np>5np > 5 » protège de cela. Ce n'est pas le cas, car la couverture ne s'améliore pas régulièrement avec les données. Toujours à p=0,2p = 0,2, l'intervalle usuel couvre :

  • 0,9512140,951214 à n=23n = 23
  • 0,8728620,872862 à n=24n = 24

Une observation de plus coûte près de huit points de couverture. Ici npnp vaut 4,6 puis 4,8, donc la règle aurait signalé les deux tailles, mais elle laisse passer n=32n = 32 (np=6,4np = 6,4), où la couverture chute encore de six points depuis n=31n = 31, de 0,9498350,949835 à 0,8901910,890191. La couverture baisse d'une taille à la suivante à 29 des 180 pas entre 20 et 200 : la plupart des baisses font un à trois points, et trois dépassent cinq points. Une binomiale à n+1n+1 issues dispose d'un ensemble d'intervalles atteignables entièrement différent quand nn change : la couverture saute donc lorsque des issues entières franchissent la frontière. Aucun seuil sur nn ne rend l'intervalle usuel sûr, et c'est l'argument honnête pour en utiliser un meilleur.

La figure ci-dessous exécute cette énumération pour toutes les tailles d'échantillon de 20 à 200 d'un seul coup. Rien n'y est simulé : chaque point est une somme finie sur les n + 1 issues possibles. Partez de n = 23, où l'intervalle classique couvre 0,951 et paraît irréprochable, puis avancez d'un pas jusqu'à 24 et regardez huit points s'évaporer. Passez ensuite à p = 0,01 pour voir l'échec sous sa forme la plus crue, et à l'intervalle de Wilson pour voir ce que l'on gagne à prendre la largeur sur p plutôt que sur l'estimation.

Interactif : la couverture réelle d’un intervalle à 95 %

Exacte, par énumération. Une binomiale n’a que n + 1 issues.

95%80%n = 20200
Couverture à n
95.1%
Manque
0.0%
Tailles qui reculent
29
Échantillons sans succès
0.6%
vrai p

À n = 23, l’intervalle annonçant 95 % en livre 95.1%. Regardez la forme : la couverture ne monte pas vers la ligne, elle la traverse 29 fois sur cette seule plage, chaque dent correspondant à une valeur atteignable de plus. Passez de 23 à 24 et huit points disparaissent avec une seule observation supplémentaire.

Ce dont une valeur p est la probabilité

La troisième idée est la plus mal lue, et l'erreur découle de l'oubli de la façon dont elle se calcule.

Un test d'hypothèses commence par supposer ce dont vous doutez. Supposons qu'il n'y ait aucun effet. Puis demandons : si c'était vrai, à quelle fréquence des données paraîtraient-elles au moins aussi extrêmes que les miennes ? Cette probabilité est la valeur p.

Tout découle de ce que l'hypothèse est faite en premier. La valeur p ne peut pas être la probabilité que l'hypothèse nulle soit vraie, puisque le calcul a déjà fixé la nulle comme vraie. Une quantité conditionnée à une hypothèse ne peut aussi être une probabilité portant sur elle.

Sous une nulle vraie, la valeur p est uniforme sur [0,1][0,1] : toutes les valeurs sont également probables. Simuler 50 000 tests sur des échantillons de 25 issus d'une nulle vraie donne une distance de Kolmogorov-Smirnov de 0,0042990,004299 à la loi uniforme, avec 0,04990,0499 des valeurs p sous 0,050,05. Une valeur p de 0,030,03 n'est pas plus rare qu'une de 0,530,53 ; elle tombe simplement dans une région déclarée intéressante.

La puissance décide de ce que vaut un résultat nul

La quantité compagne est la puissance : la probabilité de trouver un effet réellement présent. Elle est fixée par le protocole, avant que la moindre donnée existe, et c'est toujours une puissance contre une taille d'effet précise. Pour un test t bilatéral à un échantillon (ou apparié) sur nn observations, cherchant un demi écart-type, calculé à partir de la loi de Student décentrée :

nnpuissance
100,293176
250,669708
500,933898
1000,998610

Atteindre les 80 % conventionnels demande n=34n = 34. Une étude de 25 rapportant « aucun effet significatif » aurait donc manqué un effet réel de cette taille un tiers du temps. En cherchant un cinquième d'écart-type, le même protocole a une puissance de 0,1605040,160504 - il manque cinq fois sur six. L'absence de preuve n'est preuve d'absence qu'à proportion de la puissance.

Pourquoi la plupart des résultats significatifs peuvent être faux

Réunissons les deux, sans qu'aucun test ne se comporte mal nulle part.

Menez 20 tests indépendants sur des hypothèses toutes nulles. La probabilité qu'au moins un ressorte significatif à 0,050,05 vaut 1−0,9520=0,6415141 - 0,95^{20} = 0,641514. Rien n'a cassé : chaque test se trompe 5 % du temps exactement comme annoncé, et 20 occasions rendent cela probable.

Pire, supposons qu'une hypothèse sur dix seulement soit vraie, avec une puissance de 0,80,8 et α=0,05\alpha = 0,05. Pour 100 hypothèses testées, les tests trouvent 8 effets réels et lèvent 4,5 fausses alertes parmi les 90 nulles. Le taux de fausses découvertes vaut donc

0,9×0,050,1×0,8+0,9×0,05=0,36\frac{0{,}9 \times 0{,}05}{0{,}1 \times 0{,}8 + 0{,}9 \times 0{,}05} = 0{,}36

Plus d'un tiers des résultats significatifs sont faux, alors que chaque test individuel fonctionne exactement selon sa spécification. Ce qui a fait les dégâts, c'est le taux de base - combien d'hypothèses étaient vraies au départ. Le seuil de Bonferroni 0,05/20=0,00250,05/20 = 0,0025 ramène l'erreur par famille à 0,0488300,048830, et le paie en puissance sur chaque test.

La figure ci-dessous dispose cent hypothèses en carrés et applique à toutes le protocole que vous choisissez. La puissance n’est pas un curseur : elle est calculée à partir de la taille d’échantillon et de l’effet recherché, via la loi de Student décentrée, si bien que la courbe à côté de la grille est le tableau ci-dessus avec les trous comblés. Réduisez le taux de base et les carrés ambrés - des hypothèses nulles déclarées significatives - finissent par l’emporter sur les verts, sans que rien n’ait été mal appliqué. Resserrez ensuite le seuil : la protection se paie sur la puissance.

Interactif : cent hypothèses, tous les tests parfaitement conformes

Rien n’est mal appliqué ici. Comptez quand même les carrés ambrés.

Un carré par hypothèse testée

vraie, et trouvéevraie, et manquéenulle, déclarée significativenulle, correctement non
Puissance
80.8%
Taux de fausses découvertes
35.8%
Significatif et juste
64.2%
Effets réels manqués
1.9

Puissance contre cet effet, selon la taille d’échantillon

0.00.50.81.0n = 34
seuil de signification

Sur les 12.6 résultats que ce lot déclare significatifs, 4.5 sont faux, soit 35.8%. Aucun test n’a dérapé : chaque hypothèse nulle a été rejetée exactement à son taux annoncé, et chaque effet réel détecté exactement à la puissance que le protocole a payée. Le coupable est le taux de base, une quantité qui n’apparaît dans aucun des tests. Augmenter la puissance aide, mais seulement par le numérateur : cela ne touche pas les fausses alertes, fixées par le seuil et par le nombre d’hypothèses nulles.

Le fil conducteur

Les trois idées partagent une forme. Une estimation, un intervalle et une valeur p répondent chacun à une question étroite et bien posée, et chacun est couramment lu comme répondant à une question plus large qui intéresse davantage.

L'estimation dit où pointent les données, non à quelle distance elle est. L'intervalle décrit le comportement à long terme d'une procédure, non la chance qu'a le vôtre d'avoir raison. La valeur p dit à quel point les données surprendraient s'il ne se passait rien, non combien croire qu'il se passe quelque chose.

Lire chacun pour ce qu'il est ne coûte rien, et c'est la différence entre se servir de la statistique et se faire servir par elle.

Le parcours Inférence statistique travaille les trois en détail, avec les calculs exécutables et modifiables dans le navigateur.

Références et lectures complémentaires

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

4 min de lectureStatistical Inference

L’intervalle à 95 % qui couvre 81 % du temps

L’intervalle de confiance classique pour une proportion a une couverture exacte que l’on calcule en sommant sur les n+1 échantillons possibles, et à n = 30 avec p = 0,10 elle vaut 0,8085 au lieu de 0,95. La couverture ne s’améliore pas de façon monotone avec n, et dans un contexte d’événements rares elle peut tomber à 0,0392. Deux solutions d’une ligne corrigent cela.

Statistique
4 min de lectureRaisonnement probabiliste

Cent mille échantillons, quatre cents qui comptent

Sur le réseau du cambriolage avec les deux voisins qui appellent, l’échantillonnage par rejet garde 183 tirages sur 100 000 et la pondération par vraisemblance les garde tous pour une taille d’échantillon efficace de 396. Les deux estimations s’écartent d’environ 10 % d’une probabilité a posteriori de 0,284172, et la raison se calcule exactement : 252 échantillons portent 76 % du poids et 99,975 % du poids au carré.

Intelligence artificielleProbabilité
8 min de lectureExperimentation

L’expérience qui allait gagner de toute façon

Un test de 2 000 utilisateurs par bras rapporte des effets 2,4 fois trop grands. Un test A/A consulté dix fois ressort significatif 19 % du temps. Vingt métriques nulles indépendantes produisent un vainqueur 64 % du temps, et douze segments nuls 46 %. Quatre nombres, une seule cause, et les décisions à prendre avant l’arrivée des données.

StatistiqueApprentissage automatique
← Retour à tous les articles