Aller au contenu
Kudos AI

Comparaisons multiples

L’inflation des faux positifs qui survient dès que plus d’un test, d’une métrique, d’un segment ou d’un point d’arrêt peut produire le résultat annoncé. Chaque chance supplémentaire augmente la probabilité que quelque chose franchisse le seuil par pure chance.

Aussi appelé : Multiplicité, Effet du regard ailleurs, Taux d’erreur par famille

Comprendre Comparaisons multiples

Un seuil de significativité de 5 % promet qu’un unique test pré-spécifié sur des données sans effet vous trompera une fois sur vingt. Rien de cette promesse ne survit à une application répétée. Avec vingt métriques nulles indépendantes, la chance qu’au moins une soit significative vaut un moins 0,95 à la puissance vingt, soit 64,2 % ; à cinquante métriques, 92,3 %. Les tests se comportent exactement comme prévu, ce n’est pas le cas du compte rendu.

La même arithmétique s’applique au temps plutôt qu’aux métriques. Une expérience A/A, dont les deux bras sont identiques par construction, est significative 5,0 % du temps quand on la lit une fois à sa taille prévue. Consultez-la dix fois à mesure que les données arrivent en arrêtant au premier franchissement, et elle est significative 19,3 % du temps. L’estimation erre à mesure que l’échantillon grandit, et une quantité errante finit par franchir toute ligne fixe ; s’arrêter là garde l’excursion et jette le retour.

Et aux sous-groupes. Découper une expérience nulle en douze segments produit au moins un segment significatif dans 46,4 % des tirages. Davantage de données n’y change rien : avec un échantillon plus grand, un test nul fabrique des segments fallacieux à la même fréquence, car cette fréquence dépend du nombre de chances et non de leur précision.

Les corrections existent et elles fonctionnent. Bonferroni divise le seuil par le nombre de tests, ce qui ramène vingt métriques à un taux par famille de 4,9 %, au prix d’un test individuel tournant à 0,25 % et exigeant bien plus de données pour la même puissance. Les procédures de taux de fausses découvertes sont moins sévères et contrôlent une autre quantité. Mais toute correction ne compte que les comparaisons déclarées, et l’analyste qui a essayé vingt métriques, trois segments et quatre fenêtres avant d’en rapporter une a fait des comparaisons qu’aucune correction ne peut voir.

Comment calculer

P(at least one false positive) = 1 − (1 − α)^m; Bonferroni: test each at α/m

où

α
le seuil de significativité d’un test unique, en général 0,05
m
le nombre de chances indépendantes : métriques, segments, variantes (des coups d’œil répétés sur les mêmes données sont corrélés et donnent moins)
taux d’erreur par famille
la chance d’au moins un faux positif sur l’ensemble des m
taux de fausses découvertes
la part attendue de fausses trouvailles parmi celles annoncées

Exemple : Comparaisons multiples

Au seuil de 5 %, la chance qu’au moins une métrique nulle indépendante sur 1, 5, 20 et 50 ressorte significative vaut 5,0 %, 22,6 %, 64,2 % et 92,3 %.

Un test A/A lu une fois : significatif 5,0 % du temps. Le même test consulté dix fois et arrêté tôt : 19,3 %, une inflation d’environ quatre fois.

Une expérience nulle découpée en douze segments donne au moins un segment significatif dans 46,4 % des tirages, et un échantillon plus grand ne fait pas baisser ce taux.

Questions fréquentes

Une correction rattrape-t-elle un résultat trouvé en explorant ?

Pas vraiment. Elle ne peut tenir compte que des comparaisons dénombrables, et l’exploration en engendre d’indénombrables. Le traitement honnête d’une trouvaille exploratoire est de la considérer comme une hypothèse, confirmée ou abandonnée par un nouveau test qui la vise spécifiquement.

Est-il fautif de regarder une expérience pendant qu’elle tourne ?

Il est fautif de s’arrêter sur ce que l’on voit, sous un test qui supposait un seul coup d’œil. Les plans séquentiels et les schémas de dépense d’alpha existent précisément pour autoriser le suivi : ils dépensent le budget d’erreur délibérément plutôt qu’accidentellement.

Quelle correction utiliser ?

Cela dépend de ce que vous protégez. Les procédures par famille comme Bonferroni ou Holm conviennent quand une seule affirmation fausse coûte cher. Les procédures de taux de fausses découvertes conviennent quand vous criblez de nombreux candidats et pouvez tolérer une part connue de fausses pistes.

En résumé

La multiplicité explique pourquoi une étude qui a tout regardé peut trouver quelque chose dans presque n’importe quel jeu de données, y compris un où il ne se passe rien. L’arithmétique est simple et la discipline est structurelle : déclarez la métrique, la population et la règle d’arrêt avant l’arrivée des données, car aucune correction appliquée après coup ne peut voir les choix que vous n’avez pas consignés.