Aller au contenu
Kudos AI
Read in English
Causal Inférence

La variable de contrôle qui invente une relation

Deux causes indépendantes et un effet commun. Contrôlez l’effet et les causes acquièrent une corrélation d’exactement -1 : une régression de A sur B donne un coefficient de +0,0030, et ajouter l’effet commun comme contrôle le transforme en -1,0000. La sélection d’un échantillon fait la même chose de manière invisible, et c’est pourquoi « contrôlez tout ce que vous avez mesuré » n’est pas une règle défendable.

4 min de lectureKudos AI

Prérequis : Le traitement qui aide tout le monde et nuit à la moyenne

Un graphe à trois nœuds où deux flèches se rejoignent sur un nœud, un nuage de points sans la moindre inclinaison, puis le même nuage tranché à une valeur du nœud de rencontre, chaque tranche inclinée dans l’autre sens.

Voici tout le dispositif. Deux causes, indépendantes l’une de l’autre, et un effet qu’elles produisent toutes deux :

A⟶C⟵B.A \longrightarrow C \longleftarrow B.

CC est un collisionneur : les flèches y entrent en collision. Rien ne relie AA à BB ; ce qui a engendré l’un ignorait tout de l’autre.

Contrôlez maintenant CC. Mettez-le dans la régression, ou stratifiez dessus, ou - le cas qui piège - constituez un échantillon où il est maintenu fixe.

A. La version binaire, exactement

Soit AA et BB deux tirages à pile ou face indépendants et équitables, et C=A ou BC = A \text{ ou } B. Trois quarts de la population ont C=1C = 1. Parmi eux :

P(A=1∣B=0,C=1)=1.0000,P(A=1∣B=1,C=1)=0.5000.P(A = 1 \mid B = 0, C = 1) = 1.0000, \qquad P(A = 1 \mid B = 1, C = 1) = 0.5000.

La corrélation entre AA et BB vaut 00 dans la population et −0.5000\mathbf{-0.5000} dès qu’on conditionne à C=1C = 1. Le raisonnement se fait de tête : si l’alarme a sonné et que ce n’était pas BB, c’était forcément AA. Connaître BB vous renseigne désormais sur AA, parce qu’on vous a déjà dit que l’un des deux s’était déclenché.

B. La version continue, et une régression

Soit AA et BB des lois normales centrées réduites indépendantes et C=A+BC = A + B. Sur 200 000 tirages :

Régressioncoefficient sur BB
AA sur BB+0.0030+0.0030
AA sur BB et CC−1.0000\mathbf{-1.0000}

Ajouter une seule variable de contrôle fait passer un coefficient d’indiscernable-de-zéro à exactement moins un. Ce n’est pas un artefact d’échantillonnage : la corrélation partielle est exacte, car ρAC=ρBC=1/2\rho_{AC} = \rho_{BC} = 1/\sqrt{2} et

ρAB⋅C=0−121−12=−1.\rho_{AB \cdot C} = \frac{0 - \tfrac{1}{2}}{1 - \tfrac{1}{2}} = -1.

En se restreignant aux observations dont le CC est proche de zéro, on obtient −0.9992-0.9992 sur 5 606 points : la même chose, faite par sélection plutôt que par ajustement.

C. Sélectionner, c’est conditionner, et cela ne se voit pas

La version par régression laisse au moins une trace : quelqu’un a choisi d’ajouter CC. La version par sélection n’en laisse aucune, car le conditionnement a eu lieu avant l’arrivée des données.

  • Patients admis. Deux affections indépendantes augmentent chacune la probabilité d’admission. Parmi les admis, elles paraissent négativement associées, et l’une semble protéger de l’autre.
  • Candidats recrutés. Si les entretiens pèsent l’expérience et les résultats aux tests, et que la barre est une combinaison des deux, alors parmi les recrutés les deux sont négativement corrélés même s’ils sont sans rapport dans le vivier. Toute remarque du type « nos meilleurs ingénieurs n’avaient pas les meilleurs scores » a ceci pour première explication candidate.
  • Startups à succès, articles publiés, produits survivants. Tout échantillon défini par un seuil sur un résultat qu’alimentent plusieurs causes.

Le signe est toujours le même : la population d’analyse a été choisie en utilisant quelque chose situé en aval des variables comparées.

D. Ce qui en découle en pratique

  • « Contrôlez tout ce que vous avez mesuré » n’est pas une règle, c’est un tirage à pile ou face. Ajuster sur un facteur de confusion supprime un biais ; ajuster sur un collisionneur en crée un. Les deux sont indiscernables dans les données et ne se distinguent que par la structure causale que vous acceptez d’énoncer.
  • Dessinez le graphe avant de choisir les covariables. Il n’a pas besoin d’être juste dans le détail pour être utile ; il doit dire quelles variables sont en amont du traitement et lesquelles sont en aval du résultat.
  • N’ajustez jamais sur quoi que ce soit causé par le résultat ou par le traitement. Cette seule interdiction couvre la plupart de ces cas, y compris toute la famille des « variables post-traitement ».
  • Dites comment l’échantillon a été sélectionné, à chaque fois. Si la règle de sélection fait intervenir un résultat, l’analyse conditionne sur un collisionneur, que quelqu’un ait écrit une variable de contrôle ou non.

La figure réunit les deux sur un même graphe traitement-résultat, avec un facteur de confusion Z et un collisionneur C. Sous Contrôler pour, choisir Z supprime le biais, et ajouter C le fait revenir.

Interactif : chaque contrôle est une affirmation causale

Le critère graphique et l’arithmétique sont calculés séparément. Ils concordent toujours.

Zfacteur de confusionTtraitementYrésultatCcollisionneur
Estimation
0.5400
Effet réel
0.3000
Erreur
0.2400
Critère de porte dérobée
non satisfait

Contrôler pour

Le chemin T - Z - Y reste ouvert : de l’association non causale continue d’y circuler et l’estimation se trompe de 0.2400. Z augmente la probabilité d’être traité et augmente le résultat par lui-même, donc le groupe traité aurait mieux fait de toute façon. Contrôler pour Z bloque la fourche et l’arithmétique tombe exactement sur la vérité.

Références et lectures complémentaires

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

8 min de lectureCausal Inférence

Le traitement qui aide tout le monde et nuit à la moyenne

Un traitement qui augmente la guérison d'exactement cinq points dans chaque sous-groupe tout en semblant l'abaisser globalement, pourquoi plus de données rend cette conclusion plus assurée et non plus juste, ce que la randomisation achète et que l'ajustement ne peut pas, et le cas où contrôler une variable fabrique une association à partir de rien.

StatistiqueApprentissage automatique
6 min de lectureApprentissage non supervisé

La direction qui change quand vous changez d’unité

Douze personnes, deux mesures, et trois premières composantes principales différentes : en millimètres la réponse est presque uniquement la taille, en mètres presque uniquement le poids, et en centimètres un mélange équilibré - la corrélation restant fixée à 0,9500 dans les trois cas. Ce que cela dit de ce que l’ACP maximise, pourquoi une proportion de variance expliquée de 99,999 % peut être un énoncé sur les mètres plutôt que sur les personnes, et ce que la standardisation choisit réellement.

Apprentissage automatiqueStatistique
4 min de lectureStatistical Inference

L’intervalle à 95 % qui couvre 81 % du temps

L’intervalle de confiance classique pour une proportion a une couverture exacte que l’on calcule en sommant sur les n+1 échantillons possibles, et à n = 30 avec p = 0,10 elle vaut 0,8085 au lieu de 0,95. La couverture ne s’améliore pas de façon monotone avec n, et dans un contexte d’événements rares elle peut tomber à 0,0392. Deux solutions d’une ligne corrigent cela.

Statistique
← Retour à tous les articles