Aller au contenu
Kudos AI

Graphe causal

Un dessin des relations de cause a effet supposees, sous forme de fleches entre variables, servant a decider quelles variables doivent etre ajustees et lesquelles ne doivent pas l'etre - question a laquelle les donnees seules ne repondent pas.

Aussi appelé : Graphe oriente acyclique, DAG, Modele causal structurel

Comprendre Graphe causal

Un graphe rend explicites les hypotheses causales. Chaque fleche affirme qu'une variable en influence une autre, et l'absence de fleche est aussi une affirmation - souvent la plus forte. Comme la correlation est symetrique et la causalite non, aucun tableau d'associations n'oriente les fleches a lui seul, et plusieurs graphes distincts peuvent engendrer exactement les memes nombres. Ecrire le graphe est ce qui transforme une hypothese en quelque chose de discutable.

Trois motifs couvrent l'essentiel du raisonnement. Dans une chaine, T cause M qui cause Y, et controler M retire une partie de l'effet que l'on voulait mesurer. Dans une fourche, Z cause T et Y, et controler Z est ce qui supprime la confusion. Dans un collider, T et Y causent tous deux C, et ici le conseil s'inverse : controler C fabrique une association entre des causes independantes.

Le cas du collider merite son arithmetique, car il contredit l'habitude d'ajuster sur tout ce qui est enregistre. Prenez deux causes independantes, chacune presente avec probabilite un demi, et admettez un cas quand l'une ou l'autre est presente. Parmi les admis, la probabilite de la premiere cause vaut 2/3 ; parmi les admis ayant aussi la seconde, elle tombe a 1/2. L'independance a disparu : la probabilite jointe parmi les admis vaut 1/3 tandis que le produit des marginales vaut 4/9. Connaitre une cause explique l'admission et rend l'autre moins probable.

Le critere de porte derobee lit la regle sur le dessin : ajuster sur un ensemble de variables qui bloque tout chemin entrant dans le traitement par l'arrière et ne contient aucun descendant du traitement, afin de ne retirer aucun médiateur ni d'ouvrir aucun collider. Quand les hypotheses tiennent, l'ajustement est exact et non approche - dans un monde construit pour que l'effet vrai vaille 0,200000, la comparaison naive donne 0,375325 et l'estimation ajustee renvoie exactement 0,200000. Quand une cause commune non mesuree existe, la meme formule renvoie un nombre assure et faux, et c'est pourquoi le graphe est l'argument et la formule ne fait que le suivre.

Comment calculer

chain T → M → Y, fork T ← Z → Y, collider T → C ← Y

où

fork
fourche : une cause commune ; ajuster sur Z supprime la confusion
chain
chaine : un mediateur ; ajuster sur M retire une partie de l'effet
collider
collider : un effet commun ; ajuster sur C cree une association fallacieuse
back-door
porte dérobée : bloquer tout chemin non causal entrant dans T, sans ajuster sur rien en aval de T

Exemple : Graphe causal

Deux causes independantes d'admission, chacune de probabilite 1/2 : parmi les admis, P(premiere) = 2/3, mais P(premiere sachant seconde) = 1/2. La jointe parmi les admis vaut 1/3 contre un produit de marginales de 4/9 : le conditionnement a donc detruit une independance qu'il n'a pas trouvee.

Un monde confondu bati pour que l'effet vrai vaille exactement 0,200000 : la difference naive vaut 0,375325, surestimant de 0,175325, et l'estimation ajustee par porte derobee vaut exactement 0,200000. Les deux sont calculees en fractions exactes : l'ecart est donc du biais et non du bruit d'echantillonnage.

Le renversement de Simpson est une fourche : la gravite cause a la fois la decision de traitement et la guerison, si bien que la comparaison globale porte le mauvais signe jusqu'a standardisation sur la gravite.

Questions fréquentes

Le graphe peut-il s'apprendre a partir des donnees ?

Partiellement, jamais completement. Des algorithmes peuvent restreindre les possibilites a une classe de graphes partageant les memes independances conditionnelles, mais distinguer a l'interieur de cette classe exige des interventions ou des hypotheses venues d'ailleurs.

Que faire en cas de doute sur une fleche ?

Dessinez les deux versions et verifiez si la conclusion change. Si oui, le desaccord est le resultat et doit etre rapporte comme tel ; sinon, l'incertitude n'avait pas d'importance. C'est plus informatif que de choisir un graphe en silence.

Une regression avec de nombreux controles equivaut-elle a un graphe ?

Non. Une regression ajuste sur ce qu'on y met, ce qui peut inclure, comme le dirait le graphe, des colliders et des mediateurs. Les controles encodent une affirmation causale, que quelqu'un l'ecrive ou non, et le graphe est cette affirmation rendue lisible.

En résumé

Un graphe causal est l'endroit ou les hypotheses sont enoncees plutot que passees en contrebande. Il dit quels ajustements aident, lesquels ne font rien, et lesquels fabriquent activement du biais - et comme differents graphes peuvent s'accorder aux memes donnees, le dessiner est l'etape qui rend une affirmation causale discutable.