Aller au contenu
Kudos AI

Stationnarité et régression fallacieuse

Deux séries sans aucun lien, régressées l’une sur l’autre et déclarées significatives dans 82,8 % des cas, la propriété des données qui le provoque, et la transformation d’une ligne qui rétablit un test honnête.

IntermédiaireModule 125 min · 100 XP
Deux marches aléatoires générées indépendamment qui s’éloignent puis se rapprochent, un nuage de l’une contre l’autre qui se resserre en une droite convaincante, et le même nuage en différences premières qui s’effondre en un amas informe.

Voici un résultat reproductible en dix lignes, et il devrait inquiéter.

Prenez deux séries qui n’ont strictement aucun rapport entre elles : engendrées à partir de nombres aléatoires distincts, sur des lignes distinctes d’un script, sans la moindre entrée commune. Régressez l’une sur l’autre et testez la pente au seuil habituel de 5 %.

Sur 2 000 paires de 200 points, la pente ressort significative dans 82,8 % des cas.

Pas 5 %, ce qu’un test valide devrait donner sur des données sans lien. Quatre-vingt-trois pour cent. L’arithmétique est juste, les nombres aléatoires sont corrects, et les p-values sortent de la formule qui fonctionne ailleurs.

Ce qu’étaient ces séries

Chacune est une marche aléatoire : partir de zéro et ajouter à chaque pas un tirage indépendant d’une loi normale standard.

Xt=Xt−1+εt,εt∼N(0,1) indeˊpendantsX_t = X_{t-1} + \varepsilon_t, \qquad \varepsilon_t \sim N(0, 1) \text{ indépendants}

Rien n’y est caché. Deux séries construites sur des tirages séparés sont indépendantes par construction, et aucune contemplation ne rendra l’une informative sur l’autre.

Pourquoi le test échoue

Une marche aléatoire n’a aucun niveau où revenir. Quelle que soit la valeur atteinte, le pas suivant repart de là plutôt que d’une position de repos, si bien que l’écart s’accumule au lieu de se compenser.

Cela se voit sur une variance qui croît avec le temps. Mesurée sur 3 000 réplications :

instant ttvariance de XtX_t
5048,9
200194,1
800757,4

À peu près tt lui-même, ce qui est la réponse théorique : la somme de tt pas indépendants de variance unitaire a pour variance tt.

Imaginez maintenant deux telles séries sur 200 points. Chacune part quelque part et y reste un moment, parce que s’éloigner est facile et revenir ne l’est pas. Sur toute fenêtre finie, deux séries errantes dérivent très souvent dans une direction cohérente l’une par rapport à l’autre, et le nuage de points de l’une contre l’autre ressemble à une droite.

La régression n’a aucun moyen d’en tenir compte. Elle a été construite en supposant des observations indépendantes : elle compte 200 points de dérive partagée comme 200 éléments de preuve indépendants. Ils en valent plutôt un.

Une seule paire ne prouverait rien : vous seriez en droit de supposer qu’on vous a montré celle qui s’alignait par chance. La figure ci-dessous montre donc une paire et, à côté, le taux de rejet sur quatre cents autres tirées de la même façon. Tirez une autre paire autant de fois que vous voulez. Passez ensuite aux différences premières : ce sont les mêmes paires, rien n’a changé dans les données, et le taux tombe de quatre sur cinq à un sur vingt.

Interactif : deux séries sans aucun rapport

Nombres aléatoires distincts, aucune entrée commune. Tirez une autre paire.

Les deux séries

L’une contre l’autre

|t| sur la pente
4.41
R carré
0.090
Au seuil de 5 %
significatif
Sur 400 paires
81.8%

|t| vaut 4.41 pour une valeur critique de 1.972 : cette paire est donc significative, et sur 400 paires indépendantes le test rejette 81.8% du temps, là où un test valide sur des données sans rapport devrait rejeter 5 %. Aucune des deux séries ne connaît l’existence de l’autre. La régression compte 200 points de dérive commune comme 200 preuves indépendantes, alors qu’elles en valent presque une : une marche n’a pas de niveau où revenir, sa variance croît avec le temps, et deux marches passent de longues périodes à dériver de concert. Passez maintenant aux différences premières.

La stationnarité, énoncée

Une série est stationnaire quand son comportement statistique ne dépend pas du moment où on la regarde. La version stricte dit que la loi jointe de tout bloc d’observations est inchangée par décalage temporel. La version utilisée en pratique, dite faible ou de covariance, demande trois choses :

  1. la moyenne E[Xt]=μE[X_t] = \mu ne dépend pas de tt
  2. la variance Var(Xt)=σ2\mathrm{Var}(X_t) = \sigma^2 ne dépend pas de tt
  3. la covariance Cov(Xt,Xt+k)=γk\mathrm{Cov}(X_t, X_{t+k}) = \gamma_k ne dépend que de l’écart kk, et non de l’endroit où se place la fenêtre

La marche aléatoire échoue aux deux dernières. Sa variance vaut tt, et sa structure de covariance se déplace avec la fenêtre.

Pourquoi cela compte davantage pour l’inférence que pour la description : toute estimation emprunte de la force à l’ensemble des observations, ce qui n’a de sens que si ces observations décrivent le même processus. Quand le niveau erre, une moyenne sur la fenêtre est une moyenne sur des mondes différents, et un intervalle de confiance autour d’elle décrit une quantité qui n’a jamais existé.

La réparation, et son coût

Une marche aléatoire est la somme cumulée de ses pas : prendre les différences premières les restitue.

∇Xt=Xt−Xt−1=εt\nabla X_t = X_t - X_{t-1} = \varepsilon_t

Ces pas sont indépendants, de moyenne nulle et de variance constante, exactement les conditions dont le test a besoin. Régresser les mêmes 2 000 paires en différences premières donne un taux de significativité de 4,2 %, contre les 5 % qu’un test valide doit produire.

Le coût n’est pas nul, et mieux vaut l’énoncer que l’enfouir. Le modèle différencié relie les variations d’une série aux variations de l’autre. Si la question portait sur les niveaux, elle a été remplacée par une autre question, et la réponse doit être présentée comme la réponse à celle-là.

La différenciation n’est pas non plus un remède universel. Elle retire une tendance stochastique, mais appliquée à une série déjà stationnaire elle ajoute du bruit pour rien. Une tendance déterministe droite se traite mieux en l’ajustant puis en la soustrayant. Une variance qui croît multiplicativement appelle d’abord un logarithme.

L’habitude que cela doit laisser

Davantage de données ne vous sauve pas ici. Le taux de rejet fallacieux ne baisse pas quand la série s’allonge : il monte, parce qu’une fenêtre plus longue laisse aux deux séries plus de place pour errer. C’est la signature d’un biais et non d’un bruit, et c’est la même forme de problème que la confusion : une propriété de la façon dont les données sont nées, pas de leur quantité.

La première question sur toute série est donc la stabilité de son comportement dans le temps, et le premier outil honnête est un graphique. Un niveau errant ou une dispersion qui s’élargit se voient en général. Des tests formels existent, mais leur puissance est faible contre des alternatives lentes : un test qui ne rejette pas est une preuve faible de stationnarité, pas un feu vert.

Ce que cela prépare

La stationnarité est la condition qui donne un sens au reste de la boîte à outils. La question suivante est ce que cette boîte mesure alors : si une série est stationnaire, sa dépendance à son propre passé est une chose stable et estimable, et cette dépendance est à la fois ce qui rend la prévision possible et ce qui rend les écarts-types usuels faux d’un facteur calculable.

Références et lectures complémentaires

  • Rob J Hyndman, George Athanasopoulos, Forecasting: Principles and Practice, OTexts, 2014source ↗
  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Débloquez tout le parcours

Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.