Aller au contenu
Kudos AI
Read in English
Apprentissage non supervisé

La direction qui change quand vous changez d’unité

Douze personnes, deux mesures, et trois premières composantes principales différentes : en millimètres la réponse est presque uniquement la taille, en mètres presque uniquement le poids, et en centimètres un mélange équilibré - la corrélation restant fixée à 0,9500 dans les trois cas. Ce que cela dit de ce que l’ACP maximise, pourquoi une proportion de variance expliquée de 99,999 % peut être un énoncé sur les mètres plutôt que sur les personnes, et ce que la standardisation choisit réellement.

6 min de lectureKudos AI

Prérequis : Apprentissage non supervisé : de la structure sans étiquettes

Un nuage de points traversé par une direction qui tourne, les segments résiduels vers cette droite qui rétrécissent à mesure qu’elle se fixe, puis le même nuage redessiné sur un axe étiré où la direction fixée bascule vers une autre.

Voici douze personnes, mesurées chacune deux fois.

Taille168172175177180181183185186188191193
Poids586361687066747278758280

Taille en centimètres, poids en kilogrammes. Demandez à l’analyse en composantes principales la direction unique le long de laquelle ces personnes varient le plus, et elle répond

ϕ1=(0.7054,  0.7088),\phi_1 = (0.7054,\; 0.7088),

un mélange presque exactement équilibré des deux mesures, portant 97,500 % de la variance totale.

Enregistrez maintenant les tailles en millimètres. Personne n’a grandi. La réponse devient ϕ1=(0.9955,  0.0951)\phi_1 = (0.9955,\; 0.0951) : presque uniquement la taille, portant 99,904 %.

Enregistrez-les en mètres. La réponse devient ϕ1=(0.0095,  1.0000)\phi_1 = (0.0095,\; 1.0000) : presque uniquement le poids, portant 99,999 %.

Trois directions différentes, trois récits différents de ce qui fait varier ce groupe, et pas un seul nombre des données sous-jacentes n’a changé. La corrélation entre taille et poids vaut 0,9500 dans les trois cas, parce que la corrélation est sans unité et que la première composante principale ne l’est pas.

A. Ce que la méthode maximise réellement

La première composante principale est la direction ϕ1\phi_1, de norme un, qui maximise la variance des données projetées :

max⁡∥ϕ∥=1Var⁡ ⁣(ϕ⊤x).\max_{\|\phi\|=1} \operatorname{Var}\!\left(\phi^{\top} x\right).

La figure prend six points sans unités plutôt que les douze personnes, pour montrer l’objectif lui-même : faites tourner la Direction de la droite, et la direction qui capte le plus de variance est celle qui laisse la plus petite distance au carré à la droite.

Interactif : ce qu’une projection garde, et ce qu’elle perd

Six points, une droite, tous les angles possibles.

Variance conservée
2.0000
Distance au carré perdue
6.1667
Leur somme
8.1667

On conserve 2.0000 de variance. Regardez surtout la troisième mesure : les deux premières évoluent en sens inverse et leur somme ne change jamais, quel que soit l’angle. Maximiser la variance conservée et minimiser la distance perpendiculaire à la droite ne sont pas deux critères qui se trouvent concorder : c’est un seul critère écrit de deux façons. Aucun angle ne bat la composante principale ; essayez d’en trouver un.

La contrainte ∥ϕ∥=1\|\phi\| = 1 est ce qui rend le problème bien posé, et c’est aussi par là qu’entrent les unités. Fixer la norme de ϕ\phi à un revient à traiter un pas de taille un sur la première coordonnée comme un pas de taille un sur la seconde. En centimètres et kilogrammes, l’affirmation se défend : un centimètre et un kilogramme représentent des fractions comparables de la dispersion du groupe. En millimètres et kilogrammes, elle dit qu’un millimètre de taille compte autant qu’un kilogramme de poids, ce que personne ne soutiendrait à voix haute. La méthode le fait en silence, puis répond à la question qu’on lui a réellement posée.

Cela se lit dans les covariances. La taille varie de

5790.2 mm2,57.9015 cm2,0.005790 m2,5790.2\ \text{mm}^2, \qquad 57.9015\ \text{cm}^2, \qquad 0.005790\ \text{m}^2,

selon la seule manière dont elle a été notée, tandis que le poids reste à 58.4470 kg258.4470\ \text{kg}^2. Une variance est en unités au carré : changer une unité d’un facteur dix change une variance d’un facteur cent. La direction de plus grande variance suit la variable enregistrée dans la plus petite unité.

B. La proportion qui n’explique rien

La réponse en mètres mérite qu’on s’y arrête. Sa première composante porte 99,999 % de la variance, le genre de chiffre qui clôt une analyse : un nombre en remplace deux sans perte notable, et l’éboulis présente après la première composante une falaise qui ne saurait être plus nette.

C’est un énoncé sur les mètres. La taille en mètres varie de 0,0058, le poids en kilogrammes de 58,45, et un rapport de dix mille pour un signifie qu’il ne reste presque rien à porter à la seconde direction. La composante « explique » 99,999 % d’un total que le poids constitue à lui seul ou presque. Si les tailles avaient été en mètres et les poids en grammes, le même calcul aurait déclaré que toute l’histoire tenait dans la taille.

Une proportion de variance expliquée ne mesure une concentration qu’une fois les variables placées sur une base que vous êtes prêt à défendre. Avant cela, elle mesure votre tableur.

C. Ce que la standardisation choisit

Le remède habituel est de standardiser : diviser chaque variable par son propre écart type avant l’ACP, ce qui revient à faire l’ACP sur la matrice de corrélation. Chaque variable varie alors d’exactement un, et plus aucune unité ne subsiste pour incliner la réponse.

Pour ces douze personnes, cela donne

ϕ1=(0.7071,  0.7071),PVE=0.975002.\phi_1 = (0.7071,\; 0.7071), \qquad \text{PVE} = 0.975002.

Les deux nombres méritent un second regard. 0.70710.7071 vaut 1/21/\sqrt{2}, et ce n’est pas un hasard : avec deux variables standardisées, la matrice de corrélation porte des uns sur la diagonale et rr ailleurs, et ses vecteurs propres sont toujours (1,1)/2(1, 1)/\sqrt{2} et (1,−1)/2(1, -1)/\sqrt{2}, quel que soit rr. La direction était fixée avant que quiconque regarde les données. Seul le signe porte de l’information, et seulement sur le signe de rr.

La proportion est tout aussi déterminée : les valeurs propres valent 1+r1 + r et 1−r1 - r, donc

PVE=1+r2=1+0.9500042=0.975002,\text{PVE} = \frac{1 + r}{2} = \frac{1 + 0.950004}{2} = 0.975002,

c’est-à-dire la corrélation, réécrite. Sur deux variables standardisées, l’ACP retrouve ce qu’une corrélation disait déjà et n’ajoute rien. Ce n’est pas un argument contre la standardisation. C’est un rappel que la méthode n’a aucune source d’information propre : elle rend compte de la structure de covariance qu’on lui remet, et standardiser est une décision sur la structure de covariance à lui remettre.

D. Quand ne faut-il donc pas standardiser ?

Standardiser est justifié quand les variables mesurent des choses différentes dans des unités différentes, ce qui est le cas le plus fréquent. C’est une erreur quand les écarts d’échelle sont eux-mêmes le signal :

  • Intensités de pixels. Tous les canaux sont dans la même unité sur la même plage. Un canal qui varie à peine d’une image à l’autre est réellement peu informatif, et standardiser promeut son bruit au rang de structure.
  • Rendements d’actifs. Même unité partout, et un actif volatil est volatil. Standardiser efface précisément ce qu’une décomposition du risque cherche.
  • Mesures répétées d’une même grandeur, comme un spectre ou une série temporelle échantillonnée en de nombreux points. Les tailles relatives le long de l’axe font partie de la forme.

Le critère n’est pas statistique. Demandez si un pas d’une unité sur la variable A est comparable à un pas d’une unité sur la variable B. Si oui, laissez les données telles quelles. Si la question n’a même pas de sens, standardiser est la façon de refuser d’y répondre, et la réponse obtenue ensuite porte sur des corrélations plutôt que sur des grandeurs.

E. Ce que douze personnes nous apprennent

L’ACP est souvent présentée comme si elle trouvait une structure simplement présente, comme une régression trouve une pente simplement présente. Les trois réponses ci-dessus viennent d’un seul jeu de données et d’une seule méthode, et elles se contredisent complètement.

Ce que l’ACP trouve, c’est la direction de plus grande variance dans les coordonnées que vous avez fournies. Choisir ces coordonnées - millimètres ou mètres, brutes ou standardisées - est une décision de modélisation du même poids que le choix d’un prédicteur, et elle se prend qu’on la remarque ou non. La version honnête d’un rapport d’ACP dit quel choix a été fait et pourquoi, et le moyen le plus rapide de savoir s’il a compté est de faire l’autre choix et de regarder.

Références et lectures complémentaires

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

8 min de lectureApprentissage non supervisé

Apprentissage non supervisé : de la structure sans étiquettes

Ce qui change quand il n’y a pas de réponse à prédire : les composantes principales comme direction de variance maximale, les K-moyennes et les optima locaux où elles se figent, la classification hiérarchique et le saut qui décide de la réponse - et pourquoi aucun des choix requis ne peut être validé comme l’est un classifieur.

Apprentissage automatiqueStatistique
4 min de lectureTime Series

Un score qui perd contre ne rien faire

Un modèle des cinq plus proches voisins obtient 0,9983 en validation croisée aléatoire à cinq blocs sur une marche aléatoire, série dont les incréments sont par construction imprévisibles. Évalué en avançant dans le temps il obtient 0,6559, avec une RMSE 12,44 fois plus grande, et il perd contre la simple reconduction de la dernière valeur observée. C’est la découpe, non le modèle, qui a produit le premier nombre.

StatistiqueApprentissage automatique
8 min de lectureAnomaly Detection

Le détecteur qui ne se déclenche jamais est juste à 99,5 %

À un taux de base réaliste, le détecteur inerte gagne sur la justesse, une ROC de 0,9468 masque une file d’alertes fausse à 64 %, la distance à la moyenne se classe sous le hasard quand les anomalies siègent au centre, et vingt anomalies groupées se cachent les unes les autres de la méthode conçue pour les trouver.

Apprentissage automatiqueStatistique
← Retour à tous les articles