Aller au contenu
Kudos AI

Analyse en composantes principales

Une technique qui réexprime les données dans de nouvelles coordonnées non corrélées, ordonnées selon la variance que chacune explique, permettant de réduire la dimension en ne gardant que les premières.

Comprendre Analyse en composantes principales

Les données en grande dimension sont souvent bien moins complexes que leur nombre de colonnes ne le suggère, parce que les variables évoluent ensemble. L’analyse en composantes principales trouve les directions selon lesquelles les données varient réellement. La première composante principale est la direction de plus grande variance ; la deuxième est la direction de plus grande variance restante orthogonale à la première ; et ainsi de suite.

Mathématiquement, ces directions sont les vecteurs propres de la matrice de covariance, et les valeurs propres correspondantes donnent la variance selon chacune. Comme les vecteurs propres d’une matrice symétrique sont orthogonaux, les nouvelles coordonnées sont non corrélées par construction, ce qui est souvent utile en soi quand les variables d’origine sont fortement colinéaires.

La réduction de dimension découle de l’ordonnancement. Les composantes étant triées par variance expliquée, les premières représentent fréquemment l’essentiel du total, et le reste peut être écarté avec une perte modeste. La proportion de variance expliquée par chaque composante, tracée en fonction du numéro de composante, est l’outil standard pour décider combien en conserver. James et ses coauteurs décrivent la lecture d’un coude sur ce graphique, notant pour un jeu de données que le coude situé après la septième composante environ suggère peu de bénéfice à en examiner davantage.

Le coût principal est l’interprétabilité. Une composante principale est une combinaison pondérée de toutes les variables d’origine, elle correspond donc rarement à quelque chose de nommable. L’ACP suppose aussi que la structure intéressante est linéaire et alignée sur une variance élevée, ce qui n’est nullement garanti : une direction de faible variance peut être exactement celle qui sépare les classes, et l’ACP est non supervisée, elle ignore donc et n’a cure de la cible de prédiction finale.

Comment calculer

Σ vₖ = λₖ vₖ, PVEₖ = λₖ / Σⱼ λⱼ

où

Σ
la matrice de covariance des données (standardisées)
vₖ
la direction de la k-ième composante principale, vecteur propre de Σ
λₖ
la variance selon cette direction, sa valeur propre
PVEₖ
la proportion de variance expliquée par la composante k

Exemple : Analyse en composantes principales

Supposons que la taille en centimètres et la taille en pouces soient toutes deux enregistrées. Elles sont parfaitement corrélées, les données se trouvent donc sur une droite dans un plan. L’ACP trouve que la première composante suit cette droite et explique pratiquement toute la variance, tandis que la seconde n’en explique presque aucune. Une dimension s’est révélée redondante.

Avec cent questions d’enquête corrélées, les dix premières composantes pourraient expliquer ensemble 80 % de la variance. Remplacer les cent colonnes par ces dix perd un cinquième de la variabilité mais retire quatre-vingt-dix pour cent des colonnes, et les modèles ajustés en aval sur les composantes sont bien moins enclins au surapprentissage.

La standardisation importe avant tout cela. L’ACP maximise la variance, et la variance dépend des unités : une variable mesurée en mètres et une autre en millimètres ne sont pas comparables. Sans standardisation, la première composante suivra simplement la variable qui se trouve avoir la plus grande échelle numérique.

Questions fréquentes

Combien de composantes faut-il conserver ?

Il n’existe pas de règle exacte. Les approches courantes consistent à garder assez de composantes pour atteindre une proportion cumulée de variance expliquée visée, ou à chercher un coude sur l’éboulis des valeurs propres, là où les composantes supplémentaires cessent de contribuer significativement.

Pourquoi faut-il standardiser les variables au préalable ?

Parce que l’ACP maximise la variance, qui dépend de l’échelle. Une variable non standardisée à grande étendue numérique dominera la première composante uniquement à cause de ses unités, non parce qu’elle porte davantage d’information.

L’ACP peut-elle nuire à la performance prédictive ?

Oui. L’ACP est non supervisée et ignore la réponse : elle peut écarter une direction de faible variance qui se trouve être très prédictive. Elle réduit la dimension et la colinéarité ; elle ne sélectionne pas les variables les plus utiles à la prédiction.

En résumé

L’ACP fait tourner les données sur des axes non corrélés ordonnés par variance expliquée, permettant de conserver l’essentiel de la variabilité en bien moins de dimensions. Elle coûte l’interprétabilité, suppose une structure linéaire, et, étant non supervisée, peut écarter précisément la direction dont un modèle en aval avait besoin.