Aller au contenu
Kudos AI
Read in English
Fondements de l’apprentissage statistique

Qu’est-ce que l’apprentissage statistique ?

Le cadre commun à tout modèle prédictif : estimer une fonction inconnue f à partir des données, la séparation entre erreur réductible et irréductible, et pourquoi prédiction et inférence tirent dans des directions opposées.

7 min de lectureKudos AI

Prérequis : Les probabilités à partir de zéro

La barre d’erreur descendant sur un plancher de bruit de 0,25 et s’y arrêtant net, aussi loin que l’ajustement soit amélioré.

Tout modèle supervisé de ce site - régression linéaire, arbres, réseaux de neurones - est une réponse à la même question, posée dans la même notation. Avant de comparer les méthodes, il vaut la peine d’énoncer cette question exactement, car elle vous dit aussi quelle part de votre erreur vous pouvez espérer supprimer et quelle part vous restera quelle que soit la qualité de votre méthode.

A. Le cadre

Nous observons une réponse YY et pp prédicteurs X=(X1,X2,…,Xp)X = (X_1, X_2, \dots, X_p). Nous supposons qu’il existe une relation entre eux, écrite sous la forme générale

Y=f(X)+ε.Y = f(X) + \varepsilon .

Ici ff est une fonction fixe mais inconnue représentant l’information systématique que XX apporte sur YY, et ε\varepsilon est un terme d’erreur aléatoire, indépendant de XX, de moyenne nulle.

L’apprentissage statistique est l’ensemble des approches permettant d’estimer ff.

L’estimation se note f^\hat f, et la prédiction qu’elle produit est Y^=f^(X)\hat Y = \hat f(X).

B. Erreur réductible et erreur irréductible

Supposons un instant que f^\hat f et XX soient fixés. À quel point Y^\hat Y est-il faux comme prédiction de YY ? Suivant James et al., l’erreur quadratique espérée se décompose en deux morceaux conceptuellement distincts :

E[(Y−Y^)2]=[f(X)−f^(X)]2⏟reducible+Var⁡(ε)⏟irreducible.\mathbb{E}\big[(Y - \hat Y)^2\big] = \underbrace{\big[f(X) - \hat f(X)\big]^2}_{\text{reducible}} + \underbrace{\operatorname{Var}(\varepsilon)}_{\text{irreducible}} .

Le premier terme est réductible : f^\hat f n’est pas une estimation parfaite de ff, et nous pouvons réduire cet écart en choisissant une meilleure méthode ou en réunissant davantage de données.

Le second terme est irréductible, et c’est celui qui compte. Même avec une estimation parfaite - même si f^=f\hat f = f exactement - la prédiction resterait fausse de ε\varepsilon, puisque YY dépend de ε\varepsilon et que ε\varepsilon est par définition imprévisible à partir de XX.

Pourquoi l’erreur irréductible est-elle supérieure à zéro ? Deux raisons, toutes deux à intérioriser. D’abord, ε\varepsilon peut contenir des variables non mesurées qui aideraient à prédire YY - comme nous ne les avons pas mesurées, aucun ff construit sur XX ne peut les utiliser. Ensuite, il peut contenir une variation authentiquement non mesurable : les mêmes entrées, deux jours différents, ne produisent tout simplement pas des sorties identiques.

La conséquence pratique est un plafond dur. Var⁡(ε)\operatorname{Var}(\varepsilon) est une borne supérieure sur ce que peut atteindre n’importe quel modèle, et elle est presque toujours inconnue en pratique. Un modèle qui semble la dépasser n’est pas un triomphe : c’est le signe que vous mesurez l’erreur de test sur des données que le modèle a déjà vues.

C. Prédiction contre inférence

Il y a deux raisons d’estimer ff, et elles tirent en sens contraires.

Pour la prédiction, seul importe que Y^\hat Y soit proche de YY. L’estimation f^\hat f peut être une boîte noire complète - vous ne l’inspecterez jamais - pourvu qu’elle soit exacte.

Pour l’inférence, vous voulez comprendre la relation : quels prédicteurs comptent réellement, si chacun élève ou abaisse la réponse, si un résumé linéaire simple suffit. Là, f^\hat f ne peut pas être une boîte noire, car la forme du modèle est la réponse.

Cette tension revient sans cesse :

PrédictionInférence
ObjectifY^\hat Y exactComprendre ff
Modèle préféréSouple, éventuellement opaqueRestrictif, interprétable
Choix typiqueEnsembles, réseaux de neuronesModèles linéaires et linéaires généralisés

Un modèle choisi uniquement pour son exactitude sera souvent inexplicable, et un modèle choisi pour l’explication laissera souvent de l’exactitude sur la table. Savoir laquelle des deux tâches vous accomplissez est un préalable à tout choix sensé.

D. Estimation paramétrique et non paramétrique

En gros, il existe deux stratégies pour produire f^\hat f.

Les méthodes paramétriques réduisent le problème à l’estimation d’un nombre fixe de valeurs. On suppose d’abord une forme fonctionnelle - au plus simple, que ff est linéaire :

f(X)=β0+β1X1+β2X2+⋯+βpXp,f(X) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \dots + \beta_p X_p ,

et il ne reste alors qu’à estimer les p+1p+1 coefficients plutôt qu’une fonction pp-dimensionnelle arbitraire. C’est une simplification énorme. Le risque est tout aussi clair : si le vrai ff est loin d’être linéaire, aucun choix de coefficients ne l’ajustera, et le modèle est faux d’une manière que davantage de données ne corrigera pas.

Les méthodes non paramétriques ne font pas cette hypothèse et laissent les données déterminer la forme. Elles peuvent ajuster une gamme bien plus large de fonctions vraies, mais comme elles ne réduisent pas le problème à quelques paramètres, elles exigent nettement plus d’observations pour fixer la forme de façon fiable.

E. Pourquoi la souplesse n’est pas gratuite

On serait tenté d’en conclure que les méthodes non paramétriques souples sont tout simplement meilleures. Elles ne le sont pas, pour deux raisons.

D’abord, comme on l’a dit, elles sont plus gourmandes en données. Ensuite - et c’est moins évident - une méthode très souple peut suivre le bruit ε\varepsilon de l’échantillon d’entraînement comme s’il s’agissait de signal. L’ajustement aux données dont vous disposez paraît superbe pendant que la performance sur des données jamais vues se dégrade.

La figure trace des courbes schématiques, et non les ajustements polynomiaux ci-dessous : à mesure que vous augmentez la Complexité du modèle, l’erreur d’entraînement baisse régulièrement tandis que l’erreur de test finit par remonter.

Interactif : le compromis biais-variance

Erreur d’entraînement contre erreur de test à mesure que la complexité augmente.

0.00.51.0bruit irréductiblecomplexité du modèle →
Erreur de testErreur d’entraînementcomplexité optimale
Régime
Bon ajustement
Erreur d’entraînement
0.25
Erreur de test
0.55

Proche du point idéal : l’erreur de test est proche de son minimum.

L’erreur d’entraînement diminue toujours à mesure que le modèle devient plus flexible : c’est donc un guide trompeur. L’erreur de test vaut biais² + variance + bruit irréductible : elle atteint son minimum là où les deux forces s’équilibrent, puis remonte lorsque le modèle s’ajuste au bruit. Ajoutez des données (augmentez la taille de l’échantillon) et le terme de variance diminue, déplaçant le point idéal vers une complexité plus élevée et abaissant toute la courbe de test.

Ce qui suit le démontre sur des données dont la vérité est connue, ce qui permet de comparer l’ajustement à ff lui-même plutôt qu’à des observations bruitées :

Python

S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.

Son exécution affiche :

degree  1:  training MSE 0.1985   error vs true f 0.2465
degree  3:  training MSE 0.0542   error vs true f 0.0235
degree 15:  training MSE 0.0258   error vs true f 730.5159

Lisez les deux colonnes l’une contre l’autre. L’EQM d’entraînement décroît de façon monotone avec la souplesse - le degré 15 ajuste les points observés mieux que les deux autres, à 0.02580.0258. Pourtant son erreur face au vrai ff vaut 730.5730.5 : non pas marginalement pire que le 0.02350.0235 du degré 3, mais environ trente mille fois pire.

Cette explosion mérite d’être comprise et pas seulement constatée. Un polynôme de degré 15 ajusté sur 25 points dispose d’assez de liberté pour se faufiler à travers le bruit, et les ondulations nécessaires deviennent violentes près des bords de l’intervalle, là où le moins de points le contraignent. Évaluées sur la grille dense, ces excursions de bord dominent la moyenne. C’est un mode de défaillance réel et bien connu des ajustements polynomiaux de degré élevé, non un artefact de la graine aléatoire.

Le degré 1 montre pendant ce temps la défaillance inverse : son erreur d’entraînement est bien pire que celle du degré 15, mais il est honnête à ce sujet - l’erreur face à la vérité, 0.24650.2465, est à peu près égale à son erreur d’entraînement, car une droite est trop rigide pour poursuivre le bruit. Elle est simplement la mauvaise forme pour une sinusoïde.

Le degré 3 l’emporte sur la seule colonne qui compte. Cet écart entre « ajuster l’échantillon » et « capturer la vérité » est le phénomène central de la discipline, et il admet une décomposition précise.

À retenir

  • L’apprentissage statistique estime un ff inconnu dans Y=f(X)+εY = f(X) + \varepsilon.
  • L’erreur de prédiction se scinde en une part réductible, que de meilleures méthodes peuvent réduire, et une part irréductible Var⁡(ε)\operatorname{Var}(\varepsilon), que rien ne peut réduire.
  • L’erreur irréductible existe à cause de variations non mesurées et non mesurables ; c’est un plafond dur sur l’exactitude de tout modèle.
  • La prédiction favorise les modèles souples et opaques ; l’inférence favorise les modèles restrictifs et interprétables. Décidez d’abord ce que vous faites.
  • Les méthodes paramétriques supposent une forme et estiment peu de paramètres ; les méthodes non paramétriques supposent moins mais exigent bien plus de données.
  • Davantage de souplesse améliore toujours l’erreur d’entraînement et, au-delà d’un certain point, dégrade l’exactitude sur données nouvelles.

La suite

Cette dernière observation mérite un compte rendu exact plutôt qu’une anecdote. L’erreur réductible se scinde elle-même en deux morceaux concurrents - l’un qui diminue à mesure que les modèles gagnent en souplesse, l’autre qui augmente - et c’est leur somme que vous payez réellement. C’est Le compromis biais-variance.

Références et lectures complémentaires

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

7 min de lectureApprentissage supervisé

La régression linéaire à partir des premiers principes

Dériver les coefficients des moindres carrés en différenciant la somme des carrés des résidus, puis mener à la main un ajustement complet sur cinq observations : coefficients, valeurs ajustées, résidus, RSS et R², chacun vérifié numériquement.

StatistiqueApprentissage automatiqueMathématiques
8 min de lectureFondements des probabilités

Les probabilités à partir de zéro : le langage de l’incertitude

Construire les probabilités depuis la base : les mondes possibles, l’univers, les deux axiomes fondamentaux, puis les règles d’addition et de multiplication, chacune démontrée plutôt qu’affirmée, avec des exemples numériques résolus.

ProbabilitéMathématiquesIntelligence artificielle
6 min de lectureFondements des probabilités

Le théorème de Bayes et la mise à jour des croyances

Démontrer le théorème de Bayes à partir de la définition de la probabilité conditionnelle, puis résoudre deux fois l’exemple du taux de base qui trompe presque tout le monde : une fois avec la formule, une fois par simple dénombrement.

ProbabilitéMathématiquesIntelligence artificielle
← Retour à tous les articles