Les moindres carrés par la dérivée
Minimiser la somme des carrés des résidus sous forme close, le sens de la formule de la pente, et pourquoi le R carré ne peut comparer des modèles de tailles différentes.
La régression linéaire est d’ordinaire présentée comme une formule à appliquer. On la comprend mieux comme la réponse à une question de calcul différentiel : quelle droite rend les erreurs au carré les plus petites ? Une fois la question posée ainsi, les coefficients tombent de deux dérivées et il ne reste rien à mémoriser.
L’objectif
Ajustez et mesurez le désajustement par la somme des carrés des résidus :
L’élévation au carré fait deux choses : elle empêche les erreurs positives et négatives de s’annuler, et elle fait de la RSS une fonction lisse et convexe, si bien qu’annuler les dérivées trouve le minimum global plutôt qu’un simple point stationnaire.
Dériver
Par rapport à l’ordonnée à l’origine :
en notant le résidu. La condition sur l’ordonnée à l’origine garantit que les résidus somment exactement à zéro - de façon équivalente, que la droite ajustée passe par le point des moyennes . Ce n’est ni une coïncidence ni une convention ; c’est ce que dit cette seule dérivée.
Par rapport à la pente, et en substituant :
Exemple résolu
Cinq points : , .
, . Alors
donc
Les résidus valent - et ils somment exactement à , comme la dérivée en l’ordonnée à l’origine le promettait. Vérifiez-le vous-même ; cette somme est le moyen le plus rapide d’attraper une erreur de calcul.
S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.
Le R², et son piège
Ici et , donnant - la droite explique 99,73 % de la variation de .
Pourquoi le ne peut pas classer des modèles de tailles différentes. Ajouter n’importe quel prédicteur, fût-ce du bruit pur, donne aux moindres carrés strictement plus de liberté pour réduire la RSS. La RSS ne peut donc jamais augmenter quand on ajoute un prédicteur, et le ne peut jamais décroître. Une métrique qui récompense toujours davantage de prédicteurs ne peut pas servir à décider si un prédicteur mérite d’être gardé. Les comparaisons exigent quelque chose qui pénalise la taille - ajusté, un critère d’information, ou une estimation hors échantillon par validation croisée.
Voyez les carrés. La figure ci-dessous utilise cinq autres points, , bien plus dispersés que ceux de l’exemple traité. Chaque résidu y est tracé avec son carré, si bien que la RSS (SCR dans la figure) est leur aire totale, mise en regard de la TSS (SCT) que laisse la moyenne constante. Déplacez Ordonnée à l’origine et Pente, ou cliquez sur Aller à la droite des moindres carrés : on arrive à , où , et , et les résidus ont de nouveau une somme exactement nulle.
Interactif : les carrés que minimisent les moindres carrés
La SCR est l’aire totale des carrés.
- SCR
- 4.05
- SCT
- 6
- R²
- 0.325
- Somme des résidus
- -0.5
Les carrés couvrent SCR = 4.05, donc R² vaut 0.325. Inclinez et déplacez la droite pour réduire l’aire totale, et regardez la barre empilée descendre vers son plancher de 2,40, ou allez-y directement.
Voyez-le bouger. Les moindres carrés sont un membre d’une famille plus large : faites glisser le paramètre et regardez une log-vraisemblance culminer exactement là où l’estimateur atterrit.
Interactif : gravir la vraisemblance
Un échantillon fixe de 40 comptages d’événements observés.
- λ choisi
- 0.80
- Log-vraisemblance
- -72.9
- MLE (moyenne empirique)
- 1.55
Le maximum de vraisemblance demande : quel λ rend les données observées les plus probables ? Déplacez λ et la log-vraisemblance monte vers un pic unique, exactement à la moyenne empirique (1.55), et les barres ajustées s’alignent alors sur les fréquences observées. Chaque GLM de ce site est cette même montée, simplement en plus de dimensions.
Essayez-le en direct. Ajustez un modèle linéaire généralisé en itérant jusqu’à convergence la même étape d’équation normale :
S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.
Avant le quiz
Sachez dire ce que garantit , et pourquoi le est le mauvais outil pour la sélection de modèles. Dérivation complète : La régression linéaire à partir des premiers principes.
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.
Débloquez tout le parcours
Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.