Aller au contenu
Kudos AI

Estimation par maximum de vraisemblance

Une méthode d’ajustement d’un modèle qui choisit les valeurs de paramètres rendant les données observées les plus probables.

Aussi appelé : EMV

Comprendre Estimation par maximum de vraisemblance

Le maximum de vraisemblance inverse la direction habituelle du raisonnement probabiliste. Ordinairement, un modèle fixé attribue des probabilités aux jeux de données possibles. Ici le jeu de données est fixé, puisqu’il a été observé, et ce sont les paramètres qui varient : la fonction de vraisemblance indique, pour chaque valeur candidate, à quel point les données observées auraient été probables sous cette valeur. L’estimation est la valeur qui la maximise.

En pratique, c’est la log-vraisemblance que l’on maximise. La vraisemblance d’observations indépendantes est un produit de nombreux petits nombres, qui déborde numériquement par le bas et se différencie mal. Prendre le logarithme convertit le produit en somme sans déplacer le maximum, puisque le logarithme est monotone.

James et ses coauteurs rendent explicite le lien avec les méthodes familières : le maximum de vraisemblance est l’approche générale employée pour ajuster la régression logistique et bien d’autres modèles non linéaires, et dans le cadre de la régression linéaire les moindres carrés en sont eux-mêmes un cas particulier. Minimiser l’erreur quadratique est ce à quoi le maximum de vraisemblance se réduit lorsque les erreurs sont supposées normales à variance constante.

La même identité le relie à l’apprentissage profond. Maximiser la log-vraisemblance des étiquettes observées est la même optimisation que minimiser l’entropie croisée : un réseau entraîné avec une perte d’entropie croisée fait donc de l’estimation par maximum de vraisemblance. C’est pourquoi les fonctions de perte employées en statistique et en apprentissage profond se ressemblent tant une fois écrites.

Comment calculer

θ̂ = argmax_θ Πᵢ P(xᵢ | θ) = argmax_θ Σᵢ log P(xᵢ | θ)

où

θ
les paramètres à estimer
xᵢ
la i-ème donnée observée
P(xᵢ | θ)
la probabilité (ou densité) de cette observation sous θ
θ̂
l’estimation par maximum de vraisemblance

Exemple : Estimation par maximum de vraisemblance

Une pièce est lancée 10 fois et tombe 7 fois sur face. En traitant les lancers comme indépendants de probabilité de face p inconnue, la vraisemblance est proportionnelle à p⁷(1 − p)³.

Maximiser la log-vraisemblance 7 log p + 3 log(1 − p) en annulant sa dérivée 7/p − 3/(1 − p) donne 7(1 − p) = 3p, d’où p̂ = 0,7. L’estimation est simplement la proportion observée, ce qui est rassurant.

L’exemple expose aussi la principale faiblesse de la méthode. Si la pièce était tombée sur face les 10 fois, le maximum de vraisemblance annoncerait p̂ = 1,0, affirmant que pile est impossible sur la foi de dix lancers. La régularisation ou un a priori bayésien est ce qui empêche ce genre de conclusion trop assurée à partir de petits échantillons.

Questions fréquentes

Quelle est la différence entre vraisemblance et probabilité ?

Ce sont la même fonction lue dans deux sens opposés. La probabilité fixe les paramètres et demande quelle est la probabilité de divers jeux de données ; la vraisemblance fixe les données observées et demande dans quelle mesure diverses valeurs de paramètres les expliquent. La vraisemblance n’est pas une loi de probabilité sur les paramètres et n’intègre pas à un.

Pourquoi maximiser le logarithme plutôt que la vraisemblance elle-même ?

Parce que le logarithme est strictement croissant, son maximum est au même endroit, tout en convertissant un produit de nombreuses petites probabilités en une somme numériquement stable et bien plus facile à différencier.

Quel est le rapport avec l’estimation bayésienne ?

Le maximum de vraisemblance n’utilise que la vraisemblance ; l’estimation bayésienne la multiplie par un a priori et travaille sur l’a posteriori obtenu. Le maximum de vraisemblance coïncide avec l’estimation bayésienne du maximum a posteriori lorsque l’a priori est uniforme.

En résumé

Le maximum de vraisemblance choisit les paramètres sous lesquels les données observées auraient été les plus probables. Il unifie les moindres carrés, la régression logistique et l’entraînement par entropie croisée, et sa tendance à l’excès de confiance sur de petits échantillons est exactement ce que la régularisation et les a priori existent pour tempérer.