Comprendre A priori conjugué
La règle de Bayes multiplie un a priori par une vraisemblance et renormalise. En général le résultat n’a pas de forme close et demande une intégration numérique ou de l’échantillonnage. Un a priori conjugué est choisi pour que la multiplication garde la réponse dans une famille à laquelle l’a priori appartient déjà, auquel cas la mise à jour se réduit à changer les paramètres de la famille.
Le couple le plus connu est bêta et Bernoulli. Un a priori bêta de paramètres a et b, mis à jour sur c succès et l échecs, devient une bêta de paramètres a + c et b + l. Rien n’est intégré et rien n’est approché. Le même schéma se répète ailleurs : Dirichlet avec la catégorielle, gamma avec Poisson, gaussienne avec une gaussienne de variance connue.
Lire les paramètres comme des pseudo-effectifs est ce qui rend l’a priori honnête. Un a priori Bêta(1, 1) est uniforme et vaut deux observations imaginaires, une de chaque sorte ; un a priori Bêta(50, 50) en vaut cent, et dominera un petit échantillon. La force d’une croyance et sa direction sont deux réglages distincts, et les paramètres nomment les deux.
La conjugaison est choisie pour la tractabilité, et c’est un coût réel autant qu’une commodité. Si l’a priori honnête n’appartient pas à la famille conjuguée - bimodal, disons, ou avec une coupure franche - l’y forcer pour garder une arithmétique élégante est une erreur de modélisation. Avec l’échantillonnage moderne, l’arithmétique n’est plus la contrainte qu’elle était.
Comment calculer
\text{Beta}(a, b) \times \text{Binomial}(c, l) \;\propto\; \text{Beta}(a + c,\; b + l), \qquad \mathbb{E}[\theta \mid \mathbf{d}] = \frac{a + c}{a + b + c + l}
où
- a, b
- pseudo-effectifs a priori de succès et d’échecs
- c, l
- succès et échecs observés
Exemple : A priori conjugué
Déballez 25 bonbons et trouvez 18 cerises. Le maximum de vraisemblance rapporte 18/25 = 0,72. Avec un a priori uniforme Bêta(1, 1), l’a posteriori est Bêta(19, 8), de moyenne 19/27 = 0,703704 et de mode 18/25 = 0,72, soit la réponse du maximum de vraisemblance. La moyenne est tirée vers un demi ; le mode ne l’est pas.
Renforcez l’a priori et la traction grandit : Bêta(2, 2) donne une moyenne a posteriori de 20/29 = 0,689655, Bêta(5, 5) donne 23/35 = 0,657143, et Bêta(50, 50) donne 68/125 = 0,544. Les données n’ont pas changé ; seul le nombre d’observations imaginaires a changé.
Le cas d’échec est là où tout cela se justifie. Déballez un bonbon, trouvez une cerise, et le maximum de vraisemblance rapporte 1 : le citron vert n’est pas improbable mais impossible, et aucune évidence ultérieure ne peut être remultipliée. La moyenne a posteriori sous Bêta(1, 1) vaut 2/3, ce qui est exactement le lissage add-one. L’astuce standard et l’a priori uniforme sont le même calcul.
Questions fréquentes
Un a priori conjugué rend-il la réponse plus juste ?
Non. Il la rend plus facile à calculer. Un a priori conjugué qui trahit votre croyance donne un a posteriori net et faux, et sa netteté n’est un argument ni dans un sens ni dans l’autre.
Combien de données faut-il pour écraser l’a priori ?
À peu près autant que l’a priori vaut en pseudo-effectifs. Un a priori Bêta(1, 1) vaut deux observations et s’évanouit presque aussitôt ; un Bêta(50, 50) en vaut cent et déplace encore sensiblement la réponse après 25.
En résumé
Un a priori conjugué garde l’a posteriori dans la famille de l’a priori, si bien que la mise à jour est une arithmétique sur des pseudo-effectifs. Il est choisi pour la tractabilité plutôt que pour la vérité, et il explique pourquoi le lissage add-one, qui ressemble à une astuce, est la moyenne a posteriori sous un a priori uniforme.