Aller au contenu
Kudos AI
Read in English
Fondements des probabilités

Quelle mauvaise loi voulez-vous ?

Une cible bimodale, une gaussienne, et deux directions de la même divergence. Minimiser KL(P||Q) étale la gaussienne sur les deux modes avec presque aucune masse là où la cible se trouve réellement ; minimiser KL(Q||P) la pose sur un mode, à 0,6931 nats, soit ln 2 à quatre décimales, et ce n’est pas une coïncidence. Chaque ajustement est jugé catastrophique par l’autre critère, 2,0976 contre 15,2799.

4 min de lectureKudos AI

Prérequis : L’entropie et l’information

Une cible à deux bosses avec une seule cloche qui glisse dessus, d’abord étirée pour couvrir les deux bosses puis resserrée sur une seule, la divergence étant lue dans les deux sens.

La cible PP est un mélange équilibré de deux gaussiennes unitaires en −4-4 et +4+4. Sa moyenne vaut 00, son écart type 4.12314.1231, et elle n’a pour ainsi dire aucune probabilité au voisinage de sa propre moyenne.

Le modèle QQ est une gaussienne unique. Il ne peut pas représenter PP, ce qui est la situation ordinaire : la question est de savoir ce que « aussi proche que possible » veut dire.

La divergence de Kullback-Leibler donne deux réponses, parce qu’elle n’est pas symétrique.

A. Deux ajustements

D(P∥Q)=∫plog⁡pq,D(Q∥P)=∫qlog⁡qp.D(P \parallel Q) = \int p \log \frac{p}{q}, \qquad D(Q \parallel P) = \int q \log \frac{q}{p}.

Minimisez chacune sur la moyenne et l’écart type de QQ :

Critèremoyenne ajustéeécart type ajustévaleur
D(P∥Q)D(P \parallel Q)004.12314.12310,7236 nats
D(Q∥P)D(Q \parallel P)+3.9996+3.99961.00081.00080,6931 nats

Le premier ajustement couvre les deux modes. Son écart type, 4,1231, est exactement celui de PP lui-même, 1+16=17\sqrt{1 + 16} = \sqrt{17} : minimiser D(P∥Q)D(P \parallel Q) sur les gaussiennes égalise la moyenne et la variance de la cible, et ici cela place le centre au point où PP n’a presque aucune masse. Le second se pose sur un mode, à un millième près : moyenne 3,9996 pour un vrai mode en 4, écart type 1,0008 pour un vrai 1. Ces petits écarts viennent de la queue de l’autre composante, qui traverse faiblement le creux.

Les deux réponses sont correctes. Ce sont des réponses à des questions différentes.

Interactif : dans quel sens on prend la divergence

Les deux divergences en nats, intégrées sur toute la droite.

-8-4048P, la cibleQ, une gaussienne
KL(P || Q), cherche la moyenne
0.7236
KL(Q || P), cherche un mode
2.0976

Voici l’optimum direct, et c’est exactement l’égalisation des moments : Q prend la moyenne de P, 0, et son écart type, la racine de 17, 4.1231. Il couvre donc les deux modes et se centre là où P n’a presque aucune masse. La KL directe lui donne 0.7236 ; la KL inverse, qui fait payer à Q chaque zone où P est vide, donne au même Q 2.0976.

B. Pourquoi 0,6931

La valeur de la KL inverse vaut ln⁡2=0.6931\ln 2 = 0.6931 à quatre décimales, et ce n’est pas une coïncidence. Lorsque QQ se pose sur une composante, P≈12QP \approx \tfrac{1}{2}Q partout où QQ a de la masse, puisque l’autre composante n’y contribue presque rien. Donc

D(Q∥P)≈∫qlog⁡q12q=log⁡2.D(Q \parallel P) \approx \int q \log \frac{q}{\tfrac{1}{2} q} = \log 2.

Ce « presque » peut être rendu exact. Avec Q=N(4,1)Q = N(4, 1), la cible s’écrit p=12q (1+e−8x)p = \tfrac{1}{2} q \,(1 + e^{-8x}), donc

D(Q∥P)=ln⁡2−Eq ⁣[ln⁡(1+e−8x)],D(Q \parallel P) = \ln 2 - \mathbb{E}_q\!\left[\ln\left(1 + e^{-8x}\right)\right],

et la correction, la queue de l’autre composante qui traverse le creux, vaut environ 0.00010.0001. La valeur ajustée est 0.6930530.693053, contre ln⁡2=0.693147\ln 2 = 0.693147.

La pénalité pour avoir ignoré la moitié de la cible est, à cette miette près, le bit d’information nécessaire pour dire quelle moitié a été retenue. C’est une façon nette de voir ce que la KL inverse facture et ne facture pas : elle facture le fait de mettre de la masse là où la cible n’en a pas, et ne facture rien du tout pour ne pas couvrir les autres régions de la cible.

C. Chaque ajustement est un désastre pour l’autre mesure

jugé par D(P∥Q)D(P \parallel Q)jugé par D(Q∥P)D(Q \parallel P)
l’ajustement direct0,72362,0976
l’ajustement inverse15,27990,6931

L’ajustement inverse obtient 15,2799 en KL directe, vingt et une fois pire que les 0,7236 de l’ajustement direct. Ce n’est pas une petite préférence entre deux critères quasi équivalents ; les deux objectifs sont en désaccord sur le modèle utilisable.

L’asymétrie a une direction facile à retenir :

  • La KL directe, D(P∥Q)D(P \parallel Q), cherche la moyenne. L’intégrale est pondérée par pp : partout où PP a de la masse et QQ n’en a pas, le rapport p/qp/q explose. QQ est forcée de couvrir tout ce que PP couvre, au prix de couvrir beaucoup de ce que PP ne couvre pas.
  • La KL inverse, D(Q∥P)D(Q \parallel P), cherche le mode. L’intégrale est pondérée par qq : les régions où PP a de la masse et QQ n’en a pas ne coûtent rien. QQ est libre d’ignorer l’essentiel de PP, pourvu qu’elle évite de mettre de la masse là où PP n’en a pas.

D. Celle que vous utilisez déjà

Les deux servent quotidiennement, généralement sans que la direction soit énoncée.

  • Le maximum de vraisemblance est la KL directe. Minimiser l’entropie croisée face à la loi des données minimise D(P∥Q)D(P \parallel Q) à une constante près. C’est pourquoi un ajustement par maximum de vraisemblance s’étale : il est pénalisé pour chaque région des données qu’il ne couvre pas.
  • L’inférence variationnelle est la KL inverse. La borne inférieure de l’évidence minimise D(Q∥P)D(Q \parallel P), ce qui explique qu’une loi a posteriori variationnelle soit notoirement trop confiante et s’accroche à un seul mode.
  • La distillation, le RLHF et leurs proches choisissent aussi une direction, et ce choix se voit à ceci : l’élève hésite-t-il entre les options du maître, ou en choisit-il une ?

La règle pratique : si omettre une partie de la cible est l’erreur coûteuse, prenez la directe. Si affirmer des choses que la cible exclut est l’erreur coûteuse, prenez l’inverse. Et quand quelqu’un rapporte « la divergence KL » comme un seul nombre, la première question est dans quel sens elle a été prise.

Références et lectures complémentaires

  • David J. C. MacKay, Information Theory, Inference, and Learning Algorithms, Cambridge University Press, 2003source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

7 min de lectureInformation Theory

La borne qui est vraiment atteinte

L’entropie n’est pas un résumé de distribution mais un plancher que le meilleur code atteint à la dernière décimale, le supplément payé pour la mauvaise distribution est exactement la perte que tout classifieur minimise déjà, et l’information mutuelle pose un plafond dur sur tout ce qui suit un capteur. Trois résultats, chacun d’une netteté inhabituelle.

MathématiquesApprentissage automatique
10 min de lectureFondements des probabilités

L’entropie et l’information

Mesurer l’incertitude en bits : l’entropie de Shannon et pourquoi le logarithme est en base 2, le gain d’information déroulé sur une division, et comment l’entropie croisée et la divergence de Kullback-Leibler se rattachent à l’entropie et aux fonctions de perte qui entraînent les classifieurs.

Théorie de l'informationProbabilitéMathématiques
3 min de lectureFondements des probabilités

Les deux variables qui ressemblent à du bruit

Une variable qui en détermine une autre avec une corrélation d’exactement 0,0000000000, et un couple de variables dont chaque information mutuelle par paire avec la cible vaut exactement zéro alors que les deux ensemble la déterminent entièrement. Le filtrage univarié écarte les deux, et le second cas est celui qui compte : les variables qu’il supprime le sont parce qu’elles comptent.

Apprentissage automatiqueMathématiques
← Retour à tous les articles