Quelle mauvaise loi voulez-vous ?
Une cible bimodale, une gaussienne, et deux directions de la même divergence. Minimiser KL(P||Q) étale la gaussienne sur les deux modes avec presque aucune masse là où la cible se trouve réellement ; minimiser KL(Q||P) la pose sur un mode, à 0,6931 nats, soit ln 2 à quatre décimales, et ce n’est pas une coïncidence. Chaque ajustement est jugé catastrophique par l’autre critère, 2,0976 contre 15,2799.
Prérequis : L’entropie et l’information
La cible est un mélange équilibré de deux gaussiennes unitaires en et . Sa moyenne vaut , son écart type , et elle n’a pour ainsi dire aucune probabilité au voisinage de sa propre moyenne.
Le modèle est une gaussienne unique. Il ne peut pas représenter , ce qui est la situation ordinaire : la question est de savoir ce que « aussi proche que possible » veut dire.
La divergence de Kullback-Leibler donne deux réponses, parce qu’elle n’est pas symétrique.
A. Deux ajustements
Minimisez chacune sur la moyenne et l’écart type de :
| Critère | moyenne ajustée | écart type ajusté | valeur |
|---|---|---|---|
| 0,7236 nats | |||
| 0,6931 nats |
Le premier ajustement couvre les deux modes. Son écart type, 4,1231, est exactement celui de lui-même, : minimiser sur les gaussiennes égalise la moyenne et la variance de la cible, et ici cela place le centre au point où n’a presque aucune masse. Le second se pose sur un mode, à un millième près : moyenne 3,9996 pour un vrai mode en 4, écart type 1,0008 pour un vrai 1. Ces petits écarts viennent de la queue de l’autre composante, qui traverse faiblement le creux.
Les deux réponses sont correctes. Ce sont des réponses à des questions différentes.
Interactif : dans quel sens on prend la divergence
Les deux divergences en nats, intégrées sur toute la droite.
- KL(P || Q), cherche la moyenne
- 0.7236
- KL(Q || P), cherche un mode
- 2.0976
Voici l’optimum direct, et c’est exactement l’égalisation des moments : Q prend la moyenne de P, 0, et son écart type, la racine de 17, 4.1231. Il couvre donc les deux modes et se centre là où P n’a presque aucune masse. La KL directe lui donne 0.7236 ; la KL inverse, qui fait payer à Q chaque zone où P est vide, donne au même Q 2.0976.
B. Pourquoi 0,6931
La valeur de la KL inverse vaut à quatre décimales, et ce n’est pas une coïncidence. Lorsque se pose sur une composante, partout où a de la masse, puisque l’autre composante n’y contribue presque rien. Donc
Ce « presque » peut être rendu exact. Avec , la cible s’écrit , donc
et la correction, la queue de l’autre composante qui traverse le creux, vaut environ . La valeur ajustée est , contre .
La pénalité pour avoir ignoré la moitié de la cible est, à cette miette près, le bit d’information nécessaire pour dire quelle moitié a été retenue. C’est une façon nette de voir ce que la KL inverse facture et ne facture pas : elle facture le fait de mettre de la masse là où la cible n’en a pas, et ne facture rien du tout pour ne pas couvrir les autres régions de la cible.
C. Chaque ajustement est un désastre pour l’autre mesure
| jugé par | jugé par | |
|---|---|---|
| l’ajustement direct | 0,7236 | 2,0976 |
| l’ajustement inverse | 15,2799 | 0,6931 |
L’ajustement inverse obtient 15,2799 en KL directe, vingt et une fois pire que les 0,7236 de l’ajustement direct. Ce n’est pas une petite préférence entre deux critères quasi équivalents ; les deux objectifs sont en désaccord sur le modèle utilisable.
L’asymétrie a une direction facile à retenir :
- La KL directe, , cherche la moyenne. L’intégrale est pondérée par : partout où a de la masse et n’en a pas, le rapport explose. est forcée de couvrir tout ce que couvre, au prix de couvrir beaucoup de ce que ne couvre pas.
- La KL inverse, , cherche le mode. L’intégrale est pondérée par : les régions où a de la masse et n’en a pas ne coûtent rien. est libre d’ignorer l’essentiel de , pourvu qu’elle évite de mettre de la masse là où n’en a pas.
D. Celle que vous utilisez déjà
Les deux servent quotidiennement, généralement sans que la direction soit énoncée.
- Le maximum de vraisemblance est la KL directe. Minimiser l’entropie croisée face à la loi des données minimise à une constante près. C’est pourquoi un ajustement par maximum de vraisemblance s’étale : il est pénalisé pour chaque région des données qu’il ne couvre pas.
- L’inférence variationnelle est la KL inverse. La borne inférieure de l’évidence minimise , ce qui explique qu’une loi a posteriori variationnelle soit notoirement trop confiante et s’accroche à un seul mode.
- La distillation, le RLHF et leurs proches choisissent aussi une direction, et ce choix se voit à ceci : l’élève hésite-t-il entre les options du maître, ou en choisit-il une ?
La règle pratique : si omettre une partie de la cible est l’erreur coûteuse, prenez la directe. Si affirmer des choses que la cible exclut est l’erreur coûteuse, prenez l’inverse. Et quand quelqu’un rapporte « la divergence KL » comme un seul nombre, la première question est dans quel sens elle a été prise.
Références et lectures complémentaires
- David J. C. MacKay, Information Theory, Inference, and Learning Algorithms, Cambridge University Press, 2003source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.