Aller au contenu
Kudos AI

Entropie

Une mesure de l’incertitude d’une variable aléatoire, égale au nombre moyen de bits nécessaires pour encoder son issue.

Aussi appelé : Entropie de Shannon, Entropie informationnelle

Une distribution remodelée de l’uniforme au quasi certain, l’entropie en bits la suivant jusqu’à presque rien.

Comprendre Entropie

L’entropie quantifie ce que vous ignorez de l’issue d’une variable aléatoire. Si une variable prend toujours la même valeur, l’observer ne vous apprend rien et son entropie est nulle. Plus la probabilité est répartie uniformément sur les issues possibles, plus le résultat est incertain et plus l’entropie est élevée.

Les unités deviennent concrètes grâce au logarithme en base 2 : l’entropie compte des bits. Russell et Norvig rendent l’étalonnage explicite. Une pièce équilibrée a autant de chances de tomber d’un côté que de l’autre, et cela compte exactement pour 1 bit. Un dé équilibré à quatre faces vaut 2 bits, car deux bits sont nécessaires pour décrire l’un de quatre choix équiprobables. Une pièce truquée qui tombe sur face 99 % du temps porte bien moins d’incertitude, et son entropie doit être proche de zéro tout en restant positive.

La définition pondère la surprise de chaque issue, −log₂ p, par la fréquence réelle de cette issue. Les événements rares sont individuellement très surprenants mais contribuent peu parce qu’ils surviennent rarement ; les événements courants ne surprennent pas mais sont fréquents. L’entropie est la moyenne de cette surprise, et c’est pourquoi elle culmine à la distribution uniforme, où aucune issue ne peut être anticipée.

Ce n’est pas une simple métaphore sur l’information. Le théorème du codage de source de Shannon fait de l’entropie une limite dure : aucun encodage sans perte d’une source ne peut employer en moyenne moins de bits par symbole que l’entropie de cette source. La même quantité réapparaît partout en apprentissage automatique, dans le gain d’information qui divise les arbres de décision, dans la perte d’entropie croisée, et dans la divergence KL entre distributions.

Comment calculer

H(X) = − Σᵢ p(xᵢ) log₂ p(xᵢ)

où

H(X)
l’entropie de la variable aléatoire X, en bits
p(xᵢ)
la probabilité de l’issue xᵢ
log₂
logarithme en base 2, qui fait du bit l’unité
−
rend le résultat positif, puisque le logarithme d’une probabilité est négatif

Exemple : Entropie

Une pièce équilibrée a p = 0,5 pour chaque face, ce qui donne H = −(0,5 log₂ 0,5 + 0,5 log₂ 0,5) = 1 bit exactement. Un dé équilibré à quatre faces a quatre issues à p = 0,25, ce qui donne H = 2 bits, conformément à l’intuition que deux chiffres binaires identifient l’une de quatre options.

Prenez maintenant la pièce biaisée qui tombe sur face 99 % du temps. Calculer −(0,99 log₂ 0,99 + 0,01 log₂ 0,01) donne environ 0,0808 bit : proche de zéro, comme attendu, mais strictement positif, car la queue rare porte encore une surprise réelle quand elle survient.

La lecture en compression est directe. Une longue suite de lancers de la pièce biaisée peut être encodée en environ 0,081 bit par lancer en moyenne, plus de dix fois moins que le bit par lancer qu’un encodage naïf dépenserait, parce que la suite est très majoritairement composée de faces et que cette régularité peut être exploitée.

Questions fréquentes

Pourquoi y a-t-il un signe moins dans la formule ?

Les probabilités sont comprises entre 0 et 1, donc leurs logarithmes sont négatifs ou nuls. Le signe moins retourne la somme pour que l’entropie soit rapportée comme une quantité positive ou nulle.

Quelle est la différence entre entropie et entropie croisée ?

L’entropie mesure l’incertitude d’une seule distribution. L’entropie croisée mesure le coût moyen d’encoder des issues tirées d’une distribution avec un code optimisé pour une autre, ce qui en fait une fonction de perte comparant prédictions et vérité.

Pourquoi les arbres de décision utilisent-ils l’entropie ?

Une bonne division rend les groupes obtenus plus purs, c’est-à-dire moins incertains quant à la classe. Le gain d’information mesure exactement cela : l’entropie avant la division moins la moyenne pondérée des entropies après. La division qui supprime le plus d’incertitude est retenue.

En résumé

L’entropie mesure l’incertitude en bits, vaut zéro pour une issue certaine et son maximum pour une issue uniforme, et fixe le plancher dur de la compression sans perte. Elle réapparaît partout en apprentissage automatique dès qu’il faut quantifier la pureté, la surprise, ou la distance entre distributions.