Aller au contenu
Kudos AI
Read in English
Raisonnement probabiliste

La semaine qui n’a pas pu avoir lieu

Prenez l’état le plus probable chaque jour, écrivez-les dans l’ordre, et vous obtenez un rapport auquel le modèle attribue une probabilité exactement nulle : sur un exemple de surveillance de machine sur quatre jours, la réponse jour par jour est sain, sain, en panne, en panne, et passer de sain à en panne est une transition impossible. Ce que sont réellement les deux questions, pourquoi le lissage et Viterbi n’y répondent pas de la même manière, et ce que signifie la probabilité a posteriori de 0,411 du meilleur chemin pour qui doit décider.

5 min de lectureKudos AI

Prérequis : Raisonner sur un monde qui change

Un treillis de jours où tous les chemins sont tracés en pâle, le meilleur chemin survivant vers chaque nœud qui s’épaissit, et le gagnant retracé depuis la fin en passant à côté d’un nœud que la réponse jour par jour avait retenu.

Une machine se trouve dans l’un de trois états : saine, en dégradation ou en panne. Elle ne peut pas passer directement de saine à en panne ; quelque chose doit d’abord se dégrader, ne serait-ce qu’un jour. Écrit comme modèle de transition, l’état de panne étant absorbant :

P(Xt+1∣Xt)=sainedeˊgradationpannesaine0.950.050deˊgradation0.100.600.30panne001P(X_{t+1} \mid X_t) = \begin{array}{l|ccc} & \text{saine} & \text{dégradation} & \text{panne} \\ \hline \text{saine} & 0.95 & 0.05 & 0 \\ \text{dégradation} & 0.10 & 0.60 & 0.30 \\ \text{panne} & 0 & 0 & 1 \end{array}

Un capteur de vibrations déclenche une alarme avec une probabilité de 0,1 quand la machine est saine, de 0,2 quand elle se dégrade et de 0,9 une fois qu’elle est tombée en panne. La machine démarre saine. Sur quatre jours, le capteur rapporte

silence,silence,alarme,alarme.\text{silence},\quad \text{silence},\quad \text{alarme},\quad \text{alarme}.

A. La réponse jour par jour

Le calcul évident est, pour chaque jour, la probabilité de chaque état sachant les quatre observations. C’est le lissage, et c’est ce qu’affiche un tableau de bord de supervision. En sommant sur tous les chemins :

Joursainedégradationpannele plus probable
11.0000000.0000000.000000saine
20.5056420.4943580.000000saine
30.3626910.2259780.411331panne
40.3337990.1023350.563866panne

Lisez la dernière colonne de haut en bas : saine, saine, en panne, en panne.

Ce rapport est impossible. Il place la machine saine au jour 2 et en panne au jour 3, et le modèle de transition donne à ce pas une probabilité nulle. La séquence n’est pas seulement improbable, ni un résumé approximatif de quelque chose de voisin. Sa probabilité vaut exactement

P(saine,saine,panne,panne∣e1:4)=0.P(\text{saine}, \text{saine}, \text{panne}, \text{panne} \mid e_{1:4}) = 0.

Rien n’a échoué dans le calcul. Chacun de ces quatre nombres est correct. Chacun répond à une question portant sur un seul jour, et empiler quatre réponses à quatre questions distinctes ne produit pas une réponse à une question portant sur la semaine.

B. La question à laquelle Viterbi répond

L’autre question est : quelle séquence entière est la plus probable ? C’est une maximisation unique sur les 34=813^4 = 81 chemins, et l’algorithme de Viterbi l’effectue en temps linéaire en le nombre de jours. La réponse est ici

saine,deˊgradation,panne,panne,\text{saine},\quad \text{dégradation},\quad \text{panne},\quad \text{panne},

avec une probabilité a posteriori de 0,411331. C’est une séquence différente de celle obtenue jour par jour, et elle affirme notamment que la machine s’est dégradée au jour 2 - le jour même dont la marginale plaçait la dégradation en seconde position, à 0,494358 contre 0,505642 pour saine.

Cet écart résume toute la leçon. Le jour 2 est presque un pile ou face. La règle jour par jour retient le côté qui l’emporte de 1,1 point et ne se demande jamais à quoi ce choix l’engage. Viterbi ne raisonne que sur des séquences : il peut donc accepter un jour 2 légèrement moins bon en échange d’un jour 3 simplement atteignable.

La figure montre le même désaccord dans le monde du parapluie, où toute transition est permise : les marginales mises bout à bout n’y sont donc pas le chemin le plus probable, sans être pour autant un chemin impossible.

Interactif : ce que vous saviez alors, et ce que vous savez maintenant

Cliquez un jour pour basculer le parapluie.

P(pluie) filtrée
0.111
0.703
0.148
P(pluie) lissée
0.148
0.554
0.148
Histoire la plus probable
sec
sec
sec
Jours de désaccord
2
Sa probabilité
40.2%

Le jour 2, la marginale lissée et l’histoire la plus probable divergent. La marginale de ce jour vaut 0.554 : pris isolément, le jour était donc probablement pluvieux - et pourtant chaque histoire où il pleut ce jour-là est battue par une où il fait sec. Les deux nombres sont justes : la marginale somme des histoires qui, individuellement, perdent, alors que la séquence doit en choisir une. Voilà pourquoi enchaîner les gagnants pas à pas ne donne pas une histoire plausible, et pourquoi Viterbi est un autre algorithme et non une commodité.

C. La seconde hypothèse raconte tout autre chose

La deuxième semaine la plus probable n’est pas une petite variation de la première :

Séquencea posteriori
saine, dégradation, panne, panne0.411331
saine, saine, saine, saine0.326541
saine, saine, dégradation, panne0.097691
saine, dégradation, dégradation, panne0.054844

La meilleure explication est que la machine est tombée en panne au jour 3. La deuxième, à 0,326541, est qu’il ne s’est rien passé du tout et qu’une machine saine a déclenché deux fausses alarmes de suite, ce qu’elle fait avec une probabilité 0.1×0.10.1 \times 0.1 sur n’importe quelle paire de jours. Ces deux récits ne peuvent pas être presque justes tous les deux. Ce sont des versions rivales, et l’écart entre elles est l’élément sur lequel repose réellement une décision de maintenance.

Cela remet aussi le chiffre principal à sa place. La séquence la plus probable porte 0,411331 de la masse a posteriori : la meilleure explication de la semaine est donc fausse environ 59 % du temps. Viterbi renvoie le mode d’une distribution sur les séquences, non une reconstitution de ce qui s’est passé, et le rapporter sans la masse qui le soutient masque l’étroitesse de la victoire.

D. Laquelle voulez-vous ?

Les deux questions sont réellement différentes, et chacune convient à un travail différent.

  • Le lissage, jour par jour, est ce qu’il vous faut quand la décision est quotidienne : cette transaction était-elle frauduleuse, le patient était-il en fibrillation auriculaire pendant cette minute, faut-il mettre en quarantaine la production de ce jour. Chaque réponse est utilisée seule et jamais assemblée en récit.
  • La séquence la plus probable est ce qu’il vous faut quand la sortie se lit comme une histoire : une transcription, une annotation de gènes, un rapport de panne, un étiquetage morphosyntaxique. Tout ce qu’un humain ou un programme en aval lira comme une séquence doit être cohérent, et seule la maximisation conjointe le garantit.

Le mode de défaillance à surveiller est un système qui calcule le premier et le présente comme la seconde. C’est fréquent, parce que les marginales sont déjà produites par un filtre et que les empiler ne coûte rien. Le rapport empilé paraîtra le plus souvent plausible. Dès que le modèle de transition contient un zéro structurel, comme presque tous les modèles réels, il sera parfois non seulement faux mais impossible, et rien dans la chaîne ne s’en apercevra.

E. La vérification qui ne coûte rien

Si vous empilez des marginales, vous pouvez détecter le problème sans changer de méthode. Prenez la séquence rapportée et évaluez sa probabilité sous le modèle de transition : multipliez les probabilités de transition le long du chemin. Si ce produit est nul, le rapport décrit quelque chose que le modèle déclare impossible.

Cela coûte un seul passage sur la sortie, et sur cet exemple le produit s’annule entre le jour 2 et le jour 3. Rapporter les quatre nombres quotidiens comme quatre nombres est honnête. C’est en les lisant de haut en bas que naît la semaine impossible.

Références et lectures complémentaires

  • Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· Bibliothèque de référence Kudos AI

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

8 min de lectureRaisonnement probabiliste

Raisonner sur un monde qui change

Comment deux hypothèses de Markov transforment un historique non borné en deux petites tables, les récursions progressive et rétrograde qui répondent à toute question sur le présent et le passé, pourquoi la séquence la plus probable exige un algorithme à elle seule, et ce qui change quand l’état est un nombre réel plutôt qu’une liste.

ProbabilitéIntelligence artificielle
4 min de lectureRaisonnement probabiliste

Cent mille échantillons, quatre cents qui comptent

Sur le réseau du cambriolage avec les deux voisins qui appellent, l’échantillonnage par rejet garde 183 tirages sur 100 000 et la pondération par vraisemblance les garde tous pour une taille d’échantillon efficace de 396. Les deux estimations s’écartent d’environ 10 % d’une probabilité a posteriori de 0,284172, et la raison se calcule exactement : 252 échantillons portent 76 % du poids et 99,975 % du poids au carré.

Intelligence artificielleProbabilité
11 min de lectureRaisonnement probabiliste

Apprendre les nombres d’un modèle probabiliste

D’où viennent réellement les nombres d’un réseau bayésien ou d’une gaussienne : la recette en trois temps du maximum de vraisemblance déroulée sur des paramètres discrets puis continus, l’a priori Beta qui répare ce qu’elle fait d’un événement jamais vu, Bayes naïf et l’unique effectif nul qui le détruit, et l’algorithme EM pour le cas où les effectifs ne peuvent pas être relevés du tout - chaque chiffre calculé plutôt qu’affirmé.

ProbabilitéStatistiqueIntelligence artificielle
← Retour à tous les articles