Aller au contenu
Kudos AI

État de croyance

La loi de probabilité qu’un agent entretient sur les états où il pourrait se trouver, compte tenu de tout ce qu’il a fait et perçu - ce sur quoi il peut agir quand l’état lui-même est caché.

Aussi appelé : Distribution de croyance, État d’information

Comprendre État de croyance

Quand un agent ne peut pas observer l’état qu’il occupe, l’objet naturel du raisonnement n’est pas l’état mais la distribution sur les états compatibles avec son histoire. C’est l’état de croyance. Il est une statistique exhaustive de tout le passé : la croyance étant donnée, aucune action ni perception antérieure n’ajoute quoi que ce soit à la prédiction du futur, ce qui permet de planifier à partir de la seule croyance plutôt que d’une histoire sans cesse croissante.

Le maintenir tient en une récursion. Étant donné une croyance, une action et la perception qui en résulte, la nouvelle croyance s’obtient en poussant l’ancienne à travers le modèle de transition, en multipliant point par point par la probabilité de la perception dans chaque état successeur candidat, puis en renormalisant. C’est exactement l’étape avant du filtrage des modèles de Markov cachés ; la seule addition est que le modèle de transition dépend désormais de l’action choisie.

Le fait structurel décisif est que l’état de croyance est observable par l’agent par définition - c’est un résumé de sa propre histoire, non du monde. C’est ce qui le rend utilisable comme variable d’état. Une politique disant « si vous êtes dans l’état 3, faites ceci » ne peut pas être exécutée par un agent qui ignore s’il est dans l’état 3 ; une politique sur les croyances le peut toujours.

Les états de croyance dépassent largement la planification probabiliste. Dans la recherche sans capteur et la recherche conditionnelle, la croyance est un ensemble d’états possibles plutôt qu’une distribution, et la recherche procède sur ces ensembles. Dans les modèles temporels, la distribution filtrée sur l’état courant est un état de croyance maintenu par la même récursion. Et dans les MDP partiellement observables, l’espace des croyances devient l’espace d’états d’un problème équivalent, lui totalement observable.

Comment calculer

b'(s') = α · P(e | s') Σ_s P(s' | s, a) b(s)

où

b'(s')
la probabilité mise à jour d’être dans l’état s′ après avoir agi et perçu
P(e | s′)
le modèle de capteur : la vraisemblance de cette perception dans l’état candidat
P(s' | s, a)
le modèle de transition pour l’action effectivement prise
α
la constante de normalisation qui fait sommer la nouvelle croyance à un

Exemple : État de croyance

Prenez un monde à deux états où une action persiste avec probabilité 0,9, l’autre bascule avec probabilité 0,9, et le capteur annonce le bon état avec probabilité 0,6. Depuis une croyance uniforme, l’une comme l’autre action laisse la prédiction uniforme - persister et basculer reviennent au même depuis un partage 50/50 - si bien que la perception fait tout le travail, et une lecture « état 1 » porte la croyance exactement à 3/5.

La confiance est plus difficile à accumuler qu’à perdre. Une croyance de 0,99 qui prend l’action de persistance puis rencontre une seule perception contradictoire s’effondre à 446/527 = 0,846300, l’essentiel venant de la fuite de transition, qui conduit à elle seule 0,99 à une prédiction de 0,892 ; huit perceptions confirmatives consécutives depuis 0,5 ne la portent qu’à 0,817218.

Elle n’atteint jamais un. Répéter indéfiniment l’action de persistance avec la même perception converge vers (3 + √105)/16 = 0,827934, le point où les indices qui tirent la croyance vers l’extérieur équilibrent exactement le bruit de transition qui la repousse vers le milieu. L’agent doit donc planifier en restant incertain, ce qui est toute la difficulté de l’observabilité partielle.

Questions fréquentes

En quoi diffère-t-il de l’état d’un modèle de Markov caché ?

C’est le même objet - la distribution filtrée sur l’état caché - avec des actions en plus. Dans un modèle de Markov caché les transitions arrivent à l’agent ; dans une formulation par états de croyance, l’agent choisit quel modèle de transition s’applique, et influence donc ce qu’il apprendra autant que là où il ira.

La croyance converge-t-elle toujours ?

Pas vers la certitude, et pas nécessairement vers un point unique. Avec un capteur bruité et des transitions stochastiques, elle se stabilise dans une région déterminée par l’équilibre entre les deux ; avec des capteurs assez informatifs et une dynamique assez lente, cette région peut être étroite. Supposer la convergence vers la vérité est une erreur courante et coûteuse.

Pourquoi est-ce une statistique exhaustive ?

Parce que les modèles de transition et de capteur sont markoviens : l’état suivant ne dépend que de l’état et de l’action courants, et la perception que de l’état courant. Tout ce que l’histoire a à dire du futur est donc déjà contenu dans la distribution actuelle sur les états.

En résumé

Un état de croyance est la distribution de l’agent sur les endroits où il pourrait être, maintenue par la récursion de filtrage et toujours à sa disposition. Planifier sur les croyances plutôt que sur les états est ce qui rend les problèmes partiellement observables traitables en principe - et le fait que les croyances forment un continuum est ce qui les rend difficiles en pratique.