Le paramètre que personne ne choisit
La récompense de survie d’un monde en grille est écrite une fois et jamais discutée, et la politique optimale en est une fonction en escalier : huit seuils entre -3 et 0, chacun retournant exactement une case. La valeur classique de -0,04 se trouve à 0,0048 de celle qui décide si l’agent prend le raccourci le long du puits, et au-dessus de -0,0221, quand les pas ne coûtent presque rien, le mouvement optimal dans un coin consiste à foncer volontairement dans un mur.
Prérequis : Les processus de décision markoviens
Le monde en grille standard fait quatre cases sur trois, avec un mur en (2,2), un but valant +1 en (4,3) et un puits valant -1 en (4,2). Chaque action déplace l’agent comme prévu avec une probabilité de 0,8 et de côté avec une probabilité de 0,1 de chaque côté ; heurter un mur le laisse sur place. Le facteur d’actualisation vaut 1.
Et quelque part dans la spécification, généralement dans une phrase sur laquelle personne ne s’arrête, figure une récompense de survie : chaque case non terminale rapporte par pas, typiquement . Elle est là pour rendre la lenteur coûteuse. Elle n’est pas présentée comme un choix de modélisation, parce qu’elle n’en a pas l’air.
C’est le nombre le plus lourd de conséquences du problème.
A. Huit seuils
Résolvez le monde pour chaque entre et et la politique optimale ne dérive pas. Elle reste immobile, change dans une case, puis reste de nouveau immobile. En bissectant chaque changement jusqu’à six décimales :
| Récompense de survie | Case | Avant | Après |
|---|---|---|---|
| -1.649707 | (3,2) | droite | haut |
| -1.564259 | (3,1) | droite | haut |
| -0.731138 | (1,1) | droite | haut |
| -0.452624 | (4,1) | haut | gauche |
| -0.084989 | (2,1) | droite | gauche |
| -0.044833 | (3,1) | haut | gauche |
| -0.027357 | (3,2) | haut | gauche |
| -0.022145 | (4,1) | gauche | bas |
Neuf politiques optimales distinctes sur cet intervalle, séparées par huit nombres, et chacun des chiffres ci-dessus a été calculé deux fois : par itération sur les politiques, où chaque évaluation est une résolution linéaire exacte, et par itération sur les valeurs poussée jusqu’à une tolérance de . Les deux méthodes s’accordent sur chaque politique et sur chaque utilité à près.
Interactif : la politique, fonction en escalier de la récompense de survie
Le monde 4x3, 0,8 dans la direction voulue, 0,1 de chaque côté, sans actualisation.
- Utilité de la case (1,1)
- 0.705308
- Intervalle de politique
- 7 sur 9
- Cases différentes du manuel
- 0
- Itération sur les valeurs vs exact
- 5.4e-15
À R = -0.04 la politique optimale est celle qui vaut pour toute récompense de survie entre -0.044833 et -0.027357, et U(1,1) vaut 0.705308. En (3,1) l’agent part à gauche, le long détour, aussi loin du puits que possible.
B. La valeur classique est à 0,0048 d’une falaise
Regardez la ligne en gras. À , l’agent placé en (3,1), en diagonale sous le puits et à sa gauche, va à gauche : le long chemin, par le bas puis en remontant le côté opposé, sans jamais poser le pied sur une case voisine du puits. C’est la politique imprimée dans tous les manuels, et celle dont l’intuition de chacun tire sa compréhension de ce monde.
À , il va en haut : sur (3,2), la case juste à gauche du puits, en prenant la route courte et en acceptant un risque réel d’être poussé de côté dans le .
La bascule se situe à . Le réglage canonique est à au-dessus. Une récompense de survie de et une de relèvent du même choix pour qui que ce soit, et elles produisent deux récits différents de ce que fait un agent rationnel dans ce monde.
Les utilités, elles, évoluent continûment : vaut à , à et à . C’est la politique, c’est-à-dire ce que vous déployez réellement, qui est une fonction en escalier.
C. Deux politiques qui ressemblent à des bogues
Au-dessus de -0,022145, l’agent fonce volontairement dans un mur. Pour toute récompense de survie entre et , les pas les moins chers de tout l’intervalle, l’action optimale en (4,1), le coin inférieur droit, est bas. Il n’y a rien en dessous ; le mouvement heurte le sol et l’agent reste sur place avec une probabilité de 0,8, glissant de côté avec 0,1 de chaque côté, dont l’un heurte également un mur.
Ce n’est pas un bogue. La case juste au-dessus de (4,1) est le puits. Quand le temps ne coûte presque rien, la chose la moins chère à faire dans ce coin est de ne rien faire, et l’action qui réalise le mieux ce rien est de pousser contre le sol. Tout mouvement délibéré risque de dériver vers le haut, dans le .
À l’autre extrémité, l’agent plonge dans le puits. Pour , l’action optimale en (3,2) est d’aller à droite, directement dans le terminal . Dès qu’un pas supplémentaire coûte plus de 1,649707, la sortie la plus rapide l’emporte, et le puits est la sortie la plus proche. à : l’agent n’est pas confus, il est dans un monde où exister coûte cher.
Les deux comportements sont une optimisation correcte. Les deux seraient signalés comme des bogues par quiconque n’aurait pas regardé la récompense de survie, et ni l’un ni l’autre ne se corrige en changeant d’algorithme.
D. Que faire
Les conséquences pratiques sont courtes et précises.
- Balayez le paramètre que vous ne pensiez pas choisir. Neuf politiques sur un intervalle n’a rien d’exotique ; c’est l’allure d’un argmax constant par morceaux. Le balayage est bon marché : chaque résolution ici est un système linéaire .
- Rapportez l’intervalle, pas le point. « La politique optimale pour » est une affirmation qui survit à un arrondi de la récompense de survie. « La politique optimale pour » porte sur un seul nombre, et c’est l’énoncé le plus faible bien qu’il paraisse plus précis.
- Une récompense réglée est un paramètre ajusté. Retoucher un coût de pas jusqu’à ce que l’agent fasse ce qu’il faut, c’est de l’ajustement, et la valeur obtenue hérite de toutes les réserves qui accompagnent un paramètre ajusté. En particulier, elle ne devrait pas ensuite être présentée comme une propriété de l’environnement.
- Vérifiez les deux bords de l’intervalle auquel vous croyez. Si votre conviction est « le temps coûte un peu, quelques pour cent par pas », résolvez aux deux bouts de « quelques pour cent ». Ici, cet intervalle contient trois seuils.
La version profonde du propos est que la fonction de récompense n’est pas une description du monde. Elle est la spécification complète de ce à quoi sert l’agent, et une de ses pièces écrite une fois dans un fichier de configuration, jamais relue, jamais variée, pèse plus lourd que tout ce sur quoi l’on discute.
Références et lectures complémentaires
- Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· Bibliothèque de référence Kudos AI
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.