Markov Decision Processes
How to plan when actions do not reliably do what you intend: states, transition models, rewards and discounting, the Bellman equation, and value iteration worked numerically to its fixed point.
Itération sur la valeur, itération sur la politique et Q-learning sur le même monde en grille, pour comparer directement un planificateur qui connaît le modèle à un apprenant qui l’ignore.
Un petit processus de décision markovien utilisé comme cadre contrôlé pour comparer la planification et l’apprentissage. L’itération sur la valeur et l’itération sur la politique sont exécutées d’abord, avec pleine connaissance du modèle de transition, afin de calculer exactement la fonction de valeur et la politique optimales. Le Q-learning est ensuite exécuté sur le même monde sans aucun modèle, en apprenant uniquement de transitions échantillonnées, et ses estimations sont comparées à la vérité terrain planifiée - c’est ce qui rend la comparaison instructive : l’apprenant retrouve la même politique optimale tandis que ses estimations de valeur restent légèrement décalées, l’écart résiduel étant une erreur d’échantillonnage et non un défaut. Le laboratoire expose aussi les paramètres qui gouvernent réellement le comportement : facteur d’actualisation, taux d’apprentissage et calendrier d’exploration, le balayage sur epsilon montrant pourquoi un apprenant purement glouton peut se fixer sur une politique moins bonne. L’implémentation est en cours et aucun dépôt source n’a encore été publié.
How to plan when actions do not reliably do what you intend: states, transition models, rewards and discounting, the Bellman equation, and value iteration worked numerically to its fixed point.
Learning to act well without a model of the world: temporal-difference updates, the Q-learning rule, exploration versus exploitation, and a run that recovers the planned optimum from experience alone.