Aller au contenu
Kudos AI

Gridworld RL Lab

Itération sur la valeur, itération sur la politique et Q-learning sur le même monde en grille, pour comparer directement un planificateur qui connaît le modèle à un apprenant qui l’ignore.

Python (NumPy)actif

Un petit processus de décision markovien utilisé comme cadre contrôlé pour comparer la planification et l’apprentissage. L’itération sur la valeur et l’itération sur la politique sont exécutées d’abord, avec pleine connaissance du modèle de transition, afin de calculer exactement la fonction de valeur et la politique optimales. Le Q-learning est ensuite exécuté sur le même monde sans aucun modèle, en apprenant uniquement de transitions échantillonnées, et ses estimations sont comparées à la vérité terrain planifiée - c’est ce qui rend la comparaison instructive : l’apprenant retrouve la même politique optimale tandis que ses estimations de valeur restent légèrement décalées, l’écart résiduel étant une erreur d’échantillonnage et non un défaut. Le laboratoire expose aussi les paramètres qui gouvernent réellement le comportement : facteur d’actualisation, taux d’apprentissage et calendrier d’exploration, le balayage sur epsilon montrant pourquoi un apprenant purement glouton peut se fixer sur une politique moins bonne. L’implémentation est en cours et aucun dépôt source n’a encore été publié.

Points forts

  • Itération sur la valeur et sur la politique menées à convergence face à un modèle de transition connu
  • Q-learning sur le monde identique, sans modèle, comparé à l’optimum planifié
  • Convergence tracée à chaque balayage, rendant visible la contraction vers le point fixe
  • Calendrier d’epsilon balayé pour montrer un apprenant glouton convergeant vers une politique moins bonne

Articles associés

9 min de lectureReinforcement Learning

Markov Decision Processes

How to plan when actions do not reliably do what you intend: states, transition models, rewards and discounting, the Bellman equation, and value iteration worked numerically to its fixed point.

Apprentissage par renforcementProbabilitéIntelligence artificielle
9 min de lectureReinforcement Learning

Reinforcement Learning and Q-Learning

Learning to act well without a model of the world: temporal-difference updates, the Q-learning rule, exploration versus exploitation, and a run that recovers the planned optimum from experience alone.

Apprentissage par renforcementApprentissage automatiqueIntelligence artificielle