Apprentissage par renforcement
Apprendre des conséquences plutôt que d’étiquettes. Processus de décision markoviens, méthodes de valeur et de politique, et le problème d’exploration qui en est le cœur.
Parcours (1)
Encyclopédie (2)
Processus de décision markovien
Un modèle formel de prise de décision séquentielle dont les issues sont en partie aléatoires, défini par des états, des actions, des probabilités de transition et des récompenses.
Apprentissage Q
Un algorithme d’apprentissage par renforcement qui apprend directement de l’expérience la valeur de chaque action dans chaque état, sans modèle de l’environnement.
Articles (2)
L’apprentissage par renforcement et le Q-learning
Apprendre à bien agir sans modèle du monde : mises à jour par différence temporelle, la règle du Q-learning, exploration contre exploitation, et une exécution qui retrouve l’optimum planifié à partir de la seule expérience.
Les processus de décision markoviens
Comment planifier quand les actions ne font pas fiablement ce qu’on veut : états, modèle de transition, récompenses et actualisation, l’équation de Bellman, et l’itération sur les valeurs menée numériquement jusqu’à son point fixe.