Apprentissage par renforcement
Bien agir quand les issues sont incertaines : l'equation de Bellman et comment la resoudre, puis ce qui change lorsque l'environnement est inconnu et que l'agent doit apprendre par la seule experience.
Connectez-vous pour passer les quiz, gagner des XP et débloquer les étapes en atteignant 90% de maîtrise.
PDM et equation de Bellman
30 min · 130 XPLes cinq composantes d'un processus de decision markovien, pourquoi une politique vaut mieux qu'un plan sous incertitude, et la condition de coherence que toute utilite doit satisfaire.
Ouvrir la leçon →Connectez-vous pour passer le quiz de 3 questions.
Iteration sur la valeur et sur la politique
35 min · 150 XPTransformer l'equation de Bellman en affectation et balayer jusqu'a stabilisation, puis la boucle evaluer-ameliorer qui trouve generalement la politique en premier.
Ouvrir la leçon →Connectez-vous pour passer le quiz de 3 questions.
Q-learning et exploration
35 min · 160 XPApprendre a bien agir sans modele de l'environnement : la mise a jour par difference temporelle, la valeur qui remonte pas a pas, et pourquoi un agent purement glouton se bloque.
Ouvrir la leçon →Connectez-vous pour passer le quiz de 3 questions.