Aller au contenu
Kudos AI

Apprentissage par renforcement

Bien agir quand les issues sont incertaines : l'equation de Bellman et comment la resoudre, puis ce qui change lorsque l'environnement est inconnu et que l'agent doit apprendre par la seule experience.

Avancé440 XP~2 h90% pour avancer

Connectez-vous pour passer les quiz, gagner des XP et débloquer les étapes en atteignant 90% de maîtrise.

  1. PDM et equation de Bellman

    30 min · 130 XP

    Les cinq composantes d'un processus de decision markovien, pourquoi une politique vaut mieux qu'un plan sous incertitude, et la condition de coherence que toute utilite doit satisfaire.

    Ouvrir la leçon →

    Connectez-vous pour passer le quiz de 3 questions.

  2. Iteration sur la valeur et sur la politique

    35 min · 150 XP

    Transformer l'equation de Bellman en affectation et balayer jusqu'a stabilisation, puis la boucle evaluer-ameliorer qui trouve generalement la politique en premier.

    Ouvrir la leçon →

    Connectez-vous pour passer le quiz de 3 questions.

  3. Q-learning et exploration

    35 min · 160 XP

    Apprendre a bien agir sans modele de l'environnement : la mise a jour par difference temporelle, la valeur qui remonte pas a pas, et pourquoi un agent purement glouton se bloque.

    Ouvrir la leçon →

    Connectez-vous pour passer le quiz de 3 questions.

Terminez tous les modules → obtenez le badge Apprentissage par renforcement