9 min de lectureApprentissage par renforcement
Les processus de décision markoviens
Comment planifier quand les actions ne font pas fiablement ce qu’on veut : états, modèle de transition, récompenses et actualisation, l’équation de Bellman, et l’itération sur les valeurs menée numériquement jusqu’à son point fixe.
Apprentissage par renforcementProbabilitéIntelligence artificielle