Aller au contenu
Kudos AI

Étiquetés « value-iteration »

3 articles.

5 min de lectureApprentissage par renforcement

Le paramètre que personne ne choisit

La récompense de survie d’un monde en grille est écrite une fois et jamais discutée, et la politique optimale en est une fonction en escalier : huit seuils entre -3 et 0, chacun retournant exactement une case. La valeur classique de -0,04 se trouve à 0,0048 de celle qui décide si l’agent prend le raccourci le long du puits, et au-dessus de -0,0221, quand les pas ne coûtent presque rien, le mouvement optimal dans un coin consiste à foncer volontairement dans un mur.

Intelligence artificielle
10 min de lectureDécisions séquentielles et apprentissage par renforcement

Agir quand on ne voit pas l’état

Ce qui change quand un agent reçoit des perceptions bruitées au lieu de son état : l’état de croyance qui le remplace et la mise à jour par filtrage qui le maintient, la réduction exacte d’un POMDP à un MDP sur les croyances, la fonction de valeur linéaire par morceaux et convexe qui rend cette réduction calculable en principe, et les raisons mesurées pour lesquelles elle ne l’est pas en pratique - avec le point fixe de la croyance, les vecteurs alpha et la fonction de valeur calculés et non affirmés.

Intelligence artificielleProbabilité
9 min de lectureApprentissage par renforcement

Les processus de décision markoviens

Comment planifier quand les actions ne font pas fiablement ce qu’on veut : états, modèle de transition, récompenses et actualisation, l’équation de Bellman, et l’itération sur les valeurs menée numériquement jusqu’à son point fixe.

Apprentissage par renforcementProbabilitéIntelligence artificielle