Aller au contenu
Kudos AI

L’utilité espérée et le principe MEU

Une fonction d’utilité transforme des préférences en un nombre, l’utilité espérée en fait la moyenne sur ce qui peut arriver, et la maximiser constitue le critère tout entier - ce qui n’est pas la même chose que résoudre le problème.

IntermédiaireModule 125 min · 100 XP
Un choix de jeu télévisé pesé deux fois, une fois en dollars et une fois en utilité, les deux calculs aboutissant à des réponses opposées sur le même lancer de pièce.

Tous les parcours jusqu’ici se sont arrêtés à une croyance : une loi a posteriori, une estimation filtrée, une courbe ajustée. Les croyances ne disent pas quoi faire. Agir demande aussi des préférences, et la théorie de la décision est l’arithmétique qui combine les deux.

L’utilité et l’utilité espérée

Une fonction d’utilité U(s)U(s) attribue un unique nombre à un état, exprimant à quel point il est désirable. Comme, dans un monde incertain, les actions ne déterminent pas leur résultat, on note Result(a)\mathrm{Result}(a) la variable aléatoire dont les valeurs sont les états résultants possibles. Étant donné des observations e\mathbf{e}, l’utilité espérée d’une action est l’utilité moyenne de ses résultats, pondérée par leur probabilité :

EU(a∣e)=∑s′P(Result(a)=s′∣a,e) U(s′).EU(a \mid \mathbf{e}) = \sum_{s'} P\big(\mathrm{Result}(a) = s' \mid a, \mathbf{e}\big)\, U(s') .

Le principe de l’utilité espérée maximale constitue alors le critère tout entier :

action=argmax⁡aEU(a∣e).\text{action} = \operatorname*{argmax}_{a} EU(a \mid \mathbf{e}) .

Notez ce qu’il n’est pas. Ce n’est pas « maximiser le meilleur cas », qui ignorerait complètement le risque. Ce n’est pas « atteindre un but », car un agent décisionnel dispose d’une mesure continue de la qualité des résultats plutôt que d’un test binaire de réussite. Et ce n’est pas « maximiser l’argent espéré », qui est une autre quantité et, comme le montre la section suivante, bien souvent la mauvaise.

Exemple traité : le jeu télévisé

Vous avez gagné. L’animateur propose $1,000,000 tout de suite, ou une pièce équilibrée : face, vous n’avez rien ; pile, vous recevez $2,500,000. La valeur monétaire espérée du pari vaut

12($0)+12($2,500,000)=$1,250,000,\tfrac{1}{2}(\$0) + \tfrac{1}{2}(\$2{,}500{,}000) = \$1{,}250{,}000 ,

ce qui bat le million assuré. La plupart des gens refusent malgré tout. Ont-ils tort ?

Notons SnS_n le fait de posséder une fortune totale de nn dollars, et soit kk dollars votre fortune actuelle. Les deux actions ont pour utilités espérées

EU(Accept)=12U(Sk)+12U(Sk+2,500,000),EU(Decline)=U(Sk+1,000,000).EU(\text{Accept}) = \tfrac{1}{2}U(S_k) + \tfrac{1}{2}U(S_{k+2{,}500{,}000}), \qquad EU(\text{Decline}) = U(S_{k+1{,}000{,}000}) .

L’utilité n’est pas proportionnelle à l’argent : le premier million change votre vie, le second ne la change pas, à beaucoup près, autant. Supposons que vous notiez votre position actuelle 55, le résultat intermédiaire 88 et le meilleur 99. Alors

EU(Accept)=12(5)+12(9)=7<8=EU(Decline),EU(\text{Accept}) = \tfrac{1}{2}(5) + \tfrac{1}{2}(9) = 7 < 8 = EU(\text{Decline}) ,

si bien que refuser n’est pas seulement compréhensible : c’est ce que le principe prescrit.

Python

S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.

Rien ici ne met en cause le fait de moyenner. La moyenne est calculée de la même façon les deux fois. Ce qui diffère, c’est l’échelle sur laquelle on moyenne, et l’utilité est celle qui encode la préférence.

L'argument porte sur la forme d'une courbe : voici donc la courbe. Les trois issues en sont les points, le curseur la courbe, et les probabilités ne bougent jamais. La ligne pointillée est la note que le sommet devrait atteindre pour qu'accepter soit juste : 11, avec les notes ci-dessus. Cela mérite deux lectures, car cela signifie que le second million et demi devrait apporter au moins autant que le premier million, c'est-à-dire l'exact contraire des rendements décroissants sur lesquels repose tout l'argument.

Interactif : la pièce, et la courbe qui tranche

Les probabilités ne changent jamais. Seule la forme de l’utilité change.

01.0M2.5M
Utilité espérée, accepter
7.00
Utilité espérée, refuser
8.00
Note du sommet qui égaliserait
11.00
Ce que prescrit le MEU
refuser
Espérance monétaire
$1,250,000

Le pari vaut $1,250,000 en argent contre un million sûr : l’argent dit accepter. En utilité il vaut 7.00 contre 8.00, et le principe dit refuser. Rien ici ne critique la moyenne : elle est calculée de la même façon les deux fois, et ce qui diffère est l’échelle moyennée. Pour qu’accepter soit juste, le sommet devrait valoir 11.00, c’est-à-dire que le second million et demi devrait apporter au moins autant que le premier million.

Le même pari, la réponse inverse

L’argument porte sur la forme de votre courbe, non sur la prudence en général. L’utilité d’un milliardaire est essentiellement linéaire sur quelques millions : en mesurant l’utilité en millions, on obtient

EU(Accept)=12(0)+12(2.5)=1.25>1.0=EU(Decline),EU(\text{Accept}) = \tfrac{1}{2}(0) + \tfrac{1}{2}(2.5) = 1.25 > 1.0 = EU(\text{Decline}) ,

et le même principe dit de prendre le pari. Deux agents, des probabilités identiques, des choix rationnels opposés. Rien n’est incohérent : ils ont des fonctions d’utilité différentes, et la théorie n’a jamais prétendu qu’il n’y en avait qu’une.

Pourquoi ce n’est pas la fin de l’IA

Russell et Norvig observent que MEU « pourrait être vu comme définissant l’IA tout entière », puis soulignent aussitôt qu’il ne la résout pas. Les deux affirmations sont vraies, et l’écart mérite d’être décrit avec précision.

MEU dit exactement ce qu’est un choix rationnel. Ce qu’il ne dit pas, c’est comment s’en procurer les ingrédients.

  • Les probabilités P(Result(a)∣a,e)P(\mathrm{Result}(a) \mid a, \mathbf{e}) exigent un modèle causal du monde et une inférence menée en son sein - dont le parcours précédent a montré qu’elle est NP-difficile dans les réseaux bayésiens généraux.
  • Les utilités U(s′)U(s') ne peuvent souvent pas se lire sur un état du tout. Savoir à quel point une position est bonne peut demander de chercher ou de planifier pour voir ce que l’on peut atteindre depuis elle.

Le principe formalise donc « faire ce qu’il faut » et laisse presque tout le travail. Cela reste précieux : il fournit un critère à l’aune duquel juger les approximations, ce qui est déjà plus qu’un tas d’heuristiques n’en offre.

MEU et les mesures de performance. Si un agent maximise une fonction d’utilité qui reflète correctement la mesure de performance selon laquelle son comportement est jugé, il obtient le meilleur score possible pour cette mesure, moyenné sur les environnements auxquels il peut être confronté. Toute la difficulté tient dans reflète correctement.

Avant le quiz

Sachez écrire EU(a∣e)EU(a \mid \mathbf{e}) et énoncer MEU, traiter l’exemple du jeu télévisé aussi bien en argent qu’en utilité, expliquer pourquoi un milliardaire tranche rationnellement dans l’autre sens, et nommer les deux ingrédients que MEU suppose sans les fournir.

Références et lectures complémentaires

  • Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· Bibliothèque de référence Kudos AI

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Débloquez tout le parcours

Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.