Aller au contenu
Kudos AI

Précision et rappel

Deux taux qui séparent ce que l’exactitude masque : la précision est la part des positifs prédits qui sont réels, le rappel est la part des positifs réels qui ont été trouvés.

Aussi appelé : Valeur prédictive positive et sensibilité, Score F1

Comprendre Précision et rappel

Une matrice de confusion a quatre cases, et l’exactitude les résume en un nombre en comptant la diagonale. Quand une classe est rare, ce nombre est dominé par les vrais négatifs, et un modèle qui ne prédit jamais la classe rare y obtient un bon score. La précision et le rappel découpent la matrice autrement : la précision divise les vrais positifs par tout ce qui a été prédit positif, le rappel les divise par tout ce qui est réellement positif. Ni l’un ni l’autre n’utilise les vrais négatifs.

Les deux échouent dans des directions différentes et il vaut la peine de les nommer séparément. Un rappel faible signifie manquer des cas réels, ce qui compte en dépistage, en recherche d’information et en détection de fraude. Une précision faible signifie crier au loup, ce qui compte quand chaque alerte coûte l’attention d’une personne. Un système souffrant des deux se repère vite ; un système n’en souffrant que d’un passe facilement pour bon si l’on ne rapporte que l’autre.

Aucun des deux n’est une propriété fixe d’un modèle qui produit un score. Abaisser le seuil attrape plus de positifs réels et élève le rappel tout en admettant plus de fausses alertes et en abaissant la précision. La courbe tracée quand le seuil se déplace est la description honnête ; un couple de nombres n’en est qu’un point, choisi délibérément ou par défaut.

Le score F1 résume le couple par une moyenne harmonique et non arithmétique, ce qui refuse de se laisser sauver par une seule valeur élevée : une précision de 1 avec un rappel de 0,02 a une moyenne arithmétique de 0,51 et un F1 de 0,039. Quand les deux erreurs ont des coûts authentiquement différents, les pondérer explicitement en dit plus que n’importe quel résumé unique.

Comment calculer

\text{precision} = \frac{TP}{TP + FP}, \qquad \text{recall} = \frac{TP}{TP + FN}, \qquad F_1 = \frac{2\,\text{precision}\cdot\text{recall}}{\text{precision} + \text{recall}}

où

TP
vrais positifs : cas réels correctement signalés
FP
faux positifs : fausses alertes
FN
faux négatifs : cas réels manqués

Exemple : Précision et rappel

Dépistez 20 000 personnes pour une affection qu’a 1 personne sur 200 : 100 sont authentiquement positives et 19 900 ne le sont pas. Un détecteur qui ne se déclenche jamais a raison 19 900 fois sur 20 000, soit une exactitude de 0,995 et un rappel de 0.

Prenez maintenant un détecteur de sensibilité 90 pour cent et de spécificité 95 pour cent. Il trouve 90 des 100 cas réels et lève 995 fausses alertes, soit un rappel de 0,9 et une précision de 90/1085 = 0,082949. Onze alertes sur douze sont fausses, et les fausses alertes dépassent les vraies dans un rapport de 11,06 contre une.

Son exactitude vaut 18 995/20 000 = 0,94975, ce qui est INFÉRIEUR au détecteur qui ne se déclenche jamais. L’exactitude préfère le modèle inutile ; la précision et le rappel disent clairement ce que chacun fait. Voilà pourquoi le couple est rapporté pour les classes rares et l’exactitude non.

Questions fréquentes

Lequel faut-il optimiser ?

Celui dont l’erreur coûte le plus cher, ce qui est une question sur l’application et non sur les données. Manquer une tumeur et signaler un patient sain ne sont pas interchangeables, et aucune statistique de résumé ne connaît le taux de change.

Pourquoi la précision s’effondre-t-elle quand la classe est rare ?

Parce que les fausses alertes sont tirées du grand réservoir des négatifs. À une prévalence de 1 sur 200, même un taux de faux positifs de 5 pour cent produit dix fois plus d’alertes qu’il n’y a de cas réels, quelle que soit la sensibilité.

En résumé

La précision demande combien d’alertes étaient réelles, le rappel demande combien de cas réels ont été attrapés, et aucun des deux ne compte les vrais négatifs. Sur une classe rare, c’est la différence entre un nombre qui flatte un modèle inutile et un couple qui décrit ce qu’il fait vraiment.