Aller au contenu
Kudos AI

Ce que la justesse dissimule

À un taux de base de 0,5 % le détecteur inerte gagne sur la justesse, la ROC annonce 0,9468 pour un modèle dont les cent premières alertes sont fausses à 64 %, et la précision@k est le seul nombre qui décrive la file que quelqu’un doit traiter.

IntermédiaireModule 125 min · 100 XP
Une justesse de 99,5 % affichée au-dessus d’un détecteur qui ne se déclenche jamais, puis le même détecteur noté deux fois : une courbe ROC collée au coin tandis que la courbe précision-rappel s’effondre.

Vingt mille événements. Cent d’entre eux sont des anomalies. Construisez un détecteur qui répond « normal » à tout.

Il est juste à 99,50 %.

Voilà tout le problème en une ligne, et chaque habitude de mesure héritée de la classification équilibrée doit être réexaminée à cette aune.

Deux notes pour un seul détecteur

Prenez maintenant un détecteur qui fonctionne réellement : il classe les anomalies au-dessus des événements normaux, avec le recouvrement qu’a tout score réel. Notez-le de deux façons.

métriquevaleur
aire sous la ROC0,9468
précision moyenne (aire sous la PR)0,3245
ce qu’obtient un détecteur aléatoire sur la seconde0,0050

Les deux nombres sont correctement calculés à partir du même classement. Ils divergent parce qu’ils divisent par des choses différentes.

Le taux de faux positifs divise par les 19 900 événements normaux. Mille fausses alertes le déplacent de cinq points, si bien que la courbe ROC reste près du coin et que l’aire se lit comme celle d’un excellent modèle.

La précision divise par le nombre d’alertes. Mille fausses alertes n’y sont pas une erreur d’arrondi : elles sont la file entière.

La question à laquelle répond une métrique importe donc plus que sa valeur. La ROC répond à « à quel point ce score classe-t-il les anomalies au-dessus des normaux », qui est une propriété du détecteur. La précision répond à « quelle fraction de ce qu’on me montre est réelle », qui est ce que vit la personne d’astreinte.

Le nombre qui décrit la file

Aucune des deux aires ne dit combien de choses il faut regarder. La précision@k le dit, parce qu’elle fixe d’abord la longueur de la file :

vous examinezdont réellesprécisionrappel
les 50 premières2652 %26 %
les 100 premières3636 %36 %
les 500 premières6713,4 %67 %

Aux cent premières, quelqu’un examine 100 éléments pour en trouver 36. Près de deux fausses alertes pour chaque vraie trouvaille, et c’est le bon cas, venu d’un détecteur dont la ROC annonce 0,9468.

C’est ce nombre qu’il faut négocier, car il se convertit directement en effectif. Un analyste capable de vérifier quarante éléments par jour choisit une ligne de ce tableau, et la ligne détermine la part d’anomalies que l’organisation attrape. Un seuil choisi sans référence à cette capacité produit soit une file ignorée, soit une illusion de couverture.

La figure ci-dessous calcule les deux scores depuis le modèle plutôt que depuis un tirage, ce qui aiguise l'exercice précédent. La ROC ne bouge pas « à peine » quand les anomalies deviennent dix fois plus fréquentes : elle ne bouge pas du tout, car elle ne dépend que des deux lois de score. La précision moyenne, elle, plus que double. Le second panneau convertit une capacité d'examen en les deux nombres qui décident de ce que l'organisation voit réellement.

Interactif : un classement, deux métriques qui se contredisent

Toutes deux calculées exactement depuis le modèle, non d’un tirage.

ROC0
AUC ROC
0.9552
Précision moyenne
0.3326
Score d’un détecteur au hasard
0.0050
Exactitude du détecteur muet
99.5%

À un taux de contamination de 0.5%, un détecteur qui répond « normal » à tout est exact à 99.5% : tout le problème en un chiffre. Le détecteur qui fonctionne obtient 0.9552 en ROC et 0.3326 en précision moyenne, sur le même classement. Faites glisser le taux : la ROC ne bouge pas du tout, car elle mesure le classement et non la fréquence. La précision moyenne bouge beaucoup, car la précision divise par le nombre d’alertes.

Comment rapporter un détecteur

Trois choses, et c’est la troisième qui manque d’ordinaire :

  1. le taux de base des données sur lesquelles il a été mesuré, car tous les autres nombres en dépendent
  2. précision et rappel à un k annoncé, et non une aire seule
  3. la capacité d’examen que ce k suppose, car un détecteur ne vaut que la file que quelqu’un traite réellement

« ROC 0,95 » n’est pas une affirmation sur laquelle agir. « À quarante examens par jour nous attrapons un quart des incidents, et trois sur huit de ce que nous vous montrons est du bruit » en est une.

Ce que cela prépare

Cette leçon supposait un détecteur et le mesurait. La suivante demande d’où vient le score, et découvre que les trois grandes familles ne s’accordent pas sur le sens même d’« anormal », au point que l’une d’elles se classe sous le hasard.

Références et lectures complémentaires

  • Charu C. Aggarwal, Recommender Systems: The Textbook, Springer, 2016· Bibliothèque de référence Kudos AI
  • Kevin P. Murphy, Probabilistic Machine Learning: An Introduction, MIT Press (Adaptive Computation and Machine Learning), 2022source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Débloquez tout le parcours

Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.