Comparer les classifieurs, et ce que l’exactitude dissimule
Le classifieur de Bayes que rien ne peut battre et le plancher d’erreur qu’il laisse, les k plus proches voisins comme imitation non paramétrique avec k pour bouton de flexibilité, l’analyse discriminante et pourquoi une covariance partagée impose une droite, et la matrice de confusion, les seuils et la courbe ROC qu’un unique chiffre d’exactitude dissimule - chaque nombre calculé sur des données simulées où l’optimum est connu.
Prérequis : Régression logistique et classification
Comparer des classifieurs sur des données réelles a une propriété gênante : on ne sait jamais combien de marge il restait. Une méthode à 12 % d’erreur peut être quasi optimale comme elle peut laisser la moitié de l’exactitude disponible sur la table, et rien dans les données ne dit laquelle. Cet article travaille plutôt sur des données simulées, où le meilleur classifieur possible se calcule exactement - ce qui transforme des comparaisons vagues en mesures.
A. Le classifieur qu’on ne peut pas battre
Si vous connaissiez pour chaque , le mieux à faire serait d’affecter chaque point à la classe de plus grande probabilité. C’est le classifieur de Bayes, optimal pour une raison presque trop courte pour être une preuve : en chaque , la chance de se tromper vaut , et aucune règle ne la rend plus petite en ce point. Optimal partout signifie optimal en moyenne.
Ce qu’il laisse derrière lui,
est le taux d’erreur de Bayes - le pendant en classification de l’erreur irréductible, non nul parce que les classes se recouvrent véritablement.
Deux classes gaussiennes sur la droite, et , également probables. Les densités étant symétriques, la frontière est le milieu et le taux d’erreur vaut . Intégrer le mélange sur quatre millions de points de grille concorde à six décimales.
Interactif : la frontière que rien ne peut battre
Le recouvrement ombré est le plancher d’erreur.
- Erreur de Bayes (le plancher)
- 0.105650
- Frontière x*
- 0.000000
- Coût du point milieu
- 0.000000
À a priori égaux, la frontière est au point milieu et le plancher est le recouvrement des deux courbes. Rien ne passe dessous : les classes occupent véritablement le même terrain. Déplacez maintenant l’a priori. Élargissez σ et le plancher monte, car le plancher n’est rien d’autre que le recouvrement.
B. Les a priori déplacent la frontière - dans quel sens ?
Rendons la classe 1 plus fréquente, . La frontière résout :
Elle se déplace vers la classe la plus rare, agrandissant la région de la classe fréquente. Le contraire est une supposition tentante - la classe abondante n’a-t-elle pas besoin de moins de place ? - et elle est fausse : un point proche de zéro a désormais plus de chances d’être de classe 1 précisément parce qu’il y a davantage de classe 1 d’où venir.
| a priori | frontière | erreur de Bayes | erreur en gardant la frontière à 0 |
|---|---|---|---|
| 0,5 / 0,5 | 0,000000 | 0,105650 | 0,105650 |
| 0,7 / 0,3 | +0,338919 | 0,093565 | 0,105650 |
| 0,9 / 0,1 | +0,878890 | 0,050496 | 0,105650 |
Ignorer l’a priori coûte à 0,7 et fait plus que doubler l’erreur à 0,9. Cela vaut d’être vérifié numériquement plutôt que d’accorder confiance à l’algèbre : la frontière dérivée a été confirmée optimale contre une grille de 240 001 seuils, ce qui est exactement le contrôle qui attrape une erreur de signe - et l’a attrapée, à la première tentative de cet article.
C. L’imiter en comptant
Les données réelles n’ont pas . Les k plus proches voisins l’estiment aussi directement que possible - prendre les points d’entraînement les plus proches et utiliser leurs proportions - puis appliquent la règle de Bayes à cette estimation. Rien n’est ajusté à l’avance ; le jeu d’entraînement est le modèle.
Sur un problème bidimensionnel d’erreur de Bayes , ajusté sur 200 points d’entraînement et évalué sur 20 000 :
| 1 | 3 | 5 | 9 | 15 | 25 | 45 | 75 | 125 | 199 | |
|---|---|---|---|---|---|---|---|---|---|---|
| erreur de test | 0,1382 | 0,1155 | 0,1030 | 0,0976 | 0,0972 | 0,0977 | 0,0977 | 0,1036 | 0,1231 | 0,5049 |
Les extrémités sont la leçon. À , l’erreur d’entraînement est exactement nulle tandis que l’erreur de test, , est la pire du tableau hormis le dégénéré - la démonstration la plus nette disponible que l’erreur d’entraînement n’estime rien. À sur 200, presque tout l’échantillon vote à chaque prédiction, le classifieur cesse de dépendre de , et son erreur est essentiellement l’a priori de classe.
Entre les deux se trouve le U que prédit la décomposition biais-variance, avec une meilleure valeur de en - à moins d’un demi-point du plancher, pour une méthode qui n’a rien supposé de la forme de la frontière.
D. Modéliser les classes plutôt que la frontière
La régression logistique est discriminative : elle vise directement . L’analyse discriminante est générative - elle modélise comme gaussienne pour chaque classe, avec les a priori, et inverse par le théorème de Bayes.
Supposons une covariance partagée. En passant au logarithme et en supprimant ce qui ne dépend pas de , il reste . Développez : le terme ne mentionne jamais , il s’annule donc lorsqu’on compare les classes, et ce qui survit,
est linéaire en . La linéarité est une conséquence de la covariance partagée, non un choix de modélisation indépendant. Donnez à chaque classe son et le terme quadratique demeure : la frontière s’incurve. C’est l’ADQ, à fois les paramètres de covariance.
E. Quand l’hypothèse partagée échoue, et quand elle vous sauve
Classe A à l’origine avec corrélation ; classe B en avec corrélation . Aucune covariance unique ne décrit les deux : la frontière optimale s’incurve donc véritablement, et intégrer le mélange donne un plancher de . Sur 200 points d’entraînement et 200 000 points de test :
| erreur de test | |
|---|---|
| ADL | 0,118955 |
| ADQ | 0,093480 |
| plancher de Bayes | 0,092708 |
La covariance regroupée l’explique : moyenner contre donne un terme hors diagonale de , proche de zéro, qui ne décrit aucune des deux classes. L’ADQ estime et séparément et se pose au-dessus du plancher.
Notez le diagnostic. Ce qui identifie le problème de l’ADL comme du biais est l’écart au plancher, non l’écart à l’ADQ - sans la référence, vous sauriez seulement qu’une méthode en a battu une autre, ce qui est compatible avec la médiocrité des deux.
Renversons maintenant. Un second problème dont la vraie frontière est bien linéaire, plancher , moyenné sur 400 exécutions :
| points d’entraînement | ADL | ADQ | écart |
|---|---|---|---|
| 20 | 0,284479 | 0,312687 | +0,028208 |
| 50 | 0,259854 | 0,268450 | +0,008595 |
| 100 | 0,252059 | 0,255246 | +0,003187 |
| 500 | 0,245630 | 0,246275 | +0,000645 |
| 2000 | 0,244735 | 0,244889 | +0,000154 |
L’ADQ n’est pas fausse ici - un modèle quadratique contient le linéaire, son biais est donc nul et toutes deux convergent vers le plancher. Elle ne peut simplement pas s’offrir ses paramètres à . L’écart se referme de façon monotone, ce qui est l’arbitrage biais-variance apparaissant comme règle de sélection de modèle plutôt que comme schéma.
Deux de ces trois nombres tiennent à la population et non à un ajustement, et la figure ci-dessous les calcule : le plancher de Bayes à 0,092708 et l'erreur de la droite vers laquelle LDA converge avec des données illimitées, 0,114143. L'écart entre les deux est le biais de LDA, et aucune quantité de données ne l'efface : le 0,118955 mesuré plus haut, c'est ce biais plus l'erreur d'estimation d'un ajustement sur 200 points. Cette droite n'est même pas la meilleure possible : la droite qui minimise l'erreur, parallèle à celle de LDA mais décalée vers B, fait 0,106416, car LDA suppose une covariance que les classes ne partagent pas. Ramenez la corrélation à zéro et regardez la courbe se poser sur la droite, le biais disparaissant : c'est la prémisse du renversement qui suit.
Interactif : ce que coûte une frontière droite
Les deux taux d’erreur intégrés depuis la population, non ajustés.
- Plancher de Bayes
- 0.092708
- Droite limite de LDA
- 0.114143
- Coût de la droite de LDA
- 0.021435
- Hors-diagonale poolée
- 0.000000
À une corrélation de 0.75 dans une classe et -0.75 dans l’autre, aucune covariance unique ne décrit les deux : la frontière optimale se courbe vraiment. Le plancher vaut 0.092708 et la droite vers laquelle LDA converge avec des données illimitées 0.114143, soit un biais de 0.021435 qu’aucune quantité de données n’efface.
F. Ce qu’un taux d’erreur unique dissimule
Chaque chiffre ci-dessus est un nombre unique, et les nombres uniques cachent la forme des erreurs. Le du classifieur ADQ se décompose ainsi :
| prédit B | prédit A | |
|---|---|---|
| réellement B | 96 288 | 3 899 |
| réellement A | 14 797 | 85 016 |
Sensibilité , spécificité . Il est nettement meilleur à une tâche qu’à l’autre.
Avant d’incriminer l’ajustement, calculez ce que fait la règle de Bayes classe par classe : sensibilité , spécificité . Le classifieur optimal est asymétrique lui aussi, dans presque la même mesure. Les deux classes sont aussi étalées l’une que l’autre, mais le grand axe d’A pointe vers B (variance 1,75 le long de la droite qui joint les centres) tandis que B est étroite dans cette direction (0,25) - la queue d’A déborde dans la région de B, et la règle optimale cède davantage d’A en échange. Le déséquilibre appartient au problème, non au modèle, et la façon de le savoir est de calculer la référence plutôt que de raisonner à son sujet.
G. Le seuil est une décision, pas un réglage par défaut
Le seuil ne fait pas partie du modèle. Le déplacer change la règle de décision alors que chaque paramètre ajusté reste en place :
| seuil | taux d’erreur | sensibilité | spécificité |
|---|---|---|---|
| 0,5 | 0,093480 | 0,961083 | 0,851753 |
| 0,3 | 0,101905 | 0,983351 | 0,812519 |
| 0,2 | 0,110480 | 0,990598 | 0,788064 |
| 0,1 | 0,126415 | 0,995928 | 0,750784 |
Le taux d’erreur dit que 0,5 est le meilleur, mais il pèse également un faux positif et un faux négatif, et cette pondération est une hypothèse. Là où un positif manqué coûte dix fois une fausse alerte, minimiser le taux d’erreur c’est minimiser la mauvaise quantité.
Balayer le seuil et relever chaque paire (taux de faux positifs, taux de vrais positifs) trace la courbe ROC, dont l’aire a une lecture exacte : la probabilité qu’un positif tiré au hasard soit mieux noté qu’un négatif tiré au hasard. Calculer cette aire par la règle du trapèze et calculer la statistique de Mann-Whitney sur les scores bruts concordent ici à la précision des flottants près - l’équivalence est une identité, non une approximation. Sur tous les seuils, l’ADQ obtient contre pour l’ADL.
Comme seul l’ordre compte, l’AUC est aveugle à la calibration : un modèle qui classe parfaitement en annonçant chaque probabilité entre et a une AUC de 1.
La figure ci-dessous est la règle optimale de ce problème, intégrée et non ajustée : sa ligne par défaut est donc la référence citée plus haut, 9,27 % d'erreur, 0,953 de sensibilité, 0,862 de spécificité. Déplacez le seuil et rien n'est réestimé ; seule bouge la ligne entre oui et non, et les quatre cases se rééquilibrent. Rendez ensuite la classe B rare, un cas sur cent. La sensibilité et la spécificité ne bougent pas, car ni l'une ni l'autre ne voit la rareté de la classe, tandis que l'exactitude rejoint la spécificité et que la précision s'effondre.
Interactif : un modèle, tous les seuils
Rien n’est réestimé. Seule bouge la ligne entre oui et non.
Matrice de confusion sur 200 000 points de test
| prédit B | prédit A | |
|---|---|---|
| vraiment B | 95,277 | 4,723 |
| vraiment A | 13,818 | 86,182 |
- Sensibilité
- 95.3%
- Spécificité
- 86.2%
- Taux d’erreur
- 9.3%
- AUC
- 0.9657
- Exactitude
- 90.7%
- Précision
- 87.3%
- Référence majoritaire
- 50.0%
fréquence de la classe B
Le seuil par défaut, et ce taux d’erreur de 9,27 % est le meilleur que le problème autorise : aucune règle ne fait mieux, puisque ce sont les vraies probabilités a posteriori. Il reste pourtant asymétrique, 95.3% contre 86.2%. La règle optimale cède neuf points de plus sur A que sur B : la matrice déséquilibrée est un fait du problème, non un défaut de l’ajustement.
Points clés
- Le classifieur de Bayes est optimal et exige la réponse pour être calculé, ce qui fait des données simulées le seul endroit où la marge restante d’une méthode est visible.
- Les a priori déplacent la frontière vers la classe la plus rare ; les ignorer a coûté à un partage 0,7/0,3 et doublé l’erreur à 0,9/0,1.
- Dans les k plus proches voisins, est le bouton de flexibilité : erreur d’entraînement nulle à , a priori de classe à , et la meilleure valeur entre les deux.
- Une covariance partagée est ce qui rend linéaire une frontière discriminante. Le choix de la partager est dicté autant par la taille d’échantillon que par la vérité.
- Diagnostiquez le biais contre le plancher de Bayes, non contre une méthode concurrente.
- Rapportez la matrice de confusion avant l’exactitude, choisissez le seuil d’après les coûts, et lisez l’AUC comme un classement et non une calibration.
Et ensuite
Toutes les méthodes vues ici traçaient une frontière à partir d’un modèle ajusté. Les ensembles empruntent une autre voie - ajuster de nombreux modèles faibles et les combiner - et la raison pour laquelle cela fonctionne est un argument de variance et non de biais.
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
- Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· Bibliothèque de référence Kudos AI
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.