Aller au contenu
Kudos AI

Naïf de Bayes

Un classifieur qui applique le théorème de Bayes en supposant toutes les variables conditionnellement indépendantes étant donné la classe.

Aussi appelé : Classifieur naïf de Bayes, Classifieur bayésien

Comprendre Naïf de Bayes

Pour classer par probabilité, on voudrait P(classe | variables), qui par le théorème de Bayes est proportionnel à P(variables | classe) · P(classe). La difficulté est le premier facteur : modéliser la loi jointe de toutes les variables simultanément demande une quantité de données qui croît exponentiellement avec leur nombre.

Le naïf de Bayes tranche le nœud en supposant les variables conditionnellement indépendantes étant donné la classe. Sous cette hypothèse, la vraisemblance jointe se factorise en un produit de termes unidimensionnels, chacun estimable par de simples comptages ou un ajustement de densité simple. Un modèle à mille variables n’a besoin que de mille petites estimations plutôt que d’une estimation jointe intraitable. Russell et Norvig décrivent exactement cette structure, une cause unique influençant de nombreux effets conditionnellement indépendants étant donné la cause, et notent que le modèle est dit « naïf » précisément parce qu’il est couramment appliqué là où cette indépendance ne tient pas vraiment.

L’hypothèse est presque toujours violée : en classification de textes, la présence d’un mot change manifestement les chances d’apparition des mots apparentés. Ce qui sauve la méthode, c’est que la classification ne dépend que de la classe au score le plus élevé, non de l’exactitude des scores. L’hypothèse d’indépendance déforme les magnitudes, souvent gravement, tout en laissant fréquemment l’ordre intact.

La conséquence pratique est un verdict partagé. Le naïf de Bayes est une base de référence solide et extrêmement rapide pour les problèmes en grande dimension comme le texte, et il reste utilisable quand les données sont rares. Mais ses probabilités de sortie ne doivent pas être lues comme des confiances calibrées : elles sont habituellement poussées vers 0 et 1, parce que multiplier de nombreux termes corrélés comme s’ils étaient indépendants surestime les preuves accumulées.

Comment calculer

ŷ = argmax_c P(c) · Πⱼ P(xⱼ | c)

où

c
une classe candidate
P(c)
la probabilité a priori de cette classe
P(xⱼ | c)
la vraisemblance que la variable j prenne sa valeur observée, sachant la classe
Πⱼ
produit sur les variables, valide uniquement sous l’hypothèse d’indépendance conditionnelle

Exemple : Naïf de Bayes

Pour un filtre anti-spam, chaque variable est la présence d’un mot donné. Ajuster le modèle est un exercice de comptage : pour chaque classe, enregistrer la fréquence de chaque mot dans les messages de cette classe, et la fréquence de la classe elle-même.

Pour classer un nouveau message, multipliez l’a priori de la classe par les vraisemblances des mots qu’il contient, une fois pour le spam et une fois pour le non-spam, et retenez la plus grande. En pratique le calcul se fait en sommant des logarithmes plutôt qu’en multipliant des probabilités, car un produit de milliers de petits nombres tombe à zéro par sous-dépassement en virgule flottante.

Un mot jamais vu dans les données d’entraînement d’une classe donnerait à cette classe une vraisemblance exactement nulle, anéantissant tout le produit quelles que soient les autres preuves. Le correctif standard est le lissage additif (de Laplace) : ajouter une petite constante à chaque comptage pour qu’aucune probabilité ne soit exactement nulle.

Avantages et inconvénients

Avantages

  • Extrêmement rapide à entraîner et à appliquer, puisqu’il ne demande que des comptages.
  • Fonctionne bien avec de très nombreuses variables et comparativement peu de données.
  • Simple, transparent, et véritablement solide comme référence en classification de textes.

Inconvénients

  • L’hypothèse d’indépendance conditionnelle est presque toujours violée.
  • Les probabilités prédites sont mal calibrées, typiquement bien trop confiantes.
  • Les variables corrélées sont en pratique comptées plusieurs fois, ce qui amplifie leur influence.

Questions fréquentes

Pourquoi fonctionne-t-il alors que son hypothèse centrale est fausse ?

Parce que la décision ne dépend que de la classe au score le plus élevé. Violer l’indépendance déforme les scores, mais préserve fréquemment leur ordre : la classe prédite reste correcte même quand la probabilité prédite est gravement fausse.

Qu’est-ce que le lissage de Laplace et pourquoi est-il nécessaire ?

Il ajoute une petite constante à chaque comptage pour qu’aucune probabilité estimée ne soit exactement nulle. Sans lui, une seule valeur non vue à l’entraînement pour une classe force tout le produit à zéro, laissant un mot absent opposer son veto à toutes les autres preuves.

Le naïf de Bayes gère-t-il des variables continues ?

Oui. L’approche usuelle, le naïf de Bayes gaussien, ajuste une loi normale par variable et par classe et utilise sa densité à la place d’une probabilité comptée. Discrétiser les variables continues en classes est une autre option courante.

En résumé

Le naïf de Bayes achète une immense traitabilité avec une hypothèse qu’il sait fausse, et s’en tire parce que la classification n’a besoin que du bon classement. Utilisez-le comme référence rapide et robuste ; ne prenez pas ses probabilités pour des estimations calibrées.