Encyclopédie
Une référence concise et interconnectée. Chaque entrée renvoie aux concepts liés et aux articles qui approfondissent.
Parcourir par sujet
A
Analyse discriminante linéaire
Un classifieur génératif qui modélise chaque classe par une gaussienne et retourne ces modèles par le théorème de Bayes ; une matrice de covariance partagée par toutes les classes donne une frontière linéaire, une par classe donne une frontière quadratique.
Analyse en composantes principales
Une technique qui réexprime les données dans de nouvelles coordonnées non corrélées, ordonnées selon la variance que chacune explique, permettant de réduire la dimension en ne gardant que les premières.
Autocorrélation
La corrélation d’une série avec une copie décalée d’elle-même, qui mesure combien de temps persiste l’influence d’une observation. C’est la structure qui rend les séries temporelles informatives et la raison pour laquelle les écarts-types usuels ne s’y appliquent pas.
B
C
Classification hiérarchique
Une méthode non supervisée qui construit un arbre de classes emboîtées en fusionnant à répétition les deux groupes les moins dissemblables, de sorte que couper l'arbre à n'importe quelle hauteur donne un regroupement.
Comparaisons multiples
L’inflation des faux positifs qui survient dès que plus d’un test, d’une métrique, d’un segment ou d’un point d’arrêt peut produire le résultat annoncé. Chaque chance supplémentaire augmente la probabilité que quelque chose franchisse le seuil par pure chance.
Compromis biais-variance
La décomposition de l’erreur de prédiction espérée d’un modèle en biais, variance et bruit irréductible, et la tension par laquelle réduire l’un des deux premiers augmente généralement l’autre.
Courbe ROC
Un tracé du taux de vrais positifs d’un classifieur contre son taux de faux positifs à mesure que le seuil de décision balaie toute son étendue, résumant tous les arbitrages disponibles entre les deux types d’erreur.
D
E
Espérance–Maximisation
Une méthode itérative d’estimation par maximum de vraisemblance lorsque certaines variables ne sont pas observées : elle calcule la loi a posteriori des variables cachées sous les paramètres courants, puis réajuste les paramètres comme si ces effectifs espérés avaient été observés.
Estimation par maximum de vraisemblance
Une méthode d’ajustement d’un modèle qui choisit les valeurs de paramètres rendant les données observées les plus probables.
F
Facteur de confusion
Une variable qui influence a la fois le traitement et le resultat, de sorte qu'une comparaison entre traites et non traites mesure la difference entre les groupes autant que l'effet du traitement.
Factorisation matricielle
Un modèle qui explique une table d’interactions creuse comme le produit de deux petites matrices, donnant à chaque utilisateur et à chaque article un court vecteur de traits appris dont le produit scalaire prédit les cases manquantes.
G
I
K
P
Partitionnement en k moyennes
Un algorithme non supervisé qui partitionne les observations en k groupes en alternant l’affectation des points au centroïde le plus proche et le recalcul des centroïdes.
Précision et rappel
Deux taux qui séparent ce que l’exactitude masque : la précision est la part des positifs prédits qui sont réels, le rappel est la part des positifs réels qui ont été trouvés.
Puissance statistique
La probabilité qu’un test rejette l’hypothèse nulle lorsqu’une alternative précise est vraie. C’est la chance de détecter un effet réellement présent, et elle est fixée par le protocole avant toute collecte de données.
R
Régression linéaire
Un modèle qui prédit une réponse numérique comme une somme pondérée des prédicteurs, ajusté en minimisant l’erreur quadratique.
Régression logistique
Un modèle de classification qui prédit la probabilité d’une classe en faisant passer une combinaison linéaire des prédicteurs par la fonction logistique.
Régularisation
Toute technique qui contraint la complexité effective d’un modèle afin de réduire la variance et d’améliorer la généralisation, typiquement en pénalisant les grandes valeurs de paramètres.
S
Spline
Un polynôme par morceaux raccordé en des points choisis appelés nœuds, contraint de sorte que la fonction et ses dérivées d’ordre inférieur y restent continues, ce qui donne une souplesse locale sans le comportement sauvage d’un polynôme de haut degré.
Stationnarité
Propriété d’une série dont le comportement statistique ne dépend pas du moment où on la regarde : la moyenne, la variance et la structure de corrélation sont les mêmes dans toutes les fenêtres. Presque toutes les méthodes classiques la supposent, et la plupart des séries réelles ne l’ont pas.
Surapprentissage
Situation où un modèle apprend le bruit et les particularités de ses données d’entraînement plutôt que la structure sous-jacente, si bien qu’il excelle à l’entraînement et échoue sur des données nouvelles.
T
V
Valeur p
La probabilité d’observer des données au moins aussi extrêmes que celles dont on dispose, calculée en supposant l’hypothèse nulle vraie. Elle mesure à quel point l’échantillon serait inhabituel dans un monde où l’effet est absent, et rien d’autre.
Validation croisée
Une méthode de rééchantillonnage qui estime l’erreur de test d’un modèle en l’ajustant à répétition sur une partie des données et en l’évaluant sur la partie mise de côté.