Encyclopédie
Une référence concise et interconnectée. Chaque entrée renvoie aux concepts liés et aux articles qui approfondissent.
Parcourir par sujet
A
A priori conjugué
Un a priori choisi pour que l’a posteriori appartienne à la même famille, ce qui réduit la mise à jour bayésienne à de l’arithmétique sur les paramètres et rend l’a priori lisible comme un nombre d’observations imaginaires.
Analyse discriminante linéaire
Un classifieur génératif qui modélise chaque classe par une gaussienne et retourne ces modèles par le théorème de Bayes ; une matrice de covariance partagée par toutes les classes donne une frontière linéaire, une par classe donne une frontière quadratique.
Analyse en composantes principales
Une technique qui réexprime les données dans de nouvelles coordonnées non corrélées, ordonnées selon la variance que chacune explique, permettant de réduire la dimension en ne gardant que les premières.
Apprentissage PAC
Une definition de l'apprenabilite ou un algorithme doit renvoyer, avec forte probabilite, une hypothese dont l'erreur vraie reste dans une tolerance choisie - en utilisant un nombre d'echantillons borne a l'avance plutot que decouvert apres coup.
Apprentissage Q
Un algorithme d’apprentissage par renforcement qui apprend directement de l’expérience la valeur de chaque action dans chaque état, sans modèle de l’environnement.
Arbre de décision
Un modèle qui prédit en appliquant une suite de tests à seuil sur des variables isolées, divisant les données en groupes de plus en plus homogènes.
Autocorrélation
La corrélation d’une série avec une copie décalée d’elle-même, qui mesure combien de temps persiste l’influence d’une observation. C’est la structure qui rend les séries temporelles informatives et la raison pour laquelle les écarts-types usuels ne s’y appliquent pas.
B
C
Calendrier de taux d’apprentissage
Une règle qui fait varier la taille du pas au fil de l’entraînement : grand au début pour que l’exécution puisse voyager, petit à la fin pour qu’elle puisse se poser.
Classification hiérarchique
Une méthode non supervisée qui construit un arbre de classes emboîtées en fusionnant à répétition les deux groupes les moins dissemblables, de sorte que couper l'arbre à n'importe quelle hauteur donne un regroupement.
Comparaisons multiples
L’inflation des faux positifs qui survient dès que plus d’un test, d’une métrique, d’un segment ou d’un point d’arrêt peut produire le résultat annoncé. Chaque chance supplémentaire augmente la probabilité que quelque chose franchisse le seuil par pure chance.
Compromis biais-variance
La décomposition de l’erreur de prédiction espérée d’un modèle en biais, variance et bruit irréductible, et la tension par laquelle réduire l’un des deux premiers augmente généralement l’autre.
Conditionnement
Le rapport entre la plus grande et la plus petite courbure d’une surface de perte, qui détermine à lui seul la vitesse à laquelle la descente de gradient peut y converger.
Courbe ROC
Un tracé du taux de vrais positifs d’un classifieur contre son taux de faux positifs à mesure que le seuil de décision balaie toute son étendue, résumant tous les arbitrages disponibles entre les deux types d’erreur.
D
Descente de gradient
Un algorithme d’optimisation itératif qui minimise une fonction en avançant de façon répétée dans la direction opposée à son gradient.
Descente de gradient stochastique
Une descente de gradient où chaque pas utilise le gradient d’un petit échantillon aléatoire des données plutôt que de leur totalité, échangeant une direction exacte contre bien plus de pas par unité de calcul.
Détection d’anomalies
Trouver les rares observations qui n’ont pas été produites par le processus ayant produit les autres. La difficulté propre au domaine n’est pas l’algorithme mais le taux de base : à 0,5 % d’anomalies, un détecteur qui ne se déclenche jamais est juste à 99,5 %, et la plupart des métriques standard héritent de ce nombre au lieu de mesurer une compétence.
Dimension de Vapnik-Chervonenkis
La taille du plus grand ensemble de points qu'une famille de classifieurs peut etiqueter de toutes les facons possibles. Elle mesure la capacite par ce qu'une classe sait faire plutot que par le nombre de ses membres, ce qui la rend utilisable pour des familles infinies.
Divergence de Kullback-Leibler
Le nombre de bits supplémentaires payés par symbole pour décrire une distribution avec un code construit pour une autre. Elle est nulle seulement quand les deux coïncident, jamais négative, et non symétrique : c’est un coût plutôt qu’une distance.
E
Entropie croisée
Une mesure de la différence entre deux distributions de probabilité, utilisée comme fonction de perte standard en classification.
Espérance–Maximisation
Une méthode itérative d’estimation par maximum de vraisemblance lorsque certaines variables ne sont pas observées : elle calcule la loi a posteriori des variables cachées sous les paramètres courants, puis réajuste les paramètres comme si ces effectifs espérés avaient été observés.
F
Facteur de confusion
Une variable qui influence a la fois le traitement et le resultat, de sorte qu'une comparaison entre traites et non traites mesure la difference entre les groupes autant que l'effet du traitement.
Factorisation matricielle
Un modèle qui explique une table d’interactions creuse comme le produit de deux petites matrices, donnant à chaque utilisateur et à chaque article un court vecteur de traits appris dont le produit scalaire prédit les cases manquantes.
G
I
K
M
N
P
Partitionnement en k moyennes
Un algorithme non supervisé qui partitionne les observations en k groupes en alternant l’affectation des points au centroïde le plus proche et le recalcul des centroïdes.
Perplexité
L’exponentielle de l’entropie croisée moyenne d’un modèle, lue comme le nombre d’options équiprobables entre lesquelles il choisit effectivement à chaque pas.
Précision et rappel
Deux taux qui séparent ce que l’exactitude masque : la précision est la part des positifs prédits qui sont réels, le rappel est la part des positifs réels qui ont été trouvés.
Préentraînement et affinage
La recette en deux temps consistant à entraîner d’abord un modèle sur un grand corpus générique, puis à l’adapter à une tâche précise avec un jeu de données étiquetées bien plus petit.
R
Régression linéaire
Un modèle qui prédit une réponse numérique comme une somme pondérée des prédicteurs, ajusté en minimisant l’erreur quadratique.
Régression logistique
Un modèle de classification qui prédit la probabilité d’une classe en faisant passer une combinaison linéaire des prédicteurs par la fonction logistique.
Régularisation
Toute technique qui contraint la complexité effective d’un modèle afin de réduire la variance et d’améliorer la généralisation, typiquement en pénalisant les grandes valeurs de paramètres.
Réseau de neurones
Un modèle composé de couches d’unités simples, chacune calculant une somme pondérée suivie d’une fonction non linéaire, ajusté par descente de gradient au moyen de la rétropropagation.
S
Softmax
Une fonction qui transforme un vecteur de scores réels en distribution de probabilité en exponentiant chaque score et en divisant par le total, ce qui préserve leur ordre tout en les rendant positifs et de somme un.
Spline
Un polynôme par morceaux raccordé en des points choisis appelés nœuds, contraint de sorte que la fonction et ses dérivées d’ordre inférieur y restent continues, ce qui donne une souplesse locale sans le comportement sauvage d’un polynôme de haut degré.
Stationnarité
Propriété d’une série dont le comportement statistique ne dépend pas du moment où on la regarde : la moyenne, la variance et la structure de corrélation sont les mêmes dans toutes les fenêtres. Presque toutes les méthodes classiques la supposent, et la plupart des séries réelles ne l’ont pas.
Surapprentissage
Situation où un modèle apprend le bruit et les particularités de ses données d’entraînement plutôt que la structure sous-jacente, si bien qu’il excelle à l’entraînement et échoue sur des données nouvelles.