Encyclopédie
Une référence concise et interconnectée. Chaque entrée renvoie aux concepts liés et aux articles qui approfondissent.
Parcourir par sujet
A
A priori conjugué
Un a priori choisi pour que l’a posteriori appartienne à la même famille, ce qui réduit la mise à jour bayésienne à de l’arithmétique sur les paramètres et rend l’a priori lisible comme un nombre d’observations imaginaires.
Analyse en composantes principales
Une technique qui réexprime les données dans de nouvelles coordonnées non corrélées, ordonnées selon la variance que chacune explique, permettant de réduire la dimension en ne gardant que les premières.
Apprentissage PAC
Une definition de l'apprenabilite ou un algorithme doit renvoyer, avec forte probabilite, une hypothese dont l'erreur vraie reste dans une tolerance choisie - en utilisant un nombre d'echantillons borne a l'avance plutot que decouvert apres coup.
C
Cohérence d’arc
Une propriété d’un problème de contraintes où chaque valeur de chaque domaine possède au moins une valeur de soutien dans chaque domaine voisin, et l’algorithme qui l’impose en supprimant celles qui n’en ont pas.
Conditionnement
Le rapport entre la plus grande et la plus petite courbure d’une surface de perte, qui détermine à lui seul la vitesse à laquelle la descente de gradient peut y converger.
D
Descente de gradient
Un algorithme d’optimisation itératif qui minimise une fonction en avançant de façon répétée dans la direction opposée à son gradient.
Descente de gradient stochastique
Une descente de gradient où chaque pas utilise le gradient d’un petit échantillon aléatoire des données plutôt que de leur totalité, échangeant une direction exacte contre bien plus de pas par unité de calcul.
Dimension de Vapnik-Chervonenkis
La taille du plus grand ensemble de points qu'une famille de classifieurs peut etiqueter de toutes les facons possibles. Elle mesure la capacite par ce qu'une classe sait faire plutot que par le nombre de ses membres, ce qui la rend utilisable pour des familles infinies.
Divergence de Kullback-Leibler
Le nombre de bits supplémentaires payés par symbole pour décrire une distribution avec un code construit pour une autre. Elle est nulle seulement quand les deux coïncident, jamais négative, et non symétrique : c’est un coût plutôt qu’une distance.
É
F
I
M
R
S
Softmax
Une fonction qui transforme un vecteur de scores réels en distribution de probabilité en exponentiant chaque score et en divisant par le total, ce qui préserve leur ordre tout en les rendant positifs et de somme un.
Spline
Un polynôme par morceaux raccordé en des points choisis appelés nœuds, contraint de sorte que la fonction et ses dérivées d’ordre inférieur y restent continues, ce qui donne une souplesse locale sans le comportement sauvage d’un polynôme de haut degré.