Aller au contenu
Kudos AI

Statistique

Estimation, inférence, et la discipline qui consiste à dire jusqu’où un chiffre est digne de confiance. Les fondations de tout modèle qui prétend avoir appris quelque chose.

75 éléments

Parcours (12)

Fondements des probabilités et de la statistique

Raisonner rigoureusement sur l'incertitude, puis aborder le problème central de l'apprentissage : séparer l'erreur que l'on peut supprimer de celle que l'on ne peut pas.

Apprentissage automatique supervisé

Démontrer les méthodes supervisées de référence au lieu de simplement les appeler : moindres carrés, régression logistique, pénalités de rétrécissement et ensembles d'arbres.

Apprentissage non supervisé

Trouver de la structure dans des données sans réponse à prédire, et en assumer la conséquence : sans y il n'y a pas d'erreur hors échantillon, et chaque choix doit donc être défendu autrement.

Au-delà de la linéarité

Gardez les moindres carrés et changez ce sur quoi vous régressez : des fonctions de base fixées achètent de la courbure, des contraintes achètent de la régularité, et une pénalité achète une courbe qui choisit elle-même sa souplesse.

Apprendre des modèles probabilistes

Quand les données sont complètes, apprendre un modèle probabiliste revient à compter - la dérivée de la log-vraisemblance fait le reste. Quand des variables sont cachées, il n’y a rien à compter, et le remède consiste à deviner les effectifs, réajuster, et recommencer jusqu’à ce que la vraisemblance cesse de monter.

Méthodes de classification comparées

Il existe un classifieur qu’aucune méthode ne peut battre, et il lui faut la réponse pour se construire. Tout le reste - plus proches voisins, analyse discriminante, régression logistique - est une supposition différente sur ce qu’il aurait fait, et les suppositions échouent dans des directions différentes.

Inférence statistique

Ce qu'un échantillon peut et ne peut pas dire de la population qui l'a produit : comment un estimateur se trompe, ce qu'un intervalle de confiance promet réellement, et ce qu'est une valeur p - avec les trois endroits où chacun est couramment lu comme quelque chose de plus fort qu'il n'est.

Inference causale

Pourquoi une comparaison entre traites et non traites peut porter le mauvais signe, ce que la randomisation achete reellement, et la regle qui dit sur quelles variables ajuster - y compris celles qui degradent la reponse.

Séries temporelles

Ce qui casse quand les observations ne sont pas indépendantes : une régression qui trouve une relation entre deux séries sans rapport, des écarts-types faux d’un facteur connu, et une découpe de validation qui annonce un modèle plus de cinq fois meilleur qu’il ne l’est.

Expérimentation et tests A/B

Ce que rapporte une expérience en ligne trop petite, consultée trop souvent ou lue sur trop de métriques : un effet gonflé 2,4 fois, un taux de faux positifs de 19 % au lieu de 5 %, et un segment vainqueur dans près de la moitié des expériences où il ne s’est rien passé.

Systèmes de recommandation

Deux décalages ajustés qui livrent les deux tiers du gain d’exactitude avant l’apprentissage du moindre facteur latent, un modèle 1,28 fois pire pour les utilisateurs qui lui ont le moins parlé, et l’angle mort qui s’ouvre quand un système ne voit jamais que les notes de ce qu’il a choisi de montrer.

Détection d’anomalies

Un détecteur qui ne se déclenche jamais obtient 99,5 % de justesse, une ROC de 0,9468 masque une file d’alertes fausse à 64 %, la distance à la moyenne se classe sous le hasard quand les anomalies siègent au centre, et vingt anomalies groupées se cachent les unes les autres de la méthode conçue pour les trouver.

Encyclopédie (28)

Surapprentissage

Situation où un modèle apprend le bruit et les particularités de ses données d’entraînement plutôt que la structure sous-jacente, si bien qu’il excelle à l’entraînement et échoue sur des données nouvelles.

Compromis biais-variance

La décomposition de l’erreur de prédiction espérée d’un modèle en biais, variance et bruit irréductible, et la tension par laquelle réduire l’un des deux premiers augmente généralement l’autre.

Validation croisée

Une méthode de rééchantillonnage qui estime l’erreur de test d’un modèle en l’ajustant à répétition sur une partie des données et en l’évaluant sur la partie mise de côté.

Régularisation

Toute technique qui contraint la complexité effective d’un modèle afin de réduire la variance et d’améliorer la généralisation, typiquement en pénalisant les grandes valeurs de paramètres.

Théorème de Bayes

Une règle de mise à jour de la probabilité d’une hypothèse à la lumière d’un indice nouveau, par inversion d’une probabilité conditionnelle.

Estimation par maximum de vraisemblance

Une méthode d’ajustement d’un modèle qui choisit les valeurs de paramètres rendant les données observées les plus probables.

Régression linéaire

Un modèle qui prédit une réponse numérique comme une somme pondérée des prédicteurs, ajusté en minimisant l’erreur quadratique.

Régression logistique

Un modèle de classification qui prédit la probabilité d’une classe en faisant passer une combinaison linéaire des prédicteurs par la fonction logistique.

Bagging et forêts aléatoires

Des méthodes d’ensemble qui réduisent la variance en moyennant de nombreux modèles ajustés à des rééchantillons bootstrap, les forêts aléatoires décorrélant en outre les arbres en restreignant les variables disponibles à chaque division.

Spline

Un polynôme par morceaux raccordé en des points choisis appelés nœuds, contraint de sorte que la fonction et ses dérivées d’ordre inférieur y restent continues, ce qui donne une souplesse locale sans le comportement sauvage d’un polynôme de haut degré.

Partitionnement en k moyennes

Un algorithme non supervisé qui partitionne les observations en k groupes en alternant l’affectation des points au centroïde le plus proche et le recalcul des centroïdes.

Espérance–Maximisation

Une méthode itérative d’estimation par maximum de vraisemblance lorsque certaines variables ne sont pas observées : elle calcule la loi a posteriori des variables cachées sous les paramètres courants, puis réajuste les paramètres comme si ces effectifs espérés avaient été observés.

k plus proches voisins

Un classifieur non paramétrique qui prédit la classe d’un point par un vote majoritaire parmi les k observations d’entraînement les plus proches de lui.

Analyse discriminante linéaire

Un classifieur génératif qui modélise chaque classe par une gaussienne et retourne ces modèles par le théorème de Bayes ; une matrice de covariance partagée par toutes les classes donne une frontière linéaire, une par classe donne une frontière quadratique.

Courbe ROC

Un tracé du taux de vrais positifs d’un classifieur contre son taux de faux positifs à mesure que le seuil de décision balaie toute son étendue, résumant tous les arbitrages disponibles entre les deux types d’erreur.

Classification hiérarchique

Une méthode non supervisée qui construit un arbre de classes emboîtées en fusionnant à répétition les deux groupes les moins dissemblables, de sorte que couper l'arbre à n'importe quelle hauteur donne un regroupement.

Analyse en composantes principales

Une technique qui réexprime les données dans de nouvelles coordonnées non corrélées, ordonnées selon la variance que chacune explique, permettant de réduire la dimension en ne gardant que les premières.

Valeur p

La probabilité d’observer des données au moins aussi extrêmes que celles dont on dispose, calculée en supposant l’hypothèse nulle vraie. Elle mesure à quel point l’échantillon serait inhabituel dans un monde où l’effet est absent, et rien d’autre.

Intervalle de confiance

Un intervalle calculé à partir des données par une procédure qui, répétée sur de nombreux échantillons, contient la vraie valeur une proportion annoncée du temps. Cette proportion est une propriété de la procédure, non d’un intervalle particulier qu’elle produit.

Puissance statistique

La probabilité qu’un test rejette l’hypothèse nulle lorsqu’une alternative précise est vraie. C’est la chance de détecter un effet réellement présent, et elle est fixée par le protocole avant toute collecte de données.

Facteur de confusion

Une variable qui influence a la fois le traitement et le resultat, de sorte qu'une comparaison entre traites et non traites mesure la difference entre les groupes autant que l'effet du traitement.

Graphe causal

Un dessin des relations de cause a effet supposees, sous forme de fleches entre variables, servant a decider quelles variables doivent etre ajustees et lesquelles ne doivent pas l'etre - question a laquelle les donnees seules ne repondent pas.

Stationnarité

Propriété d’une série dont le comportement statistique ne dépend pas du moment où on la regarde : la moyenne, la variance et la structure de corrélation sont les mêmes dans toutes les fenêtres. Presque toutes les méthodes classiques la supposent, et la plupart des séries réelles ne l’ont pas.

Autocorrélation

La corrélation d’une série avec une copie décalée d’elle-même, qui mesure combien de temps persiste l’influence d’une observation. C’est la structure qui rend les séries temporelles informatives et la raison pour laquelle les écarts-types usuels ne s’y appliquent pas.

Comparaisons multiples

L’inflation des faux positifs qui survient dès que plus d’un test, d’une métrique, d’un segment ou d’un point d’arrêt peut produire le résultat annoncé. Chaque chance supplémentaire augmente la probabilité que quelque chose franchisse le seuil par pure chance.

Factorisation matricielle

Un modèle qui explique une table d’interactions creuse comme le produit de deux petites matrices, donnant à chaque utilisateur et à chaque article un court vecteur de traits appris dont le produit scalaire prédit les cases manquantes.

Précision et rappel

Deux taux qui séparent ce que l’exactitude masque : la précision est la part des positifs prédits qui sont réels, le rappel est la part des positifs réels qui ont été trouvés.

Détection d’anomalies

Trouver les rares observations qui n’ont pas été produites par le processus ayant produit les autres. La difficulté propre au domaine n’est pas l’algorithme mais le taux de base : à 0,5 % d’anomalies, un détecteur qui ne se déclenche jamais est juste à 99,5 %, et la plupart des métriques standard héritent de ce nombre au lieu de mesurer une compétence.

Articles (21)

La direction qui change quand vous changez d’unité

Douze personnes, deux mesures, et trois premières composantes principales différentes : en millimètres la réponse est presque uniquement la taille, en mètres presque uniquement le poids, et en centimètres un mélange équilibré - la corrélation restant fixée à 0,9500 dans les trois cas. Ce que cela dit de ce que l’ACP maximise, pourquoi une proportion de variance expliquée de 99,999 % peut être un énoncé sur les mètres plutôt que sur les personnes, et ce que la standardisation choisit réellement.

La variable de contrôle qui invente une relation

Deux causes indépendantes et un effet commun. Contrôlez l’effet et les causes acquièrent une corrélation d’exactement -1 : une régression de A sur B donne un coefficient de +0,0030, et ajouter l’effet commun comme contrôle le transforme en -1,0000. La sélection d’un échantillon fait la même chose de manière invisible, et c’est pourquoi « contrôlez tout ce que vous avez mesuré » n’est pas une règle défendable.

L’intervalle à 95 % qui couvre 81 % du temps

L’intervalle de confiance classique pour une proportion a une couverture exacte que l’on calcule en sommant sur les n+1 échantillons possibles, et à n = 30 avec p = 0,10 elle vaut 0,8085 au lieu de 0,95. La couverture ne s’améliore pas de façon monotone avec n, et dans un contexte d’événements rares elle peut tomber à 0,0392. Deux solutions d’une ligne corrigent cela.

Un score qui perd contre ne rien faire

Un modèle des cinq plus proches voisins obtient 0,9983 en validation croisée aléatoire à cinq blocs sur une marche aléatoire, série dont les incréments sont par construction imprévisibles. Évalué en avançant dans le temps il obtient 0,6559, avec une RMSE 12,44 fois plus grande, et il perd contre la simple reconduction de la dernière valeur observée. C’est la découpe, non le modèle, qui a produit le premier nombre.

Le détecteur qui ne se déclenche jamais est juste à 99,5 %

À un taux de base réaliste, le détecteur inerte gagne sur la justesse, une ROC de 0,9468 masque une file d’alertes fausse à 64 %, la distance à la moyenne se classe sous le hasard quand les anomalies siègent au centre, et vingt anomalies groupées se cachent les unes les autres de la méthode conçue pour les trouver.

Le traitement qui aide tout le monde et nuit à la moyenne

Un traitement qui augmente la guérison d'exactement cinq points dans chaque sous-groupe tout en semblant l'abaisser globalement, pourquoi plus de données rend cette conclusion plus assurée et non plus juste, ce que la randomisation achète et que l'ajustement ne peut pas, et le cas où contrôler une variable fabrique une association à partir de rien.

La régression qui trouve une relation qui n’existe pas

Deux séries engendrées à partir de nombres aléatoires distincts ressortent significativement liées dans 82,8 % des cas, un écart-type sur données dépendantes est trop étroit d’un facteur calculable de 2,4, et la découpe de validation habituelle annonce un prévisionniste plus de cinq fois meilleur qu’il ne l’est. Trois échecs, une seule cause, et les vérifications qui attrapent chacun d’eux.

Le modèle qui choisit ses propres données d’entraînement

Deux décalages ajustés livrent 66 % du gain d’exactitude d’un recommandeur avant l’apprentissage du moindre facteur latent, l’erreur est 1,28 fois pire pour les utilisateurs qui ont le moins parlé, seuls 30 % du catalogue atteignent le top dix de qui que ce soit sans aucun terme explicite de popularité, et après six tours de données auto-sélectionnées le système est 1,14 fois pire exactement là où il a cessé de regarder.

L’expérience qui allait gagner de toute façon

Un test de 2 000 utilisateurs par bras rapporte des effets 2,4 fois trop grands. Un test A/A consulté dix fois ressort significatif 19 % du temps. Vingt métriques nulles indépendantes produisent un vainqueur 64 % du temps, et douze segments nuls 46 %. Quatre nombres, une seule cause, et les décisions à prendre avant l’arrivée des données.

Ce qu'un échantillon peut et ne peut pas vous dire

Les estimateurs comme variables aléatoires dotées de leur propre distribution, le cas où l'estimateur sans biais est le moins bon, ce qu'un intervalle de confiance promet réellement et l'intervalle standard qui délivre 87 % là où il en annonce 95, et ce dont une valeur p est la probabilité - chaque chiffre calculé exactement ou par simulation à graine fixée.

Apprendre les nombres d’un modèle probabiliste

D’où viennent réellement les nombres d’un réseau bayésien ou d’une gaussienne : la recette en trois temps du maximum de vraisemblance déroulée sur des paramètres discrets puis continus, l’a priori Beta qui répare ce qu’elle fait d’un événement jamais vu, Bayes naïf et l’unique effectif nul qui le détruit, et l’algorithme EM pour le cas où les effectifs ne peuvent pas être relevés du tout - chaque chiffre calculé plutôt qu’affirmé.

Comparer les classifieurs, et ce que l’exactitude dissimule

Le classifieur de Bayes que rien ne peut battre et le plancher d’erreur qu’il laisse, les k plus proches voisins comme imitation non paramétrique avec k pour bouton de flexibilité, l’analyse discriminante et pourquoi une covariance partagée impose une droite, et la matrice de confusion, les seuils et la courbe ROC qu’un unique chiffre d’exactitude dissimule - chaque nombre calculé sur des données simulées où l’optimum est connu.

Au-delà de la linéarité : splines et modèles additifs

Comment ajuster des relations courbes sans quitter les moindres carrés : les fonctions de base, les contraintes qui transforment un polynôme par morceaux cassé en une spline, l’unique colonne supplémentaire par nœud qui les impose gratuitement, et la pénalité de rugosité qui laisse une courbe choisir sa propre souplesse.

Apprentissage non supervisé : de la structure sans étiquettes

Ce qui change quand il n’y a pas de réponse à prédire : les composantes principales comme direction de variance maximale, les K-moyennes et les optima locaux où elles se figent, la classification hiérarchique et le saut qui décide de la réponse - et pourquoi aucun des choix requis ne peut être validé comme l’est un classifieur.

Qu’est-ce que l’apprentissage statistique ?

Le cadre commun à tout modèle prédictif : estimer une fonction inconnue f à partir des données, la séparation entre erreur réductible et irréductible, et pourquoi prédiction et inférence tirent dans des directions opposées.

Le compromis biais-variance

La décomposition exacte de l’erreur de test espérée en biais au carré, variance et bruit irréductible, démontrée numériquement par une simulation de 2 000 tirages où les trois termes sont mesurés séparément et vérifiés comme s’additionnant.

La validation croisée et le rééchantillonnage

Pourquoi l’erreur d’entraînement est une estimation biaisée de l’erreur de test, et comment l’ensemble de validation, le leave-one-out et le k-fold y remédient, avec une LOOCV à cinq observations calculée point par point.

La régression linéaire à partir des premiers principes

Dériver les coefficients des moindres carrés en différenciant la somme des carrés des résidus, puis mener à la main un ajustement complet sur cinq observations : coefficients, valeurs ajustées, résidus, RSS et R², chacun vérifié numériquement.

La régression logistique et la classification

Pourquoi une droite ne peut pas modéliser une probabilité, comment la fonction logistique y remédie, et ce que signifient les coefficients en log-cotes, avec un pas de montée de gradient et un ajustement convergé calculés et vérifiés numériquement.

La régularisation : ridge et lasso

Ajouter une pénalité sur la taille des coefficients pour échanger un peu de biais contre une forte réduction de variance, et pourquoi la pénalité L1 annule exactement des coefficients quand L2 se contente de les rétrécir, les deux ajustées numériquement.

Les arbres de décision et les ensembles

Comment la division binaire récursive construit un arbre, pourquoi l’indice de Gini bat le taux d’erreur comme critère de division, et comment le bagging et les forêts aléatoires transforment un apprenant à forte variance en un apprenant puissant, avec l’arithmétique d’une division déroulée.

Outils (7)

Calculateur de taux de base

Saisissez une prévalence, une sensibilité et un taux de faux positifs pour voir ce que vaut réellement un test positif - en probabilité et en nombre de personnes sur dix mille.

Explorateur de métriques de classification

Déplacez un seuil de décision sur une population déséquilibrée et observez précision, rappel, F1 et le point ROC suivre - y compris le régime où l’exactitude paraît excellente alors que le modèle ne sert à rien.

Simulateur d’intervalles de confiance

Tirez trente échantillons, formez un intervalle de confiance pour chacun et comptez ceux qui couvrent la vérité - la façon la plus claire de voir que le niveau de confiance décrit la procédure, pas un intervalle isolé.

Explorateur biais-variance

Faites varier la complexité du modèle et la taille de l’échantillon pour voir l’erreur d’apprentissage décroître sans cesse tandis que l’erreur de test remonte, décomposée en biais, variance et bruit irréductible.

Explorateur de distributions

Changez les paramètres des distributions qui reviennent sans cesse dans le contenu et observez la forme, la moyenne et la dispersion réagir.

Explorateur du maximum de vraisemblance

Déplacez un paramètre le long de la courbe de log-vraisemblance d’un échantillon fixe et voyez la distribution ajustée suivre, le sommet se trouvant exactement à l’estimateur du maximum de vraisemblance.

Planificateur d’étude

Choisissez un objectif - fondements, méthodes supervisées ou IA moderne - et obtenez le plan ordonné propre à ce site pour l’atteindre : quel parcours suivre à chaque étape, quoi lire en parallèle, et combien de temps durent les leçons.

Jeux de données (3)

Recherche (2)

Projets (2)

Thèmes liés