Optimisation
Comment un modèle apprend vraiment : fonctions objectif, gradients, convexité, et les algorithmes qui cherchent le fond d’une surface de perte dans un espace de paramètres.
Parcours (3)
Apprentissage automatique supervisé
Démontrer les méthodes supervisées de référence au lieu de simplement les appeler : moindres carrés, régression logistique, pénalités de rétrécissement et ensembles d'arbres.
Fondements de l’apprentissage profond
Ce qu'un réseau de neurones calcule réellement, comment la règle de dérivation en chaîne livre tous les gradients en une seule passe arrière, et pourquoi la convolution est le bon a priori pour une image.
Machines à vecteurs de support
Classer en choisissant la bande la plus large qui sépare deux classes, puis l’assouplir pour que quelques points puissent s’y installer, et enfin la courber sans jamais construire l’espace dans lequel elle se courbe.
Encyclopédie (8)
Descente de gradient
Un algorithme d’optimisation itératif qui minimise une fonction en avançant de façon répétée dans la direction opposée à son gradient.
Descente de gradient stochastique
Une descente de gradient où chaque pas utilise le gradient d’un petit échantillon aléatoire des données plutôt que de leur totalité, échangeant une direction exacte contre bien plus de pas par unité de calcul.
Conditionnement
Le rapport entre la plus grande et la plus petite courbure d’une surface de perte, qui détermine à lui seul la vitesse à laquelle la descente de gradient peut y converger.
Calendrier de taux d’apprentissage
Une règle qui fait varier la taille du pas au fil de l’entraînement : grand au début pour que l’exécution puisse voyager, petit à la fin pour qu’elle puisse se poser.
Rétropropagation
L’algorithme qui calcule le gradient de la perte d’un réseau de neurones par rapport à chaque poids, en appliquant la règle de dérivation en chaîne à rebours à travers le réseau.
Régularisation
Toute technique qui contraint la complexité effective d’un modèle afin de réduire la variance et d’améliorer la généralisation, typiquement en pénalisant les grandes valeurs de paramètres.
Machine à vecteurs de support
Un classifieur qui sépare les classes par la frontière laissant la plus large marge possible, déterminée par les seuls points d’entraînement les plus proches.
Équation de Bellman
La condition de cohérence selon laquelle l’utilité d’un état égale sa récompense immédiate plus la valeur actualisée de la meilleure action disponible, moyennée sur les issues que cette action ne contrôle pas.
Articles (6)
Ce qui fait vraiment converger un entraînement
Deux pour cent d’écart sur le taux d’apprentissage séparent une exécution convergée d’une autre à cinq ordres de grandeur, un conditionnement prédit le taux de convergence à six décimales, et la descente de gradient stochastique à pas fixe ne converge jamais - elle se stabilise dans une boule dont le rayon croît comme la racine carrée du pas. Chaque chiffre a été calculé sur un problème dont l’optimum exact est connu.
Machines à vecteurs de support : marges et noyaux
Pourquoi la bande la plus large entre deux classes est une bonne frontière, pourquoi en exiger une parfaite est contre-productif, comment un budget de violations rachète de la stabilité, et comment un noyau courbe la frontière en travaillant dans un espace qu’il n’a jamais à construire.
La régression linéaire à partir des premiers principes
Dériver les coefficients des moindres carrés en différenciant la somme des carrés des résidus, puis mener à la main un ajustement complet sur cinq observations : coefficients, valeurs ajustées, résidus, RSS et R², chacun vérifié numériquement.
La régression logistique et la classification
Pourquoi une droite ne peut pas modéliser une probabilité, comment la fonction logistique y remédie, et ce que signifient les coefficients en log-cotes, avec un pas de montée de gradient et un ajustement convergé calculés et vérifiés numériquement.
La régularisation : ridge et lasso
Ajouter une pénalité sur la taille des coefficients pour échanger un peu de biais contre une forte réduction de variance, et pourquoi la pénalité L1 annule exactement des coefficients quand L2 se contente de les rétrécir, les deux ajustées numériquement.
La rétropropagation et la descente de gradient
Comment un réseau de neurones apprend : la perte comme fonction des poids, la descente de gradient, et la rétropropagation comme règle de dérivation en chaîne appliquée à rebours, avec toutes les dérivées partielles d’un petit réseau calculées à la main et vérifiées contre autograd.
Outils (1)
Recherche (2)
Learning Internal Representations by Error Propagation
Présente la rétropropagation comme méthode générale d’entraînement des réseaux multicouches, en montrant que les couches cachées peuvent apprendre des représentations internes utiles au lieu de devoir être conçues à la main.
Support-Vector Networks
Introduit la machine à vecteurs de support à marge souple, qui sépare les classes par la marge la plus large possible tout en autorisant des violations bornées, et utilise des noyaux pour obtenir des frontières non linéaires.
Projets (2)
Neural Network From Scratch
Un réseau à propagation avant en NumPy, avec rétropropagation dérivée à la main et validée par gradients numériques : le calcul différentiel est prouvé, non pas supposé.
Statistical Learning Toolkit
Moindres carrés, régression logistique, ridge et lasso, et validation croisée k-fold, implémentés depuis leurs équations d’estimation et vérifiés face à scikit-learn.