Aller au contenu
Kudos AI

Optimisation

Comment un modèle apprend vraiment : fonctions objectif, gradients, convexité, et les algorithmes qui cherchent le fond d’une surface de perte dans un espace de paramètres.

22 éléments

Parcours (3)

Encyclopédie (8)

Descente de gradient

Un algorithme d’optimisation itératif qui minimise une fonction en avançant de façon répétée dans la direction opposée à son gradient.

Descente de gradient stochastique

Une descente de gradient où chaque pas utilise le gradient d’un petit échantillon aléatoire des données plutôt que de leur totalité, échangeant une direction exacte contre bien plus de pas par unité de calcul.

Conditionnement

Le rapport entre la plus grande et la plus petite courbure d’une surface de perte, qui détermine à lui seul la vitesse à laquelle la descente de gradient peut y converger.

Calendrier de taux d’apprentissage

Une règle qui fait varier la taille du pas au fil de l’entraînement : grand au début pour que l’exécution puisse voyager, petit à la fin pour qu’elle puisse se poser.

Rétropropagation

L’algorithme qui calcule le gradient de la perte d’un réseau de neurones par rapport à chaque poids, en appliquant la règle de dérivation en chaîne à rebours à travers le réseau.

Régularisation

Toute technique qui contraint la complexité effective d’un modèle afin de réduire la variance et d’améliorer la généralisation, typiquement en pénalisant les grandes valeurs de paramètres.

Machine à vecteurs de support

Un classifieur qui sépare les classes par la frontière laissant la plus large marge possible, déterminée par les seuls points d’entraînement les plus proches.

Équation de Bellman

La condition de cohérence selon laquelle l’utilité d’un état égale sa récompense immédiate plus la valeur actualisée de la meilleure action disponible, moyennée sur les issues que cette action ne contrôle pas.

Articles (6)

Ce qui fait vraiment converger un entraînement

Deux pour cent d’écart sur le taux d’apprentissage séparent une exécution convergée d’une autre à cinq ordres de grandeur, un conditionnement prédit le taux de convergence à six décimales, et la descente de gradient stochastique à pas fixe ne converge jamais - elle se stabilise dans une boule dont le rayon croît comme la racine carrée du pas. Chaque chiffre a été calculé sur un problème dont l’optimum exact est connu.

Machines à vecteurs de support : marges et noyaux

Pourquoi la bande la plus large entre deux classes est une bonne frontière, pourquoi en exiger une parfaite est contre-productif, comment un budget de violations rachète de la stabilité, et comment un noyau courbe la frontière en travaillant dans un espace qu’il n’a jamais à construire.

La régression linéaire à partir des premiers principes

Dériver les coefficients des moindres carrés en différenciant la somme des carrés des résidus, puis mener à la main un ajustement complet sur cinq observations : coefficients, valeurs ajustées, résidus, RSS et R², chacun vérifié numériquement.

La régression logistique et la classification

Pourquoi une droite ne peut pas modéliser une probabilité, comment la fonction logistique y remédie, et ce que signifient les coefficients en log-cotes, avec un pas de montée de gradient et un ajustement convergé calculés et vérifiés numériquement.

La régularisation : ridge et lasso

Ajouter une pénalité sur la taille des coefficients pour échanger un peu de biais contre une forte réduction de variance, et pourquoi la pénalité L1 annule exactement des coefficients quand L2 se contente de les rétrécir, les deux ajustées numériquement.

La rétropropagation et la descente de gradient

Comment un réseau de neurones apprend : la perte comme fonction des poids, la descente de gradient, et la rétropropagation comme règle de dérivation en chaîne appliquée à rebours, avec toutes les dérivées partielles d’un petit réseau calculées à la main et vérifiées contre autograd.

Outils (1)

Recherche (2)

Projets (2)

Thèmes liés