Le pas, et le bord de la stabilité
Ce qu’un pas de gradient minimise, pourquoi un gradient sur mini-lot est le gradient complet plus du bruit et non un gradient différent, et la taille de pas exacte au-delà de laquelle la descente cesse de descendre.
Tous les modèles de ce site sont ajustés de la même façon. Régression linéaire, régression logistique, réseau de neurones, transformeur : chacun écrit un nombre qui dit à quel point il se trompe, demande dans quel sens ce nombre descend, et se déplace. Le modèle change ; la boucle, non.
Ce qui change en revanche, et ce qui décide si la boucle prend quarante pas ou explose en trois, c’est la géométrie autour d’elle. Cette leçon porte sur le plus petit morceau de cette géométrie : un pas.
Ce que la boucle minimise
L’entraînement minimise le risque empirique - la perte moyenne sur les données dont on dispose :
Les exemples de tout ce parcours utilisent un problème de moindres carrés à points et deux paramètres, parce que tout y est calculable exactement et comparable à ce que la théorie prétend. Sa perte vaut , son minimiseur est , et la perte y vaut . Connaître la réponse à l’avance est le principe même : cela transforme chaque affirmation ci-dessous en mesure.
Un gradient sur mini-lot est le gradient complet plus du bruit
Calculer suppose de toucher les exemples. Un mini-lot de taille en touche et les moyenne :
Comme est un échantillon uniforme, exactement. Cela mérite d’être énoncé soigneusement, car la croyance inverse - qu’un petit lot pointe vers quelque chose de systématiquement différent - mène à de mauvaises conclusions sur la taille de lot.
À l’origine , le gradient complet vaut . Moyenner 20 000 mini-lots indépendants en ce même point donne :
| taille de lot | erreur moyenne | taille typique du bruit |
|---|---|---|
| 8 | 0,032 | 1,4382 |
| 32 | 0,012 | 0,7052 |
| 128 | 0,002 | 0,3027 |
La première colonne tend vers zéro parce qu’elle est un résidu de Monte-Carlo dans la moyenne, pas un biais. La seconde raconte la véritable histoire : seize fois le lot achète fois la précision, proche du que prédit la moyenne de tirages indépendants. L’excédent de 19 % au-dessus de 4 n’est pas du bruit : ces lots sont tirés sans remise dans seulement points, et le facteur de population finie réduit un lot de 128 bien plus qu’un lot de 8. Cela prédit , et un tirage avec remise, réellement indépendant, donne 3,89 à la place. Ce taux de change explique pourquoi les entraînements utilisent de petits lots et beaucoup de pas plutôt que l’inverse. Le calcul achète la précision à la racine carrée, et il achète les pas linéairement.
Le facteur (1 − ηλ)
Venons-en au pas. Au voisinage d’un minimum la perte ressemble à une cuvette quadratique, et la forme de cette cuvette est la hessienne . Écrivons l’erreur ; un pas de gradient de taux donne
Décomposons selon les vecteurs propres de . Chaque composante est simplement multipliée par , où est la courbure de cette direction, et les directions n’interagissent pas du tout. Un pas n’est donc pas un mouvement ; c’est autant de contractions indépendantes que la courbure a de directions, chacune à son rythme.
La composante décroît lorsque , soit exactement . Toute direction doit décroître, donc la contrainte déterminante est la plus raide :
La falaise, mesurée
Sur ce problème , donc le seuil vaut . Deux exécutions depuis le même point, deux cents pas chacune :
| taille de pas | en multiple de 2/L | perte après 200 pas |
|---|---|---|
| 1,124600 | 0,99 | 0,236592 |
| 1,147319 | 1,01 | 23585,65 |
Deux pour cent d’écart sur le pas séparent une exécution convergée d’une autre à cinq ordres de grandeur. Ce n’est pas une dégradation douce avec une zone grise au milieu ; c’est un changement de signe dans , et dès que ce facteur passe sous la direction la plus raide est amplifiée d’un facteur constant à chaque pas, indéfiniment.
La forme pratique de ce phénomène est familière à quiconque a vu une courbe de
perte partir en NaN en quelques dizaines de pas après un changement de taux
d’apprentissage qui semblait anodin. Rien n’était stable avant de devenir
instable : l’exécution a franchi un seuil qui était là depuis le début.
Interactif : le pas, et le bord de la stabilité
η = 0.6816, et la falaise est à 2/L = 1.1360.
- Contraction par pas
- 0.949667
- Pas pour six décimales
- > 260
- Falaise à 2/L
- 1.1360
Six décimales sont hors d’atteinte en 260 pas à ce réglage. Le conditionnement vaut 23.8410 - un allongement modéré, sur un problème à deux paramètres - et il fixe le taux à lui seul. Augmentez β : le zigzag en travers de la vallée s’annule tandis que la progression le long s’accumule, et la dépendance passe de κ à √κ.
Stable n’est pas synonyme de rapide
Connaître ne signifie pas poser . Stabilité et vitesse sont deux questions séparées, et leurs réponses diffèrent.
L’erreur se contracte de par pas, où est la direction la plus plate. Augmenter accélère la direction plate et ralentit la raide : le meilleur pas est donc là où les deux coûts se rejoignent,
Ici , d’où - nettement sous le seuil de divergence. Toute taille de pas entre et est plus lente et plus proche de la falaise.
Cette formule mérite vérification plutôt que confiance. Exécuter les mêmes 200 pas pour chacune de 2000 tailles de pas et retenir celle qui finit au plus près de donne un optimum empirique de 1,088582, contre 1,090230 pour la dérivation - un accord à . Ce petit écart ne vient pas de la grille : sur 200 pas seulement, le meilleur pas se situe juste sous l’optimum asymptotique, et s’en rapproche à mesure que l’exécution s’allonge. Une dérivation et une recherche sur grille sont à trois lignes l’une de l’autre, et la grille attrape les erreurs de signe que l’algèbre dissimule.
Ce que cela n’explique pas encore
Deux faits se côtoient mal. Le meilleur pas sur ce problème vaut environ 1,09, et vaut 0,074 : la direction la plus plate ne se déplace donc que de de son erreur résiduelle par pas, même au taux optimal. C’est ce rapport, et non la taille du pas, qui rend l’entraînement lent, et il a un nom et un remède.
Le nom est le conditionnement, et le remède est la leçon suivante.
Références et lectures complémentaires
- Ian Goodfellow, Yoshua Bengio, Aaron Courville, Deep Learning, MIT Press (Adaptive Computation and Machine Learning), 2016source ↗
- Stephen Boyd, Lieven Vandenberghe, Convex Optimization, Cambridge University Press, 2004source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.
Débloquez tout le parcours
Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.