Aller au contenu
Kudos AI

Préentraînement et affinage

La recette en deux temps consistant à entraîner d’abord un modèle sur un grand corpus générique, puis à l’adapter à une tâche précise avec un jeu de données étiquetées bien plus petit.

Aussi appelé : Apprentissage par transfert, Modèle de fondation

log V démontré à l’écran comme la perte que doit rapporter un modèle indécis, puis confronté à une mesure réelle qui n’en est distante que de 0,03.

Comprendre Préentraînement et affinage

Entraîner depuis zéro un modèle compétent pour chaque tâche exigerait à chaque fois un grand jeu de données étiquetées, rarement disponible. L’approche en deux temps sépare l’apprentissage du domaine en général de l’apprentissage de la tâche précise. La première étape est coûteuse et menée une seule fois ; la seconde est bon marché et répétée par application.

Le préentraînement fonctionne parce que son objectif est auto-supervisé. Prédire le jeton suivant ne demande aucune annotation : le texte lui-même fournit la réponse, si bien qu’une quantité pratiquement illimitée de texte brut peut être employée. Pour bien prédire, le modèle doit acquérir une grande compétence incidente en syntaxe, en associations factuelles et en structure du discours, et c’est cette compétence que l’affinage exploite ensuite.

L’affinage poursuit l’entraînement sur des données propres à la tâche, généralement à un taux d’apprentissage bien plus faible pour que la connaissance préentraînée soit ajustée plutôt qu’écrasée. Les représentations étant déjà bonnes, la quantité de données étiquetées nécessaire est faible, souvent quelques milliers d’exemples là où un entraînement depuis zéro en demanderait des millions. Raschka présente la distinction sous la forme d’un affinage par instructions et d’un affinage de classification appliqués après le préentraînement d’un modèle de base.

L’économie de cette division explique une bonne part du paysage actuel. Les coûts de préentraînement sont énormes et concentrés entre quelques organisations, tandis que l’affinage est à la portée de presque tout le monde : un seul modèle de base engendre donc de nombreux descendants spécialisés. Les méthodes économes en paramètres, qui ne mettent à jour qu’un petit ensemble de paramètres ajoutés et laissent les poids de base gelés, abaissent le coût plus encore.

Exemple : Préentraînement et affinage

Un modèle de langue de base est préentraîné sur un très grand corpus de texte avec un objectif unique : prédire le jeton suivant. On ne lui parle jamais d’analyse de sentiment, de résumé ni de réponse à des questions, et pourtant il acquiert la compétence linguistique dont ces tâches dépendent.

Pour en tirer un classifieur de sentiment, on lui attache une petite tête de classification et on l’affine sur quelques milliers d’avis étiquetés. Il comprend déjà la négation, les indices d’ironie et les intensificateurs grâce au préentraînement : il ne lui reste qu’à apprendre la correspondance vers les étiquettes de sentiment.

L’affinage par instructions est le même mécanisme employé autrement : affiner sur des exemples d’instructions appariées à de bonnes réponses transforme un simple prédicteur de jeton suivant en quelque chose qui suit des demandes. La capacité sous-jacente venait du préentraînement ; l’affinage a façonné la manière dont elle s’exprime.

Questions fréquentes

Pourquoi le préentraînement n’a-t-il besoin d’aucune étiquette ?

L’objectif est construit à partir des données elles-mêmes. Étant donné un passage de texte, le jeton suivant est déjà connu, le signal de supervision est donc gratuit. Cette auto-supervision est ce qui permet d’entraîner sur des corpus bien plus vastes que tout jeu de données étiquetées ne pourrait l’être.

Qu’est-ce que l’oubli catastrophique ?

Le cas où l’affinage écrase la connaissance préentraînée : le modèle gagne la tâche étroite mais perd sa capacité générale. On l’atténue par de faibles taux d’apprentissage, un affinage sur peu d’étapes, ou en gelant la plupart des paramètres pour n’entraîner qu’un petit ensemble ajouté.

En quoi cela diffère-t-il de l’amorçage par quelques exemples ?

L’affinage modifie les poids du modèle et persiste. L’amorçage par quelques exemples ne change rien : les exemples sont placés dans la fenêtre de contexte et n’influencent que cette requête. L’amorçage est immédiat et gratuit ; l’affinage est plus durable et généralement plus précis pour une tâche étroite fixée.

En résumé

Le préentraînement achète, une fois et à grands frais, une capacité large à partir de données non étiquetées ; l’affinage la convertit en compétence précise, à bas coût et de façon répétée. C’est cette division qui explique qu’une poignée de modèles de base soutienne aujourd’hui un très grand nombre d’applications.