Lesson 7 of 8 · 20 min

Le pré-entraînement et les lois d’échelle

Comment un modèle apprend en prédisant le mot suivant sur des milliers de milliards de jetons, et ce que les lois d’échelle ont révélé.

ObjectiveDécrire le pré-entraînement et expliquer ce que disent les lois d’échelle sur la taille des modèles et des données.

Le pré-entraînement est la phase la plus longue et la plus coûteuse. Le modèle lit un très grand corpus de textes et, à chaque position, essaie de prédire le jeton suivant. Quand il se trompe, ses paramètres sont légèrement corrigés. Répétée des milliers de milliards de fois, cette correction fait émerger la grammaire, des connaissances et des manières de raisonner.

  1. Pré-entraînementPrédire le mot suivant sur un très grand corpus de textes.
  2. AjustementApprendre à suivre des instructions à partir d’exemples rédigés.
  3. AlignementPréférer les réponses que des personnes jugent utiles et sûres.
  4. UsageLe modèle est figé. Il ne retient rien de vos échanges.
Les grandes étapes de la vie d’un modèle de langage.

Ce que les lois d’échelle ont montré

En 2020, des chercheurs mesurent que l’erreur d’un modèle baisse de façon régulière et prévisible quand on augmente la taille du modèle, la quantité de données et le calcul. Cette régularité a orienté toute la course à la taille qui a suivi.

En 2022, l’étude dite Chinchilla corrige le tir. À budget de calcul égal, beaucoup de modèles étaient trop grands et pas assez entraînés. Un modèle plus petit nourri de davantage de données faisait mieux. Le repère souvent retenu est d’environ vingt jetons d’entraînement par paramètre.

References

  1. Kaplan, McCandlish, Henighan et al. (2020). Scaling Laws for Neural Language Models. Prépublication arXiv. arxiv.org/abs/2001.08361
  2. Hoffmann, Borgeaud, Mensch et al. (2022). Training Compute-Optimal Large Language Models. Prépublication arXiv. arxiv.org/abs/2203.15556
  3. Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165