Lektion 7 von 8 · 3 Min.

Pretraining und Skalierungsgesetze

Wie ein Modell lernt, indem es auf Billionen von Tokens das nächste Wort vorhersagt, und was die Skalierungsgesetze offengelegt haben.

ZielDas Pretraining beschreiben und erklären, was die Skalierungsgesetze über die Grösse von Modellen und Daten aussagen.

Das Pretraining ist die längste und teuerste Phase. Das Modell liest einen sehr grossen Textkorpus und versucht an jeder Position, das nächste Token vorherzusagen. Liegt es falsch, werden seine Parameter leicht korrigiert. Billionenfach wiederholt, lässt diese Korrektur Grammatik, Wissen und Denkweisen entstehen.

  1. PretrainingDas nächste Wort in einem sehr grossen Textkorpus vorhersagen.
  2. Instruction TuningAnhand verfasster Beispiele lernen, Anweisungen zu befolgen.
  3. AlignmentAntworten bevorzugen, die Menschen als nützlich und sicher beurteilen.
  4. NutzungDas Modell ist eingefroren. Es behält nichts aus Ihren Unterhaltungen.
Die grossen Etappen im Leben eines Sprachmodells.

Was die Skalierungsgesetze gezeigt haben

2020 messen Forschende, dass der Fehler eines Modells regelmässig und vorhersehbar sinkt, wenn man die Modellgrösse, die Datenmenge und den Rechenaufwand erhöht. Diese Regelmässigkeit hat den gesamten anschliessenden Wettlauf um die Grösse geprägt.

2022 korrigiert die sogenannte Chinchilla-Studie den Kurs. Bei gleichem Rechenbudget waren viele Modelle zu gross und zu wenig trainiert. Ein kleineres Modell, das mit mehr Daten trainiert wurde, schnitt besser ab. Als Richtwert gelten oft etwa zwanzig Trainings-Tokens pro Parameter.

Quellen

  1. Kaplan, McCandlish, Henighan et al. (2020). Scaling Laws for Neural Language Models. arXiv-Preprint. arxiv.org/abs/2001.08361
  2. Hoffmann, Borgeaud, Mensch et al. (2022). Training Compute-Optimal Large Language Models. arXiv-Preprint. arxiv.org/abs/2203.15556
  3. Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165