Lektion 5 von 8 · 6 Min.

Gestapelte Schichten und Milliarden von Parametern

Was die Parameter eines Modells sind und warum ihre Anzahl so wichtig war.

ZielDen Schichtaufbau eines Transformers beschreiben und erklären, wofür ein Parameter steht.

Ein Transformer stapelt identische Blöcke. Jeder Block enthält einen Attention-Schritt, der Informationen zwischen den Tokens austauscht, und danach ein kleines Netz, das jedes Token einzeln umformt. Der Vektor eines Tokens wird so Schicht für Schicht weiterbearbeitet und nimmt immer mehr Kontext auf.

Parameter sind die Zahlen, die während des Trainings eingestellt werden. Sie bestimmen die Embeddings, die Attention-Berechnungen und die kleinen Netze. Das 2020 veröffentlichte Modell GPT-3 hatte 175 Milliarden Parameter, verteilt auf 96 Schichten. Seine Autoren zeigten, dass ein Modell in dieser Grössenordnung eine Aufgabe anhand weniger Beispiele in der Anfrage lösen kann, ohne neues Training.

Was Parameter nicht sind

  • Sie sind keine Wissenskarteikarten. Kein Parameter enthält «die Hauptstadt der Schweiz».
  • Das Wissen ist auf Millionen von Parametern gleichzeitig verteilt. Das macht es robust, aber schwer punktuell zu korrigieren.
  • Mehr Parameter garantieren kein besseres Modell. Menge und Qualität der Daten zählen genauso.

Quellen

  1. Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762
  2. Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165