Lektion 6 von 8 · 3 Min.

Das nächste Wort wählen: Wahrscheinlichkeiten und Temperatur

Das Modell erzeugt kein Wort, sondern eine Wahrscheinlichkeit für jedes mögliche Wort. Die endgültige Wahl hängt von einer Einstellung ab.

ZielErklären, wie das nächste Token gewählt wird und was die Temperatur verändert.

Am Ende all seiner Schichten berechnet das Modell für jedes Token des Vokabulars die Wahrscheinlichkeit, das nächste zu sein. Nach «Die Hauptstadt der Schweiz ist» erhält «Bern» eine sehr hohe Wahrscheinlichkeit, «Zürich» eine geringe, aber nicht null.

Danach muss gewählt werden. Immer das Wahrscheinlichste zu nehmen, ergibt sichere, aber eintönige Texte. Nach den Wahrscheinlichkeiten zu losen, ergibt abwechslungsreichere Texte. Die Temperatur steuert dieses Gleichgewicht. Bei niedriger Temperatur hält sich das Modell an die wahrscheinlichsten Optionen. Bei hoher Temperatur wagt es mehr.

  • Um Zahlen zu extrahieren, zu klassifizieren oder eine Faktenfrage zu beantworten, begrenzt eine niedrige Temperatur die Abweichungen.
  • Um Titel, Ideen oder Varianten vorzuschlagen, erweitert eine höhere Temperatur die Bandbreite.
  • Dieselbe Frage kann zwei unterschiedliche Antworten ergeben. Das ist keine Störung, das ist das Sampling.

Quellen

  1. Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165