Tokens, die Grundeinheit des Modells
Warum ein Modell weder Buchstaben noch Wörter liest, sondern Tokens, und was das für Sie bedeutet.
ZielErklären, was ein Token ist, wie ein Text zerlegt wird und warum die Länge eines Textes in Tokens gezählt wird.
Ein Sprachmodell verarbeitet ausschliesslich Zahlen. Vor jeder Berechnung wird der Text daher in Stücke zerlegt, die Tokens heissen, und jedes Token erhält eine Nummer in einem festen Vokabular. Diese Zerlegung nennt man Tokenisierung.
Tokens sind weder Buchstaben noch ganze Wörter. Ein gängiges Wort passt oft in ein einziges Token. Ein seltenes Wort, ein Eigenname oder ein Fachbegriff wird in mehrere häufige Stücke zerlegt. Das verbreitetste Verfahren, Byte-Pair-Encoding genannt, geht von den Zeichen aus und verschmilzt Schritt für Schritt die Paare, die in einem grossen Korpus am häufigsten vorkommen.
Was das erklärt
- Die Grösse eines Dokuments, die Grenze einer Unterhaltung und oft auch die Kosten werden in Tokens gezählt, nicht in Wörtern.
- Ein Text auf Französisch oder Deutsch braucht in der Regel mehr Tokens als derselbe Text auf Englisch, weil die Vokabulare auf überwiegend englischen Korpora aufgebaut wurden.
- Die Buchstaben eines Wortes zu zählen oder es rückwärts zu schreiben, fällt einem Modell schwer. Es sieht keine Buchstaben, es sieht Stücke.
Wie viele «r» stecken im Wort «Erdbeere»?
Buchstabiere «Erdbeere» Buchstabe für Buchstabe und zähle dann die «r».
Wenn Sie zuerst das Buchstabieren verlangen, zwingen Sie das Modell, die Buchstaben einzeln zu erzeugen, was es kann, bevor es zählt.
Quellen
- Sennrich, Haddow, Birch (2016). Neural Machine Translation of Rare Words with Subword Units. Proceedings of the 54th Annual Meeting of the ACL, p. 1715–1725. doi.org/10.18653/v1/P16-1162