Attention, oder den ganzen Text auf einmal lesen
Der Mechanismus, mit dem jedes Wort alle anderen berücksichtigen kann, im Kern aller grossen heutigen Modelle.
ZielAnhand eines Beispiels erklären, was die Attention berechnet und warum sie die früheren Architekturen abgelöst hat.
2017 veröffentlicht ein Team von Google «Attention Is All You Need» und stellt den Transformer vor. Seine Kernidee ist die Attention, auf Deutsch Aufmerksamkeit. Für jedes Token berechnet das Modell, wie nützlich jedes andere Token des Textes für seine Interpretation ist, und mischt deren Informationen entsprechend.
Nehmen wir «Die Katze schläft, weil sie müde ist». Um «sie» zu verstehen, muss das Modell wissen, dass damit die Katze gemeint ist. Bei der Verarbeitung von «sie» gibt die Attention dem Wort «Katze» ein hohes Gewicht. Nichts davon ist von Hand programmiert. Die Gewichte werden gelernt.
Worauf richtet «sie» ihre Aufmerksamkeit?
Die4 %Katze62 %schläft9 %weil3 %sie12 %müde4 %ist6 %Warum das entscheidend ist
- Alle Tokens werden parallel verarbeitet, was das Training auf riesigen Korpora mit Grafikprozessoren (GPUs) möglich macht.
- Ein Wort kann sich direkt auf ein anderes beziehen, das sehr weit entfernt im Text steht.
- Mehrere Attention-Heads arbeiten nebeneinander. Einer kann der Grammatik folgen, ein anderer den Bezügen, ein weiterer dem Thema.
Quellen
- Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762