Leçon 4 sur 8 · 20 min

L’attention, ou lire tout le texte à la fois

Le mécanisme qui permet à chaque mot de tenir compte de tous les autres, au cœur de tous les grands modèles actuels.

ObjectifExpliquer avec un exemple ce que calcule l’attention et pourquoi elle a remplacé les architectures précédentes.

En 2017, une équipe de Google publie « Attention Is All You Need » et présente le transformeur. Son idée maîtresse est l’attention. Pour chaque jeton, le modèle calcule à quel point chacun des autres jetons du texte est utile pour l’interpréter, puis mélange leurs informations en conséquence.

Prenons « Le chat dort car il est fatigué ». Pour comprendre « il », le modèle doit savoir qu’il désigne le chat. L’attention attribue un poids élevé à « chat » quand il traite « il ». Rien de cela n’est programmé à la main. Les poids sont appris.

À quoi « il » prête-t-il attention ?

Le4 %chat62 %dort9 %car3 %il12 %est4 %fatigué6 %
Poids d’attention illustratifs pour le mot « il ». Un vrai modèle calcule de tels poids dans des dizaines de têtes et de couches.

Pourquoi c’est décisif

  • Tous les jetons sont traités en parallèle, ce qui rend l’entraînement sur d’énormes corpus possible avec des processeurs graphiques.
  • Un mot peut se relier directement à un autre placé très loin dans le texte.
  • Plusieurs têtes d’attention travaillent côte à côte. L’une peut suivre la grammaire, une autre les références, une autre le sujet.

Références

  1. Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762