L’attention, ou lire tout le texte à la fois
Le mécanisme qui permet à chaque mot de tenir compte de tous les autres, au cœur de tous les grands modèles actuels.
ObiettivoExpliquer avec un exemple ce que calcule l’attention et pourquoi elle a remplacé les architectures précédentes.
En 2017, une équipe de Google publie « Attention Is All You Need » et présente le transformeur. Son idée maîtresse est l’attention. Pour chaque jeton, le modèle calcule à quel point chacun des autres jetons du texte est utile pour l’interpréter, puis mélange leurs informations en conséquence.
Prenons « Le chat dort car il est fatigué ». Pour comprendre « il », le modèle doit savoir qu’il désigne le chat. L’attention attribue un poids élevé à « chat » quand il traite « il ». Rien de cela n’est programmé à la main. Les poids sont appris.
À quoi « il » prête-t-il attention ?
Le4 %chat62 %dort9 %car3 %il12 %est4 %fatigué6 %Pourquoi c’est décisif
- Tous les jetons sont traités en parallèle, ce qui rend l’entraînement sur d’énormes corpus possible avec des processeurs graphiques.
- Un mot peut se relier directement à un autre placé très loin dans le texte.
- Plusieurs têtes d’attention travaillent côte à côte. L’une peut suivre la grammaire, une autre les références, une autre le sujet.
Riferimenti
- Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762