Des couches empilées et des milliards de paramètres
Ce que sont les paramètres d’un modèle, et pourquoi leur nombre a tant compté.
ObjectifDécrire l’empilement des couches d’un transformeur et ce que représente un paramètre.
Un transformeur empile des blocs identiques. Chaque bloc contient une étape d’attention, qui fait circuler l’information entre les jetons, puis un petit réseau qui transforme chaque jeton séparément. Le vecteur d’un jeton est ainsi retravaillé couche après couche, de plus en plus chargé de contexte.
Les paramètres sont les nombres réglés pendant l’entraînement. Ils définissent les plongements, les calculs d’attention et les petits réseaux. Le modèle GPT-3, publié en 2020, comptait 175 milliards de paramètres répartis sur 96 couches. Ses auteurs ont montré qu’à cette échelle, un modèle pouvait accomplir une tâche à partir de quelques exemples donnés dans la demande, sans réentraînement.
Ce que les paramètres ne sont pas
- Ce ne sont pas des fiches de connaissances. Aucun paramètre ne contient « la capitale de la Suisse ».
- Le savoir est réparti sur des millions de paramètres à la fois, ce qui le rend robuste mais difficile à corriger point par point.
- Plus de paramètres ne garantit pas un meilleur modèle. La quantité et la qualité des données comptent autant.
Références
- Vaswani, Shazeer, Parmar et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems 30. arxiv.org/abs/1706.03762
- Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165