Le mélange d’experts
Comment un modèle peut compter beaucoup de paramètres tout en n’en utilisant qu’une partie pour chaque jeton.
ObjetivoExpliquer le principe d’un mélange d’experts et ses conséquences sur le coût et la vitesse.
Dans un transformeur classique, chaque jeton traverse tous les paramètres de chaque couche. Un mélange d’experts, ou MoE, remplace certains blocs par plusieurs sous-réseaux appelés experts. Un petit réseau, le routeur, choisit pour chaque jeton les quelques experts qui le traiteront.
L’idée date de 2017 et a été simplifiée en 2022 avec les Switch Transformers, qui n’envoient chaque jeton qu’à un seul expert. Le modèle ouvert Mixtral 8x7B, publié en 2024, utilise huit experts par couche et en active deux par jeton. Il compte environ 47 milliards de paramètres au total, mais n’en mobilise qu’environ 13 milliards pour chaque jeton.
Ce que cela change
- Le calcul par jeton est celui d’un modèle plus petit, donc la réponse est plus rapide et moins coûteuse.
- La mémoire nécessaire reste celle du modèle entier, car tous les experts doivent être chargés.
- Les experts ne sont pas des spécialistes lisibles comme « droit » ou « médecine ». Leur répartition est apprise et souvent plus fine.
Referencias
- Shazeer, Mirhoseini, Maziarz et al. (2017). Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer. ICLR 2017. arxiv.org/abs/1701.06538
- Fedus, Zoph, Shazeer (2022). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. Journal of Machine Learning Research 23(120), p. 1–39. jmlr.org/papers/v23/21-0998.html
- Jiang, Sablayrolles, Roux et al. (2024). Mixtral of Experts. Prépublication arXiv. arxiv.org/abs/2401.04088