La mezcla de expertos
Cómo un modelo puede tener muchos parámetros y usar solo una parte de ellos para cada token.
ObjetivoExplicar el principio de una mezcla de expertos y sus consecuencias en el coste y la velocidad.
En un transformer clásico, cada token atraviesa todos los parámetros de cada capa. Una mezcla de expertos, o MoE, sustituye algunos bloques por varias subredes llamadas expertos. Una pequeña red, el router, elige para cada token los pocos expertos que lo procesarán.
La idea data de 2017 y se simplificó en 2022 con los Switch Transformers, que envían cada token a un solo experto. El modelo abierto Mixtral 8x7B, publicado en 2024, utiliza ocho expertos por capa y activa dos por token. Tiene unos 47.000 millones de parámetros en total, pero solo moviliza unos 13.000 millones para cada token.
Lo que esto cambia
- El cómputo por token es el de un modelo más pequeño, por lo que la respuesta es más rápida y menos costosa.
- La memoria necesaria sigue siendo la del modelo completo, porque todos los expertos deben estar cargados.
- Los expertos no son especialistas reconocibles como «derecho» o «medicina». Su reparto se aprende y suele ser más fino.
Referencias
- Shazeer, Mirhoseini, Maziarz et al. (2017). Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer. ICLR 2017. arxiv.org/abs/1701.06538
- Fedus, Zoph, Shazeer (2022). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. Journal of Machine Learning Research 23(120), p. 1–39. jmlr.org/papers/v23/21-0998.html
- Jiang, Sablayrolles, Roux et al. (2024). Mixtral of Experts. Prepublicación en arXiv. arxiv.org/abs/2401.04088