Lección 4 de 5 · 3 min

La mezcla de expertos

Cómo un modelo puede tener muchos parámetros y usar solo una parte de ellos para cada token.

ObjetivoExplicar el principio de una mezcla de expertos y sus consecuencias en el coste y la velocidad.

En un transformer clásico, cada token atraviesa todos los parámetros de cada capa. Una mezcla de expertos, o MoE, sustituye algunos bloques por varias subredes llamadas expertos. Una pequeña red, el router, elige para cada token los pocos expertos que lo procesarán.

Token «funciona»RouterExperto 1Experto 2Experto 3Experto 4Experto 5Experto 6Experto 7Experto 82 expertos de 8 calculan este token
Para cada token, el router solo activa una parte de los expertos.

La idea data de 2017 y se simplificó en 2022 con los Switch Transformers, que envían cada token a un solo experto. El modelo abierto Mixtral 8x7B, publicado en 2024, utiliza ocho expertos por capa y activa dos por token. Tiene unos 47.000 millones de parámetros en total, pero solo moviliza unos 13.000 millones para cada token.

Lo que esto cambia

  • El cómputo por token es el de un modelo más pequeño, por lo que la respuesta es más rápida y menos costosa.
  • La memoria necesaria sigue siendo la del modelo completo, porque todos los expertos deben estar cargados.
  • Los expertos no son especialistas reconocibles como «derecho» o «medicina». Su reparto se aprende y suele ser más fino.

Referencias

  1. Shazeer, Mirhoseini, Maziarz et al. (2017). Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer. ICLR 2017. arxiv.org/abs/1701.06538
  2. Fedus, Zoph, Shazeer (2022). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. Journal of Machine Learning Research 23(120), p. 1–39. jmlr.org/papers/v23/21-0998.html
  3. Jiang, Sablayrolles, Roux et al. (2024). Mixtral of Experts. Prepublicación en arXiv. arxiv.org/abs/2401.04088