Lezione 4 di 5 · 3 min

La mixture of experts

Come un modello può avere moltissimi parametri pur usandone solo una parte per ogni token.

ObiettivoSpiegare il principio di una mixture of experts e le sue conseguenze su costo e velocità.

In un transformer classico, ogni token attraversa tutti i parametri di ogni strato. Una mixture of experts, o MoE, sostituisce alcuni blocchi con più sottoreti chiamate esperti. Una piccola rete, il router, sceglie per ogni token i pochi esperti che lo elaboreranno.

Token «funziona»RouterEsperto 1Esperto 2Esperto 3Esperto 4Esperto 5Esperto 6Esperto 7Esperto 82 esperti su 8 calcolano questo token
Per ogni token, il router attiva solo una parte degli esperti.

L’idea risale al 2017 ed è stata semplificata nel 2022 con gli Switch Transformers, che inviano ogni token a un solo esperto. Il modello aperto Mixtral 8x7B, pubblicato nel 2024, usa otto esperti per strato e ne attiva due per token. Conta circa 47 miliardi di parametri in totale, ma ne impiega solo circa 13 miliardi per ogni token.

Cosa cambia

  • Il calcolo per token è quello di un modello più piccolo, quindi la risposta è più rapida e meno costosa.
  • La memoria necessaria resta quella dell’intero modello, perché tutti gli esperti devono essere caricati.
  • Gli esperti non sono specialisti riconoscibili come «diritto» o «medicina». La loro ripartizione è appresa e spesso più fine.

Riferimenti

  1. Shazeer, Mirhoseini, Maziarz et al. (2017). Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer. ICLR 2017. arxiv.org/abs/1701.06538
  2. Fedus, Zoph, Shazeer (2022). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. Journal of Machine Learning Research 23(120), p. 1–39. jmlr.org/papers/v23/21-0998.html
  3. Jiang, Sablayrolles, Roux et al. (2024). Mixtral of Experts. Preprint arXiv. arxiv.org/abs/2401.04088