La mixture of experts
Come un modello può avere moltissimi parametri pur usandone solo una parte per ogni token.
ObiettivoSpiegare il principio di una mixture of experts e le sue conseguenze su costo e velocità.
In un transformer classico, ogni token attraversa tutti i parametri di ogni strato. Una mixture of experts, o MoE, sostituisce alcuni blocchi con più sottoreti chiamate esperti. Una piccola rete, il router, sceglie per ogni token i pochi esperti che lo elaboreranno.
L’idea risale al 2017 ed è stata semplificata nel 2022 con gli Switch Transformers, che inviano ogni token a un solo esperto. Il modello aperto Mixtral 8x7B, pubblicato nel 2024, usa otto esperti per strato e ne attiva due per token. Conta circa 47 miliardi di parametri in totale, ma ne impiega solo circa 13 miliardi per ogni token.
Cosa cambia
- Il calcolo per token è quello di un modello più piccolo, quindi la risposta è più rapida e meno costosa.
- La memoria necessaria resta quella dell’intero modello, perché tutti gli esperti devono essere caricati.
- Gli esperti non sono specialisti riconoscibili come «diritto» o «medicina». La loro ripartizione è appresa e spesso più fine.
Riferimenti
- Shazeer, Mirhoseini, Maziarz et al. (2017). Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer. ICLR 2017. arxiv.org/abs/1701.06538
- Fedus, Zoph, Shazeer (2022). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. Journal of Machine Learning Research 23(120), p. 1–39. jmlr.org/papers/v23/21-0998.html
- Jiang, Sablayrolles, Roux et al. (2024). Mixtral of Experts. Preprint arXiv. arxiv.org/abs/2401.04088