Mixture of Experts
Wie ein Modell sehr viele Parameter haben und trotzdem für jedes Token nur einen Teil davon nutzen kann.
ZielDas Prinzip einer Mixture of Experts und ihre Folgen für Kosten und Geschwindigkeit erklären.
In einem klassischen Transformer durchläuft jedes Token alle Parameter jeder Schicht. Eine Mixture of Experts, kurz MoE, ersetzt bestimmte Blöcke durch mehrere Teilnetze, die Experten heissen. Ein kleines Netz, der Router, wählt für jedes Token die wenigen Experten aus, die es verarbeiten.
Die Idee stammt aus dem Jahr 2017 und wurde 2022 mit den Switch Transformers vereinfacht, die jedes Token nur an einen einzigen Experten schicken. Das offene Modell Mixtral 8x7B, 2024 veröffentlicht, verwendet acht Experten pro Schicht und aktiviert zwei pro Token. Es hat insgesamt rund 47 Milliarden Parameter, nutzt aber für jedes Token nur rund 13 Milliarden.
Was das verändert
- Der Rechenaufwand pro Token entspricht dem eines kleineren Modells, die Antwort kommt also schneller und günstiger.
- Der benötigte Speicher bleibt der des ganzen Modells, denn alle Experten müssen geladen sein.
- Die Experten sind keine lesbaren Spezialisten wie «Recht» oder «Medizin». Ihre Aufteilung wird gelernt und ist oft feiner.
Quellen
- Shazeer, Mirhoseini, Maziarz et al. (2017). Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer. ICLR 2017. arxiv.org/abs/1701.06538
- Fedus, Zoph, Shazeer (2022). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. Journal of Machine Learning Research 23(120), p. 1–39. jmlr.org/papers/v23/21-0998.html
- Jiang, Sablayrolles, Roux et al. (2024). Mixtral of Experts. arXiv-Preprint. arxiv.org/abs/2401.04088