A mistura de especialistas
Como um modelo pode ter muitos parâmetros e utilizar apenas uma parte deles para cada token.
ObjetivoExplicar o princípio de uma mistura de especialistas e as suas consequências no custo e na velocidade.
Num transformer clássico, cada token atravessa todos os parâmetros de cada camada. Uma mistura de especialistas, ou MoE, substitui certos blocos por várias sub-redes chamadas especialistas. Uma pequena rede, o router, escolhe para cada token os poucos especialistas que o vão processar.
A ideia data de 2017 e foi simplificada em 2022 com os Switch Transformers, que enviam cada token para um único especialista. O modelo aberto Mixtral 8x7B, publicado em 2024, utiliza oito especialistas por camada e ativa dois por token. Tem cerca de 47 mil milhões de parâmetros no total, mas só mobiliza cerca de 13 mil milhões para cada token.
O que isto muda
- A computação por token é a de um modelo mais pequeno, por isso a resposta é mais rápida e menos dispendiosa.
- A memória necessária continua a ser a do modelo inteiro, porque todos os especialistas têm de estar carregados.
- Os especialistas não são especialidades legíveis como «direito» ou «medicina». A sua repartição é aprendida e muitas vezes mais fina.
Referências
- Shazeer, Mirhoseini, Maziarz et al. (2017). Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer. ICLR 2017. arxiv.org/abs/1701.06538
- Fedus, Zoph, Shazeer (2022). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. Journal of Machine Learning Research 23(120), p. 1–39. jmlr.org/papers/v23/21-0998.html
- Jiang, Sablayrolles, Roux et al. (2024). Mixtral of Experts. Pré-publicação no arXiv. arxiv.org/abs/2401.04088