Lição 4 de 5 · 3 min

A mistura de especialistas

Como um modelo pode ter muitos parâmetros e utilizar apenas uma parte deles para cada token.

ObjetivoExplicar o princípio de uma mistura de especialistas e as suas consequências no custo e na velocidade.

Num transformer clássico, cada token atravessa todos os parâmetros de cada camada. Uma mistura de especialistas, ou MoE, substitui certos blocos por várias sub-redes chamadas especialistas. Uma pequena rede, o router, escolhe para cada token os poucos especialistas que o vão processar.

Token «funciona»RouterEspecialista 1Especialista 2Especialista 3Especialista 4Especialista 5Especialista 6Especialista 7Especialista 82 especialistas em 8 calculam este token
Para cada token, o router só ativa uma parte dos especialistas.

A ideia data de 2017 e foi simplificada em 2022 com os Switch Transformers, que enviam cada token para um único especialista. O modelo aberto Mixtral 8x7B, publicado em 2024, utiliza oito especialistas por camada e ativa dois por token. Tem cerca de 47 mil milhões de parâmetros no total, mas só mobiliza cerca de 13 mil milhões para cada token.

O que isto muda

  • A computação por token é a de um modelo mais pequeno, por isso a resposta é mais rápida e menos dispendiosa.
  • A memória necessária continua a ser a do modelo inteiro, porque todos os especialistas têm de estar carregados.
  • Os especialistas não são especialidades legíveis como «direito» ou «medicina». A sua repartição é aprendida e muitas vezes mais fina.

Referências

  1. Shazeer, Mirhoseini, Maziarz et al. (2017). Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer. ICLR 2017. arxiv.org/abs/1701.06538
  2. Fedus, Zoph, Shazeer (2022). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. Journal of Machine Learning Research 23(120), p. 1–39. jmlr.org/papers/v23/21-0998.html
  3. Jiang, Sablayrolles, Roux et al. (2024). Mixtral of Experts. Pré-publicação no arXiv. arxiv.org/abs/2401.04088