Choisir le mot suivant : probabilités et température
Le modèle ne produit pas un mot, il produit une probabilité pour chaque mot possible. Le choix final dépend d’un réglage.
ObjectiveExpliquer comment le jeton suivant est choisi et ce que change la température.
Au bout de toutes ses couches, le modèle calcule pour chaque jeton du vocabulaire une probabilité d’être le suivant. Après « La capitale de la Suisse est », « Berne » reçoit une probabilité très élevée, « Zurich » une probabilité faible mais non nulle.
Il faut ensuite choisir. Prendre toujours le plus probable donne des textes sûrs mais répétitifs. Tirer au sort selon les probabilités donne des textes plus variés. La température règle cet équilibre. Basse, le modèle s’en tient aux choix les plus probables. Haute, il ose davantage.
- Pour extraire des chiffres, classer ou répondre à une question factuelle, une température basse limite les écarts.
- Pour proposer des titres, des idées ou des variantes, une température plus élevée élargit l’éventail.
- La même question peut donner deux réponses différentes. Ce n’est pas une panne, c’est le tirage.
References
- Brown, Mann, Ryder et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems 33, p. 1877–1901. arxiv.org/abs/2005.14165