Lección 1 de 8 · 7 min

Los tokens, unidad básica del modelo

Por qué un modelo no lee letras ni palabras, sino tokens, y lo que eso cambia para usted.

ObjetivoExplicar qué es un token, cómo se divide un texto y por qué la longitud de un texto se cuenta en tokens.

Un modelo de lenguaje solo maneja números. Por eso, antes de cualquier cálculo, el texto se divide en fragmentos llamados tokens, y cada token recibe un número dentro de un vocabulario fijo. Esta división se llama tokenización.

Los tokens no son letras ni palabras enteras. Una palabra común suele caber en un solo token. Una palabra poco frecuente, un nombre propio o un término técnico se corta en varios fragmentos frecuentes. El método más extendido, llamado codificación por pares de bytes (BPE), parte de los caracteres y fusiona paso a paso los pares que aparecen con más frecuencia en un gran corpus.

El43␣apr9811endiz306aje22109␣esp1891aci7356ado12340␣funciona710.13
Una división ilustrativa. Cada fragmento recibe un número, el modelo solo ve esos números.

Lo que esto explica

  • El tamaño de un documento, el límite de una conversación y a menudo el coste se cuentan en tokens, no en palabras.
  • Un texto en español o en alemán suele requerir más tokens que el mismo texto en inglés, porque los vocabularios se construyeron con corpus mayoritariamente en inglés.
  • Contar las letras de una palabra o escribirla al revés es difícil para un modelo. No ve las letras, ve fragmentos.
Menos eficaz

¿Cuántas «r» hay en «ferrocarril»?

Más eficaz

Deletrea «ferrocarril» letra por letra y luego cuenta las «r».

Al pedir que primero deletree, obliga al modelo a producir las letras una a una, algo que sabe hacer, antes de contar.

Referencias

  1. Sennrich, Haddow, Birch (2016). Neural Machine Translation of Rare Words with Subword Units. Proceedings of the 54th Annual Meeting of the ACL, p. 1715–1725. doi.org/10.18653/v1/P16-1162