La ventana de contexto
Todo lo que el modelo puede tener en cuenta de una vez, y por qué la parte central de un documento largo es la más frágil.
ObjetivoExplicar qué es la ventana de contexto y aplicar tres reglas para colocar en ella la información útil.
El modelo solo ve lo que está en su ventana de contexto: sus instrucciones, el historial de la conversación, los documentos adjuntos y los resultados de las herramientas. Su tamaño se mide en tokens. Más allá, hay que dividir, resumir o buscar.
Una ventana más grande no significa una lectura uniforme. Un estudio de 2024 midió que los modelos recuperan mejor una información situada al principio o al final de un contexto largo que en el medio. Los autores lo llamaron «perdido en el medio».
Tres reglas prácticas
- Coloque la instrucción y la pregunta al final, después de los documentos, para que estén recientes en el momento de responder.
- Adjunte los pasajes útiles en lugar de una carpeta entera. Menos ruido, menos olvidos.
- En una conversación larga, pida un resumen del punto en que se encuentra y continúe a partir de ese resumen.
Referencias
- Liu, Lin, Hewitt et al. (2024). Lost in the Middle: How Language Models Use Long Contexts. Transactions of the ACL 12, p. 157–173. doi.org/10.1162/tacl_a_00638