Ventana de contexto (context window)
Última actualización:
Qué es la ventana de contexto
Un modelo de lenguaje no tiene memoria en el sentido humano. En cada respuesta, la aplicación le envía un bloque de texto que el modelo lee antes de escribir. La ventana de contexto es el límite máximo de ese bloque, respuesta incluida. Se mide en tokens, los pequeños trozos de texto con los que trabajan los modelos.
Las ventanas de contexto han crecido rápido. Los modelos actuales van de varios miles a cientos de miles de tokens, y algunos admiten más. Una ventana mayor permite leer documentos o conversaciones más largos de una vez, pero suele costar más y tardar más en cada petición.
Cómo se llena la ventana de contexto
Para una sola respuesta de un chatbot, la ventana de contexto suele tener que contener:
Si el total supera el límite, algo tiene que ceder: se eliminan o resumen los mensajes antiguos, se incluyen menos fragmentos o la petición falla. Algunos estudios también han observado que los modelos pueden prestar menos atención a la información situada en medio de un contexto muy largo, así que una ventana mayor no garantiza un mejor aprovechamiento.
- El prompt del sistema con las instrucciones y reglas del bot.
- La conversación hasta ese momento, o una versión resumida.
- Los fragmentos recuperados de la base de conocimiento.
- Los resultados de herramientas o llamadas a APIs, si los hay.
- Espacio para la respuesta que el modelo va a escribir.
Ejemplo
Un visitante habla un rato de sofás con el chatbot de una tienda de muebles y luego pregunta por la entrega. El chatbot no vuelve a enviar todo el catálogo ni todas las páginas de políticas. Recupera los pocos fragmentos sobre entregas, añade la parte reciente de la conversación y sus instrucciones, y se queda holgadamente dentro de la ventana. Si incluyera todas las páginas de la web en cada mensaje, llegaría pronto al límite y se volvería lento y caro.
Por qué importa en los chatbots de empresa
La ventana de contexto explica por qué un chatbot no puede leer toda tu web en cada pregunta. Los buenos sistemas deciden qué entra en la ventana: los fragmentos de contenido más relevantes, las instrucciones que importan y suficiente historial para seguir el hilo. Esa selección, más que el tamaño bruto de la ventana, determina la calidad de las respuestas, la velocidad y el coste. También explica por qué en una conversación muy larga se pueden perder detalles mencionados mucho antes.
La ventana de contexto e intoCHAT
intoCHAT mantiene tu base de conocimiento fuera de la ventana de contexto. En cada mensaje recupera los fragmentos más relevantes de tu contenido con una búsqueda híbrida, que combina coincidencia semántica y por palabras clave, y envía al modelo esos fragmentos, tus instrucciones y la conversación, no toda tu base de conocimiento. No tienes que gestionar el tamaño del contexto ni los tokens: los planes se miden en mensajes al mes y en caracteres de contenido de entrenamiento.