Saltar al contenido

Ventana de contexto (context window)

Última actualización:

Qué es la ventana de contexto

Un modelo de lenguaje no tiene memoria en el sentido humano. En cada respuesta, la aplicación le envía un bloque de texto que el modelo lee antes de escribir. La ventana de contexto es el límite máximo de ese bloque, respuesta incluida. Se mide en tokens, los pequeños trozos de texto con los que trabajan los modelos.

Las ventanas de contexto han crecido rápido. Los modelos actuales van de varios miles a cientos de miles de tokens, y algunos admiten más. Una ventana mayor permite leer documentos o conversaciones más largos de una vez, pero suele costar más y tardar más en cada petición.

Cómo se llena la ventana de contexto

Para una sola respuesta de un chatbot, la ventana de contexto suele tener que contener:

Si el total supera el límite, algo tiene que ceder: se eliminan o resumen los mensajes antiguos, se incluyen menos fragmentos o la petición falla. Algunos estudios también han observado que los modelos pueden prestar menos atención a la información situada en medio de un contexto muy largo, así que una ventana mayor no garantiza un mejor aprovechamiento.

  • El prompt del sistema con las instrucciones y reglas del bot.
  • La conversación hasta ese momento, o una versión resumida.
  • Los fragmentos recuperados de la base de conocimiento.
  • Los resultados de herramientas o llamadas a APIs, si los hay.
  • Espacio para la respuesta que el modelo va a escribir.

Ejemplo

Un visitante habla un rato de sofás con el chatbot de una tienda de muebles y luego pregunta por la entrega. El chatbot no vuelve a enviar todo el catálogo ni todas las páginas de políticas. Recupera los pocos fragmentos sobre entregas, añade la parte reciente de la conversación y sus instrucciones, y se queda holgadamente dentro de la ventana. Si incluyera todas las páginas de la web en cada mensaje, llegaría pronto al límite y se volvería lento y caro.

Por qué importa en los chatbots de empresa

La ventana de contexto explica por qué un chatbot no puede leer toda tu web en cada pregunta. Los buenos sistemas deciden qué entra en la ventana: los fragmentos de contenido más relevantes, las instrucciones que importan y suficiente historial para seguir el hilo. Esa selección, más que el tamaño bruto de la ventana, determina la calidad de las respuestas, la velocidad y el coste. También explica por qué en una conversación muy larga se pueden perder detalles mencionados mucho antes.

La ventana de contexto e intoCHAT

intoCHAT mantiene tu base de conocimiento fuera de la ventana de contexto. En cada mensaje recupera los fragmentos más relevantes de tu contenido con una búsqueda híbrida, que combina coincidencia semántica y por palabras clave, y envía al modelo esos fragmentos, tus instrucciones y la conversación, no toda tu base de conocimiento. No tienes que gestionar el tamaño del contexto ni los tokens: los planes se miden en mensajes al mes y en caracteres de contenido de entrenamiento.

Preguntas frecuentes

¿Qué pasa cuando una conversación supera la ventana de contexto?

La aplicación tiene que recortar algo, por ejemplo los mensajes más antiguos, o resumir partes anteriores de la conversación. Si no, la petición falla. En ambos casos, el modelo ya no ve los detalles eliminados.

¿Una ventana de contexto más grande siempre es mejor?

No necesariamente. Las ventanas más grandes admiten entradas más largas, pero suelen aumentar el coste y el tiempo de respuesta, y los modelos no aprovechan igual todas las partes de un contexto largo. En la mayoría de los chatbots de empresa importa más recuperar los fragmentos correctos que el tamaño de la ventana.

¿La ventana de contexto es la memoria del modelo?

No. La ventana de contexto es memoria a corto plazo y solo cubre lo que se envía en la petición actual. Lo que el modelo aprendió en el entrenamiento está en sus pesos, y lo que un chatbot deba recordar entre sesiones tiene que guardarlo la aplicación y volver a enviarlo.

¿Tengo que preocuparme por la ventana de contexto con intoCHAT?

No. intoCHAT selecciona en cada mensaje los fragmentos relevantes de tu contenido y gestiona el modelo por ti. Los límites de tu plan se expresan en mensajes al mes y caracteres de contenido de entrenamiento, no en tokens.

Míralo responder con tu propia web

Pega la dirección de tu web y chatea con un agente creado a partir de tus páginas. Tarda alrededor de un minuto.

Crea tu agente gratis

Plan gratuito, sin tarjeta de crédito.