Aller au contenu

Fenêtre de contexte (context window)

Dernière mise à jour:

Ce qu’est la fenêtre de contexte

Un modèle de langage n’a pas de mémoire au sens humain. Pour chaque réponse, l’application lui envoie un bloc de texte, qu’il lit avant d’écrire. La fenêtre de contexte est la taille maximale de ce bloc, réponse comprise. Elle se mesure en tokens, les petits morceaux de texte que traitent les modèles.

Les fenêtres de contexte ont rapidement grandi. Les modèles actuels vont de quelques milliers à plusieurs centaines de milliers de tokens, et certains acceptent davantage. Une fenêtre plus large permet de lire des documents ou des conversations plus longs d’un seul tenant, mais elle coûte généralement plus cher et allonge le temps de traitement de chaque requête.

Comment la fenêtre de contexte se remplit

Pour une seule réponse de chatbot, la fenêtre de contexte doit généralement contenir :

Si le total dépasse la limite, il faut sacrifier quelque chose : les anciens messages sont supprimés ou résumés, moins de passages sont inclus, ou la requête échoue. Des études ont aussi montré que les modèles peuvent accorder moins d’attention aux informations situées au milieu d’un contexte très long : une fenêtre plus grande ne garantit donc pas une meilleure utilisation.

  • Le prompt système avec les instructions et les règles du bot.
  • La conversation jusqu’ici, ou une version raccourcie.
  • Les passages récupérés dans la base de connaissances.
  • Les résultats d’outils ou d’appels d’API, le cas échéant.
  • La place nécessaire à la réponse que le modèle va écrire.

Exemple

Un visiteur discute un moment de canapés avec le chatbot d’un magasin de meubles, puis pose une question sur la livraison. Le chatbot ne renvoie pas tout le catalogue et toutes les pages de conditions. Il récupère les quelques passages consacrés à la livraison, ajoute la partie récente de la conversation et ses instructions, et reste largement dans la fenêtre. S’il incluait toutes les pages du site à chaque message, il atteindrait vite la limite et deviendrait lent et coûteux.

Pourquoi c’est important pour les chatbots d’entreprise

La fenêtre de contexte explique pourquoi un chatbot ne peut pas simplement relire tout votre site à chaque question. Un bon système choisit ce qui entre dans la fenêtre : les contenus les plus pertinents, les instructions utiles et assez d’historique pour suivre la conversation. Ce tri influence la qualité des réponses, la vitesse et le coût bien plus que la taille brute de la fenêtre. Il explique aussi pourquoi une très longue conversation peut perdre de vue des détails mentionnés au début.

La fenêtre de contexte et intoCHAT

intoCHAT garde votre base de connaissances en dehors de la fenêtre de contexte. Pour chaque message, il récupère les extraits les plus pertinents de vos contenus grâce à une recherche hybride, sémantique et par mots-clés, puis envoie au modèle ces extraits, vos instructions et la conversation, et non l’ensemble de votre base. Vous n’avez pas à gérer la taille du contexte ni les tokens : les offres se mesurent en messages par mois et en caractères de contenu d’entraînement.

Questions fréquentes

Que se passe-t-il quand une conversation dépasse la fenêtre de contexte ?

L’application doit couper quelque chose, par exemple les messages les plus anciens, ou résumer les premières parties de la conversation. Sinon, la requête échoue. Dans les deux cas, le modèle ne voit plus les détails supprimés.

Une fenêtre de contexte plus grande est-elle toujours préférable ?

Pas forcément. Une fenêtre plus large accepte des entrées plus longues, mais augmente généralement le coût et le temps de réponse, et les modèles n’exploitent pas toutes les parties d’un long contexte aussi bien. Pour la plupart des chatbots d’entreprise, retrouver les bons passages compte davantage que la taille de la fenêtre.

La fenêtre de contexte est-elle la mémoire du modèle ?

Non. La fenêtre de contexte est une mémoire à court terme qui ne couvre que ce qui est envoyé dans la requête en cours. Ce que le modèle a appris à l’entraînement réside dans ses poids, et ce qu’un chatbot doit retenir d’une session à l’autre doit être stocké par l’application puis renvoyé.

Faut-il se soucier de la fenêtre de contexte avec intoCHAT ?

Non. intoCHAT sélectionne pour chaque message les extraits pertinents de vos contenus et gère le modèle pour vous. Les limites de votre offre s’expriment en messages par mois et en caractères de contenu d’entraînement, pas en tokens.

Voyez-le répondre à partir de votre site

Collez l’adresse de votre site et discutez avec un agent créé à partir de vos pages. Cela prend environ une minute.

Créer votre agent gratuitement

Offre gratuite, sans carte bancaire.