Kontextfenster (Context Window)
Zuletzt aktualisiert:
Was ein Kontextfenster ist
Ein Sprachmodell hat kein Gedächtnis im menschlichen Sinn. Für jede Antwort schickt ihm die Anwendung einen Textblock, und das Modell liest diesen Block, bevor es schreibt. Das Kontextfenster ist die Obergrenze dafür, wie groß dieser Block samt Antwort sein darf. Gemessen wird es in Tokens, den kleinen Textstücken, mit denen Modelle arbeiten.
Kontextfenster sind schnell gewachsen. Aktuelle Modelle reichen von einigen tausend bis zu Hunderttausenden Tokens, manche nehmen noch mehr auf. Ein größeres Fenster erlaubt es, längere Dokumente oder Gespräche in einem Durchgang zu lesen, kostet aber meist mehr und dauert pro Anfrage länger.
Wie sich das Kontextfenster füllt
Für eine einzelne Chatbot-Antwort muss das Kontextfenster typischerweise Folgendes aufnehmen:
Überschreitet die Summe die Grenze, muss etwas weichen: Ältere Nachrichten werden entfernt oder zusammengefasst, weniger Textstellen kommen hinein, oder die Anfrage schlägt fehl. Studien zeigen außerdem, dass Modelle Informationen in der Mitte eines sehr langen Kontexts weniger beachten können. Ein größeres Fenster garantiert also nicht, dass es auch gut genutzt wird.
- Den System Prompt mit den Anweisungen und Regeln des Bots.
- Das bisherige Gespräch oder eine gekürzte Fassung davon.
- Textstellen aus der Wissensdatenbank.
- Ergebnisse von Werkzeugen oder API-Aufrufen, falls vorhanden.
- Platz für die Antwort, die das Modell gleich schreibt.
Beispiel
Ein Besucher unterhält sich eine Weile mit dem Chatbot eines Möbelhändlers über Sofas und fragt dann nach der Lieferung. Der Chatbot schickt nicht den ganzen Katalog und alle Richtlinienseiten erneut mit. Er holt die wenigen Textstellen zur Lieferung, ergänzt das jüngste Gespräch und seine Anweisungen und bleibt deutlich innerhalb des Fensters. Würde er bei jeder Nachricht alle Seiten der Website mitschicken, stieße er schnell an die Grenze und würde langsam und teuer.
Warum es für Business-Chatbots wichtig ist
Das Kontextfenster erklärt, warum ein Chatbot nicht einfach bei jeder Frage deine ganze Website liest. Gute Systeme entscheiden, was ins Fenster kommt: die relevantesten Inhaltsabschnitte, die wichtigen Anweisungen und genug Gesprächsverlauf, um den Faden zu halten. Diese Auswahl prägt Antwortqualität, Geschwindigkeit und Kosten stärker als die reine Fenstergröße. Sie erklärt auch, warum ein sehr langes Gespräch Details aus dem Anfang verlieren kann.
Kontextfenster und intoCHAT
intoCHAT hält deine Wissensdatenbank außerhalb des Kontextfensters. Für jede Nachricht sucht intoCHAT mit einer hybriden Suche aus semantischem und Stichwortabgleich die relevantesten Auszüge deiner Inhalte heraus und schickt diese Auszüge, deine Anweisungen und das Gespräch an das Modell, nicht deine gesamte Wissensdatenbank. Kontextgröße und Tokens musst du nicht selbst verwalten: Die Tarife richten sich nach Nachrichten pro Monat und Zeichen an Trainingsinhalten.