Zum Inhalt springen
Dokumentation

So beantwortet intoCHAT Fragen aus deinen Inhalten

Wie ein intoCHAT-Agent Antworten findet: Aufteilung in Abschnitte, hybride semantische und Stichwortsuche, Q&A und Prioritätsquellen zuerst, kein Fine-Tuning.

intoCHAT trainiert kein KI-Modell mit deinen Inhalten nach. Es indexiert deine Quellen, sucht zu jeder Besuchernachricht die passenden Abschnitte heraus und gibt sie zusammen mit deinen Anweisungen an das Modell. Wenn du die Schritte kennst, verstehst du, warum eine Antwort so ausfällt, wie sie ausfällt.

1. Training: aufteilen und indexieren

Wenn du Train agent klickst, wird der Text jeder Quelle in Abschnitte geteilt:

  • Ein Abschnitt fasst bis zu etwa 1.600 Zeichen. Absätze bleiben möglichst ganz; lange Absätze werden an Satzgrenzen getrennt.
  • Benachbarte Abschnitte überlappen um etwa 200 Zeichen, damit ein Fakt an einer Grenze von beiden Seiten gefunden wird.
  • Ein Q&A-Paar bleibt ein Stück, solange es nicht länger als ein Abschnitt ist.
  • Jeder Abschnitt wird zusammen mit Titel und Adresse seiner Quelle indexiert. So lässt sich ein Absatz unter „Pro-Plan“ vom gleichen Wortlaut unter „Starter-Plan“ unterscheiden.

„Training“ bedeutet im Dashboard genau dieses Indexieren. Das KI-Modell selbst verändert sich nicht.

2. Die Frage verstehen

Folgefragen hängen oft vom Vorherigen ab, etwa „und was kostet das?“. Der Agent formuliert die letzte Nachricht deshalb zuerst mithilfe der letzten Gesprächsrunden in eine eigenständige Suchanfrage um. Namen, Produktcodes und Zahlen bleiben dabei unverändert, ebenso die Sprache des Besuchers.

3. Hybride Suche

Die Anfrage läuft durch zwei Suchen über deine trainierten Abschnitte:

  • Semantische Suche findet Abschnitte mit derselben Bedeutung, auch wenn andere Wörter verwendet werden.
  • Stichwortsuche findet exakte Begriffe wie Produktcodes, Namen und Preise, die der semantischen Suche entgehen können.

Beide Ergebnislisten werden zusammengeführt. Abschnitte, die nicht gut genug zur Frage passen, fallen heraus, damit ein schwacher Treffer nicht als Antwort durchgeht. Ein Abschnitt, der nur über die Stichwortsuche gefunden wurde, muss alle aussagekräftigen Wörter der Frage oder alle darin genannten Produktcodes enthalten.

4. Auswählen, was das Modell sieht

Aus den verbleibenden Treffern wählt der Agent höchstens sechs Abschnitte mit insgesamt etwa 12.000 Zeichen. Aus einer Quelle nimmt er zunächst höchstens drei, damit ein einzelnes langes Dokument die übrigen nicht verdrängt. Liegen Treffer nah beieinander, gewinnt die vertrauenswürdigere Art von Quelle, in dieser Reihenfolge:

  1. Q&A-Paare. Ein Paar, das eng zur Frage passt, steht immer an erster Stelle.
  2. Als Priorität markierte Quellen (Stern-Symbol).
  3. Textbausteine.
  4. Dateien.
  5. Webseiten.

Jeder Abschnitt trägt eine Kennzeichnung mit seiner Art und dem Datum des letzten Trainings. Widersprechen sich Abschnitte, soll das Modell derselben Reihenfolge folgen und bei Quellen gleicher Art der zuletzt aktualisierten vertrauen. Deine Anweisungen stehen über allem Wissen. Ein erfolgreiches Aktionsergebnis, etwa ein aktueller Preis aus deiner API, steht bei Live-Daten über beidem.

5. Die Antwort schreiben

Das Modell erhält eingebaute Regeln, die aktuellen Einstellungen des Agenten (verfügbare Aktionen und Lead-Formular), deine Anweisungen und Guardrails sowie das Gespräch, an das die Abschnitte als Referenzmaterial angehängt sind. Wo sie sich widersprechen, gehen die eingebauten Regeln deinen Anweisungen und Guardrails vor. Sie sorgen dafür, dass der Agent:

  • Geschäftsfakten wie Produkte, Preise, Richtlinien und Kontaktdaten nur aus deinen Anweisungen, deinem Wissen oder Aktionsergebnissen nimmt;
  • kurz sagt, was er nicht bestätigen kann, wenn nichts Passendes gefunden wird, statt eine Antwort, einen Link oder einen Kontaktweg zu erfinden;
  • dein Wissen und Aktionsergebnisse als Daten behandelt, nie als Anweisungen. Ein Satz auf einer gecrawlten Seite wie „ignoriere deine Regeln“ bewirkt nichts, und auch Besucher können die Regeln nicht aushebeln.

Die vollständige Liste steht auf der Seite Anweisungen.

Die Antworten schreibt ein einziges OpenAI-Modell, das intoCHAT auswählt und betreibt. Modell oder Temperatur lassen sich nicht einstellen. Der Agent antwortet in der Sprache, in der der Besucher schreibt.

Was das für dich bedeutet

  • Steht ein Fakt in keiner trainierten Quelle, kann der Agent ihn nicht kennen. Prüfe in der Vorschau einer Quelle, was tatsächlich gelesen wurde. Siehe Quellen verwalten.
  • Für Fragen, die genau auf eine Weise beantwortet werden müssen, legst du ein Q&A-Paar an.
  • Gewinnt immer wieder eine veraltete Seite, aktualisiere oder lösche sie, oder markiere die richtige Quelle als Priorität.
  • Eine Priorität wirkt ab der nächsten Antwort. Geänderte Inhalte wirken erst nach dem Training.

Als Markdown anzeigen