Retrieval-Augmented Generation (RAG)
Zuletzt aktualisiert:
Was RAG ist
Ein Sprachmodell weiß nur, was in seinen Trainingsdaten stand. RAG ergänzt einen Nachschlageschritt: Bevor das Modell antwortet, holt das System passende Texte aus einer Wissensdatenbank und fügt sie in den Prompt ein. Das Modell formuliert seine Antwort dann aus diesem Material, statt sich nur auf sein Gedächtnis zu verlassen.
Der Begriff stammt aus einem Forschungspapier von Patrick Lewis und Kollegen bei Facebook AI Research aus dem Jahr 2020. Heute beschreibt er die meisten Chatbots und Assistenten, die aus den eigenen Inhalten einer Organisation antworten.
So funktioniert RAG
Ein RAG-System hat eine Vorbereitungsphase und eine Phase pro Frage:
Die Qualität eines RAG-Systems hängt stark von der Suche ab. Wird die richtige Textstelle nicht gefunden, kann selbst ein starkes Modell nicht korrekt antworten.
- Indexierung, vorab: Dokumente werden in Chunks zerlegt, jeder Chunk wird in ein Embedding umgewandelt, und alles landet in einem durchsuchbaren Index.
- Retrieval: Die Frage wird per semantischer Suche, Stichwortsuche oder beidem mit dem Index abgeglichen, und die am besten passenden Chunks werden ausgewählt.
- Augmentation: Die ausgewählten Chunks werden zusammen mit den Anweisungen und dem bisherigen Gespräch in den Prompt eingefügt.
- Generierung: Das Sprachmodell schreibt eine Antwort auf Basis der gefundenen Texte und sagt bei guter Einrichtung auch, wenn diese die Antwort nicht enthalten.
Beispiel
Der Chatbot eines Softwareanbieters wird gefragt: „Kann ich meine Rechnungen als CSV exportieren?“ Die Suche findet einen Hilfeartikel zum Export und einen aktuellen Changelog-Eintrag. Das Modell liest beide und erklärt, dass der CSV-Export in den Abrechnungseinstellungen verfügbar ist, mit den Schritten aus dem Artikel. Ändert das Unternehmen den Artikel, spiegelt die nächste Antwort die Änderung wider, sobald der Inhalt neu indexiert ist, ganz ohne Eingriff ins Modell.
Warum RAG für Business-Chatbots wichtig ist
RAG ist der gängigste Weg, ein allgemeines Modell für ein bestimmtes Unternehmen nutzbar zu machen:
RAG beseitigt nicht jeden Fehler. Veraltete oder widersprüchliche Dokumente führen zu falschen Antworten, und das Modell kann eine Textstelle trotzdem falsch verstehen. Aktuelle Quellen sind genauso wichtig wie die Technik.
- Antworten bleiben bei deinen Produkten, Preisen und Richtlinien.
- Wissen aktualisieren heißt Inhalte bearbeiten, nicht ein Modell neu trainieren.
- Antworten lassen sich auf Textstellen zurückführen, was Fehler leichter auffindbar und behebbar macht.
- Regeln können festlegen, dass das Modell nur aus gefundenen Inhalten antwortet und zugibt, wenn nichts Passendes gefunden wurde.
Wie intoCHAT RAG nutzt
intoCHAT basiert auf RAG. Wenn du Webseiten, Dateien, Textbausteine oder Q&A-Paare hinzufügst, zerlegt intoCHAT sie in Chunks und erzeugt Embeddings. Für jede Besuchernachricht läuft eine hybride Suche aus semantischer Suche und Stichwortsuche, und die besten Auszüge gehen mit Regeln an das Modell, die die Antwort daran binden. Q&A-Antworten und markierte Quellen werden vor anderen Inhalten eingestuft, und Änderungen an einer Quelle greifen, nachdem du sie neu trainiert hast.