Zum Inhalt springen

Retrieval-Augmented Generation (RAG)

Zuletzt aktualisiert:

Was RAG ist

Ein Sprachmodell weiß nur, was in seinen Trainingsdaten stand. RAG ergänzt einen Nachschlageschritt: Bevor das Modell antwortet, holt das System passende Texte aus einer Wissensdatenbank und fügt sie in den Prompt ein. Das Modell formuliert seine Antwort dann aus diesem Material, statt sich nur auf sein Gedächtnis zu verlassen.

Der Begriff stammt aus einem Forschungspapier von Patrick Lewis und Kollegen bei Facebook AI Research aus dem Jahr 2020. Heute beschreibt er die meisten Chatbots und Assistenten, die aus den eigenen Inhalten einer Organisation antworten.

So funktioniert RAG

Ein RAG-System hat eine Vorbereitungsphase und eine Phase pro Frage:

Die Qualität eines RAG-Systems hängt stark von der Suche ab. Wird die richtige Textstelle nicht gefunden, kann selbst ein starkes Modell nicht korrekt antworten.

  • Indexierung, vorab: Dokumente werden in Chunks zerlegt, jeder Chunk wird in ein Embedding umgewandelt, und alles landet in einem durchsuchbaren Index.
  • Retrieval: Die Frage wird per semantischer Suche, Stichwortsuche oder beidem mit dem Index abgeglichen, und die am besten passenden Chunks werden ausgewählt.
  • Augmentation: Die ausgewählten Chunks werden zusammen mit den Anweisungen und dem bisherigen Gespräch in den Prompt eingefügt.
  • Generierung: Das Sprachmodell schreibt eine Antwort auf Basis der gefundenen Texte und sagt bei guter Einrichtung auch, wenn diese die Antwort nicht enthalten.

Beispiel

Der Chatbot eines Softwareanbieters wird gefragt: „Kann ich meine Rechnungen als CSV exportieren?“ Die Suche findet einen Hilfeartikel zum Export und einen aktuellen Changelog-Eintrag. Das Modell liest beide und erklärt, dass der CSV-Export in den Abrechnungseinstellungen verfügbar ist, mit den Schritten aus dem Artikel. Ändert das Unternehmen den Artikel, spiegelt die nächste Antwort die Änderung wider, sobald der Inhalt neu indexiert ist, ganz ohne Eingriff ins Modell.

Warum RAG für Business-Chatbots wichtig ist

RAG ist der gängigste Weg, ein allgemeines Modell für ein bestimmtes Unternehmen nutzbar zu machen:

RAG beseitigt nicht jeden Fehler. Veraltete oder widersprüchliche Dokumente führen zu falschen Antworten, und das Modell kann eine Textstelle trotzdem falsch verstehen. Aktuelle Quellen sind genauso wichtig wie die Technik.

  • Antworten bleiben bei deinen Produkten, Preisen und Richtlinien.
  • Wissen aktualisieren heißt Inhalte bearbeiten, nicht ein Modell neu trainieren.
  • Antworten lassen sich auf Textstellen zurückführen, was Fehler leichter auffindbar und behebbar macht.
  • Regeln können festlegen, dass das Modell nur aus gefundenen Inhalten antwortet und zugibt, wenn nichts Passendes gefunden wurde.

Wie intoCHAT RAG nutzt

intoCHAT basiert auf RAG. Wenn du Webseiten, Dateien, Textbausteine oder Q&A-Paare hinzufügst, zerlegt intoCHAT sie in Chunks und erzeugt Embeddings. Für jede Besuchernachricht läuft eine hybride Suche aus semantischer Suche und Stichwortsuche, und die besten Auszüge gehen mit Regeln an das Modell, die die Antwort daran binden. Q&A-Antworten und markierte Quellen werden vor anderen Inhalten eingestuft, und Änderungen an einer Quelle greifen, nachdem du sie neu trainiert hast.

Häufige Fragen

Wofür steht RAG?

RAG steht für Retrieval-Augmented Generation. Retrieval ist der Suchschritt, der passende Texte findet, Generation ist das Formulieren der Antwort durch das Sprachmodell. Augmented bedeutet, dass der Prompt des Modells um die gefundenen Texte ergänzt wird.

Was ist der Unterschied zwischen RAG und Fine-Tuning?

RAG gibt dem Modell im Moment der Antwort passende Dokumente mit, Fine-Tuning verändert dagegen das Modell selbst durch Training mit zusätzlichen Beispielen. Für faktisches, sich oft änderndes Unternehmenswissen passt RAG meist besser, weil Aktualisierungen nur Inhaltsänderungen erfordern. Fine-Tuning eignet sich eher, um einen einheitlichen Stil oder ein festes Ausgabeformat beizubringen.

Verhindert RAG Halluzinationen?

Es verringert sie, beseitigt sie aber nicht. Das Modell kann eine Textstelle falsch lesen oder Lücken füllen, wenn die Suche den relevanten Text verfehlt. Klare Grounding-Regeln, gepflegte Inhalte und Tests senken das Risiko weiter.

Brauche ich für RAG eine Vektordatenbank?

Die meisten RAG-Systeme speichern Embeddings in einem Vektorindex, entweder in einer eigenen Vektordatenbank oder in einer normalen Datenbank mit Vektorunterstützung. Gehostete Chatbot-Plattformen wie intoCHAT übernehmen diese Speicherung für dich. Viele Systeme ergänzen außerdem eine Stichwortsuche, weil exakte Begriffe wie Artikelnummern mit Vektoren allein leicht untergehen.

Sieh, wie er mit deiner Website antwortet

Gib die Adresse deiner Website ein und chatte mit einem Agenten, der aus deinen Seiten gebaut wird. Das dauert etwa eine Minute.

Agent kostenlos erstellen

Kostenloser Plan, keine Kreditkarte nötig.