RAG vs. Fine-Tuning für Business-Chatbots
Zuletzt aktualisiert:
Zwei Wege, einem Chatbot dein Wissen zu geben
Ein allgemeines Sprachmodell weiß viel über die Welt, aber nichts über deine Öffnungszeiten, deine Rückgaberegeln oder das Produkt, das du letzten Monat eingeführt hast. Damit ein Chatbot Fragen zu deinem Unternehmen beantworten kann, müssen deine eigenen Informationen irgendwie ins Gespräch kommen.
Dafür gibt es zwei gängige Ansätze. Retrieval-Augmented Generation, kurz RAG, lässt deine Inhalte außerhalb des Modells und reicht ihm zum Zeitpunkt der Frage die passenden Teile weiter. Fine-Tuning verändert das Modell selbst, indem es mit Beispielen weitertrainiert wird. Beide lösen unterschiedliche Probleme, und wer sie verwechselt, wird von seinem Chatbot-Projekt oft enttäuscht.
Was Retrieval-Augmented Generation ist
RAG arbeitet in zwei Phasen. Zuerst werden deine Inhalte vorbereitet: Webseiten, Dokumente und FAQs werden in kurze Abschnitte zerlegt, oft Chunks genannt. Jeder Abschnitt wird in ein Embedding umgewandelt, eine Zahlenreihe, die seine Bedeutung abbildet, und in einem durchsuchbaren Index gespeichert.
Stellt dann ein Besucher eine Frage, durchsucht das System diesen Index nach den Abschnitten, die am ehesten die Antwort enthalten. Diese Abschnitte landen zusammen mit der Frage und einer Reihe von Anweisungen im Prompt, und das Sprachmodell formuliert daraus eine Antwort. Das Modell hat deine Inhalte nicht auswendig gelernt. Es liest jedes Mal die relevanten Stellen, ähnlich wie eine Mitarbeiterin, die vor der Antwort kurz im Handbuch nachschlägt.
Weil die Fakten im Index liegen und nicht im Modell, ist eine neue Antwort eine Änderung am Inhalt, kein Trainingsauftrag. Du bearbeitest die Seite, indexierst sie neu, und die nächste Antwort berücksichtigt die Änderung. Und weil das System weiß, welche Abschnitte es verwendet hat, kann es zeigen, woher eine Antwort stammt, oder sagen, dass es nichts Passendes gefunden hat.
Was Fine-Tuning ist
Beim Fine-Tuning wird ein bestehendes Modell mit einer Sammlung von Beispielen weitertrainiert, meist Paaren aus einer Eingabe und der gewünschten Ausgabe. Das Training passt die internen Gewichte des Modells an, sodass das neue Verhalten Teil des Modells selbst wird.
Fine-Tuning ist gut darin, einem Modell beizubringen, wie es antworten soll: ein einheitlicher Ton, ein festes Ausgabeformat, ein Klassifizierungsschema oder eine eng umrissene Aufgabe, die sich oft wiederholt. Als Weg, Fakten zu vermitteln, ist es deutlich weniger zuverlässig. Ein feinabgestimmtes Modell speichert deine Preisliste nicht als Dokument, in dem es nachsehen kann. Es übernimmt Muster aus den Beispielen, und wenn es nach einem Detail gefragt wird, das es nur ein- oder zweimal gesehen hat, vermischt es dieses womöglich mit etwas anderem oder füllt die Lücke mit einer plausibel klingenden Vermutung.
Außerdem braucht Fine-Tuning aufbereitete Trainingsdaten: eine Sammlung guter, einheitlicher Beispiele, die genau das gewünschte Verhalten zeigen, und bei jeder wichtigen Änderung eine neue Runde aus Training und Auswertung. Einen Fakt, den das Modell gelernt hat, wirst du nicht einfach los, indem du eine Seite löschst. Meist musst du mit korrigierten Daten neu trainieren.
RAG und Fine-Tuning im Vergleich
Die Tabelle vergleicht beide Ansätze in den Punkten, die für einen Chatbot mit Fragen zu deinem Unternehmen am meisten zählen.
| Retrieval-Augmented Generation (RAG) | Fine-Tuning | |
|---|---|---|
| Was sich ändert | Was das Modell vor der Antwort liest | Die Gewichte des Modells und damit sein Standardverhalten |
| Fakten aktuell halten | Quelle bearbeiten oder neu indexieren, die nächste Antwort nutzt sie | Neue Trainingsdaten und ein weiterer Trainingslauf nötig |
| Aufwand bei Änderungen | Gering: eine Änderung am Inhalt | Höher: Daten aufbereiten, trainieren und testen |
| Antworten zur Quelle zurückverfolgen | Möglich, weil die gefundenen Abschnitte bekannt sind | Nicht direkt möglich, das Wissen ist über die Gewichte verteilt |
| Halluzinationen eindämmen | Anweisungen können Antworten auf gefundene Inhalte beschränken und „Ich weiß es nicht“ erlauben | Schwieriger, das Modell antwortet womöglich selbstsicher aus Mustern |
| Benötigte Daten | Deine vorhandenen Seiten, Dokumente und FAQs | Kuratierte Beispiele aus Eingabe und Ausgabe |
| Inhalte entfernen | Quelle aus dem Index löschen | Ohne diese Daten neu trainieren |
| Am besten für | Faktenantworten aus Inhalten, die sich ändern | Ton, Format und eng umrissene, wiederkehrende Aufgaben |
Keyword-Suche, semantische und hybride Suche
Wie gut ein RAG-Chatbot ist, hängt stark vom Suchschritt ab. Wird der richtige Abschnitt nicht gefunden, kann auch das beste Modell nicht richtig antworten. Es gibt zwei grundlegende Arten zu suchen.
Die Keyword-Suche gleicht die Wörter der Frage mit den Wörtern in deinen Inhalten ab. Bei exakten Begriffen ist sie präzise: Artikelnummern, Modellbezeichnungen, Namen, Fehlermeldungen und Abkürzungen. Schwer tut sie sich, wenn Besucher andere Wörter verwenden als deine Seite, etwa wenn jemand fragt, wie er „etwas zurückschicken“ kann, die Seite aber „Rückgaberichtlinie“ heißt.
Die semantische Suche vergleicht Embeddings statt Wörter und findet so Abschnitte mit ähnlicher Bedeutung, auch wenn die Formulierung abweicht. Umschriebene und umgangssprachliche Fragen erkennt sie gut, exakte Kennungen übersieht sie aber leicht, weil etwa eine Teilenummer für sich genommen kaum Bedeutung trägt.
Die hybride Suche führt beide aus und kombiniert die Ergebnisse. Eine Frage wie „Passt der X200 an mein Fahrrad von 2019?“ profitiert von der Keyword-Suche nach „X200“ und von der semantischen Suche für den Rest. Für Unternehmensinhalte, in denen sich Alltagssprache mit Namen und Codes mischt, ist die hybride Suche meist die robusteste Wahl.
Wann Fine-Tuning sinnvoll ist
Fine-Tuning ist nicht das falsche Werkzeug, sondern ein anderes. Beide Ansätze lassen sich auch kombinieren: Ein Modell, das auf Ton oder Format feinabgestimmt ist, kann seine Fakten trotzdem per Retrieval holen.
Fine-Tuning lohnt einen genaueren Blick, wenn einer oder mehrere dieser Punkte zutreffen:
- Du brauchst ein sehr einheitliches Ausgabeformat, zum Beispiel strukturierte Daten für ein anderes System.
- Die Aufgabe ist eng umrissen und fällt in großer Menge an, etwa das Einordnen eingehender Nachrichten in feste Kategorien.
- Du willst einen bestimmten Stil oder Ton, den Anweisungen allein nicht zuverlässig erzeugen.
- Du hast viele hochwertige Beispiele und die Kapazität, bei Änderungen neu zu trainieren und zu testen.
Inhalte für einen RAG-Chatbot vorbereiten
Bei den meisten Website-Chatbots übernehmen klare Anweisungen das, was man sich vom Fine-Tuning erhofft, und Retrieval liefert das Wissen. Retrieval findet aber nur, was in deinen Inhalten steht, und funktioniert am besten, wenn diese klar sind. Ein paar Gewohnheiten helfen dabei:
- Beginne mit Seiten, die für Kunden geschrieben sind: FAQs, Produkt- und Leistungsseiten, Preise, Versand, Richtlinien und Hilfeartikel.
- Lass Seiten weg, die nur Rauschen erzeugen, etwa Archive, Tag-Seiten, Login-Seiten und veraltete Ankündigungen.
- Entferne oder aktualisiere alte Dokumente. Widersprechen sich zwei Quellen, findet der Chatbot womöglich die falsche.
- Lege Q&A-Paare für Fragen an, bei denen es auf den genauen Wortlaut ankommt, etwa Kündigungsfristen oder Garantiebedingungen.
- Behandle nach Möglichkeit ein Thema pro Seite oder Abschnitt, damit jeder Abschnitt für sich verständlich ist.
- Indexiere nach wichtigen Änderungen neu, zum Beispiel bei neuen Preisen oder Öffnungszeiten.
- Teste vor dem Start mit den Fragen, die echte Besucher stellen, auch mit vagen Fragen und mit solchen, die deine Inhalte nicht beantworten.
So macht es intoCHAT
intoCHAT setzt auf Retrieval. Wenn du einen Agenten erstellst, trainierst du ihn mit deinen eigenen Inhalten: Du fügst die URL deiner Website ein und wählst die Seiten aus, die gelesen werden sollen, lädst Dateien wie PDFs, Word-Dokumente, Tabellen oder Präsentationen hoch und ergänzt Textbausteine oder Q&A-Paare. intoCHAT zerlegt diese Inhalte in Abschnitte und erstellt Embeddings dafür.
Stellt ein Besucher eine Frage, führt intoCHAT eine hybride Suche aus, die semantische Suche und Keyword-Suche über deine Inhalte kombiniert, und gibt die besten Abschnitte zusammen mit deinen Anweisungen an das KI-Modell weiter. Eingebaute Regeln halten die Antworten an deinen Quellen und wehren Prompt-Injection ab, und der Agent sagt, wenn er etwas nicht weiß, statt eine Antwort zu erfinden.
intoCHAT führt kein Fine-Tuning von Modellen mit deinen Inhalten durch. Einen Agenten zu trainieren heißt bei intoCHAT, deine Inhalte für die Suche zu indexieren, nicht das Modell zu verändern. Das KI-Modell ist ein OpenAI-Modell, das intoCHAT auswählt und verwaltet, und Abschnitte deiner Inhalte werden an OpenAI gesendet, um Embeddings zu erstellen und Antworten zu generieren. Deshalb gehen Aktualisierungen auch schnell: Dein Wissen liegt in Quellen, die du selbst steuerst, nicht in einem Modell.
- Antworten aus Q&A-Paaren haben Vorrang vor anderen Quellen, so legst du den Wortlaut wichtiger Antworten fest.
- Markierst du eine Quelle mit einem Stern, wird sie bei der Suche höher gewichtet, ganz ohne neues Training.
- Jede Quelle kannst du bearbeiten, in der Vorschau ansehen, herunterladen, löschen oder neu trainieren. Das Neutrainieren passiert manuell, trainiere eine Quelle also neu, wenn sich ihr Inhalt geändert hat.
- Im Playground testest du den Agenten mit echten Fragen, bevor er live geht.
Den passenden Ansatz wählen
Wenn dein Chatbot Kundenfragen anhand von Informationen beantworten soll, die du veröffentlichst, fang mit Retrieval an. Es nutzt die Inhalte, die du schon hast, bleibt aktuell, wenn du diese Inhalte aktualisierst, und hält die Antworten an deinen Quellen. Fine-Tuning lohnt sich erst, wenn du ein bestimmtes Verhalten brauchst, das Anweisungen nicht liefern, und du die Daten und die Zeit hast, es zu pflegen.
Am schnellsten siehst du Retrieval in der Praxis mit deiner eigenen Website: Das kostenlose Vorschau-Tool baut einen temporären Agenten aus fünf deiner Seiten, und wenn du weitermachen willst, erstellst du deinen intoCHAT-Agenten kostenlos.