Zum Inhalt springen

RAG vs. Fine-Tuning für Business-Chatbots

Zuletzt aktualisiert:

Zwei Wege, einem Chatbot dein Wissen zu geben

Ein allgemeines Sprachmodell weiß viel über die Welt, aber nichts über deine Öffnungszeiten, deine Rückgaberegeln oder das Produkt, das du letzten Monat eingeführt hast. Damit ein Chatbot Fragen zu deinem Unternehmen beantworten kann, müssen deine eigenen Informationen irgendwie ins Gespräch kommen.

Dafür gibt es zwei gängige Ansätze. Retrieval-Augmented Generation, kurz RAG, lässt deine Inhalte außerhalb des Modells und reicht ihm zum Zeitpunkt der Frage die passenden Teile weiter. Fine-Tuning verändert das Modell selbst, indem es mit Beispielen weitertrainiert wird. Beide lösen unterschiedliche Probleme, und wer sie verwechselt, wird von seinem Chatbot-Projekt oft enttäuscht.

Was Retrieval-Augmented Generation ist

RAG arbeitet in zwei Phasen. Zuerst werden deine Inhalte vorbereitet: Webseiten, Dokumente und FAQs werden in kurze Abschnitte zerlegt, oft Chunks genannt. Jeder Abschnitt wird in ein Embedding umgewandelt, eine Zahlenreihe, die seine Bedeutung abbildet, und in einem durchsuchbaren Index gespeichert.

Stellt dann ein Besucher eine Frage, durchsucht das System diesen Index nach den Abschnitten, die am ehesten die Antwort enthalten. Diese Abschnitte landen zusammen mit der Frage und einer Reihe von Anweisungen im Prompt, und das Sprachmodell formuliert daraus eine Antwort. Das Modell hat deine Inhalte nicht auswendig gelernt. Es liest jedes Mal die relevanten Stellen, ähnlich wie eine Mitarbeiterin, die vor der Antwort kurz im Handbuch nachschlägt.

Weil die Fakten im Index liegen und nicht im Modell, ist eine neue Antwort eine Änderung am Inhalt, kein Trainingsauftrag. Du bearbeitest die Seite, indexierst sie neu, und die nächste Antwort berücksichtigt die Änderung. Und weil das System weiß, welche Abschnitte es verwendet hat, kann es zeigen, woher eine Antwort stammt, oder sagen, dass es nichts Passendes gefunden hat.

Was Fine-Tuning ist

Beim Fine-Tuning wird ein bestehendes Modell mit einer Sammlung von Beispielen weitertrainiert, meist Paaren aus einer Eingabe und der gewünschten Ausgabe. Das Training passt die internen Gewichte des Modells an, sodass das neue Verhalten Teil des Modells selbst wird.

Fine-Tuning ist gut darin, einem Modell beizubringen, wie es antworten soll: ein einheitlicher Ton, ein festes Ausgabeformat, ein Klassifizierungsschema oder eine eng umrissene Aufgabe, die sich oft wiederholt. Als Weg, Fakten zu vermitteln, ist es deutlich weniger zuverlässig. Ein feinabgestimmtes Modell speichert deine Preisliste nicht als Dokument, in dem es nachsehen kann. Es übernimmt Muster aus den Beispielen, und wenn es nach einem Detail gefragt wird, das es nur ein- oder zweimal gesehen hat, vermischt es dieses womöglich mit etwas anderem oder füllt die Lücke mit einer plausibel klingenden Vermutung.

Außerdem braucht Fine-Tuning aufbereitete Trainingsdaten: eine Sammlung guter, einheitlicher Beispiele, die genau das gewünschte Verhalten zeigen, und bei jeder wichtigen Änderung eine neue Runde aus Training und Auswertung. Einen Fakt, den das Modell gelernt hat, wirst du nicht einfach los, indem du eine Seite löschst. Meist musst du mit korrigierten Daten neu trainieren.

RAG und Fine-Tuning im Vergleich

Die Tabelle vergleicht beide Ansätze in den Punkten, die für einen Chatbot mit Fragen zu deinem Unternehmen am meisten zählen.

Retrieval-Augmented Generation (RAG)Fine-Tuning
Was sich ändertWas das Modell vor der Antwort liestDie Gewichte des Modells und damit sein Standardverhalten
Fakten aktuell haltenQuelle bearbeiten oder neu indexieren, die nächste Antwort nutzt sieNeue Trainingsdaten und ein weiterer Trainingslauf nötig
Aufwand bei ÄnderungenGering: eine Änderung am InhaltHöher: Daten aufbereiten, trainieren und testen
Antworten zur Quelle zurückverfolgenMöglich, weil die gefundenen Abschnitte bekannt sindNicht direkt möglich, das Wissen ist über die Gewichte verteilt
Halluzinationen eindämmenAnweisungen können Antworten auf gefundene Inhalte beschränken und „Ich weiß es nicht“ erlaubenSchwieriger, das Modell antwortet womöglich selbstsicher aus Mustern
Benötigte DatenDeine vorhandenen Seiten, Dokumente und FAQsKuratierte Beispiele aus Eingabe und Ausgabe
Inhalte entfernenQuelle aus dem Index löschenOhne diese Daten neu trainieren
Am besten fürFaktenantworten aus Inhalten, die sich ändernTon, Format und eng umrissene, wiederkehrende Aufgaben

Keyword-Suche, semantische und hybride Suche

Wie gut ein RAG-Chatbot ist, hängt stark vom Suchschritt ab. Wird der richtige Abschnitt nicht gefunden, kann auch das beste Modell nicht richtig antworten. Es gibt zwei grundlegende Arten zu suchen.

Die Keyword-Suche gleicht die Wörter der Frage mit den Wörtern in deinen Inhalten ab. Bei exakten Begriffen ist sie präzise: Artikelnummern, Modellbezeichnungen, Namen, Fehlermeldungen und Abkürzungen. Schwer tut sie sich, wenn Besucher andere Wörter verwenden als deine Seite, etwa wenn jemand fragt, wie er „etwas zurückschicken“ kann, die Seite aber „Rückgaberichtlinie“ heißt.

Die semantische Suche vergleicht Embeddings statt Wörter und findet so Abschnitte mit ähnlicher Bedeutung, auch wenn die Formulierung abweicht. Umschriebene und umgangssprachliche Fragen erkennt sie gut, exakte Kennungen übersieht sie aber leicht, weil etwa eine Teilenummer für sich genommen kaum Bedeutung trägt.

Die hybride Suche führt beide aus und kombiniert die Ergebnisse. Eine Frage wie „Passt der X200 an mein Fahrrad von 2019?“ profitiert von der Keyword-Suche nach „X200“ und von der semantischen Suche für den Rest. Für Unternehmensinhalte, in denen sich Alltagssprache mit Namen und Codes mischt, ist die hybride Suche meist die robusteste Wahl.

Wann Fine-Tuning sinnvoll ist

Fine-Tuning ist nicht das falsche Werkzeug, sondern ein anderes. Beide Ansätze lassen sich auch kombinieren: Ein Modell, das auf Ton oder Format feinabgestimmt ist, kann seine Fakten trotzdem per Retrieval holen.

Fine-Tuning lohnt einen genaueren Blick, wenn einer oder mehrere dieser Punkte zutreffen:

  • Du brauchst ein sehr einheitliches Ausgabeformat, zum Beispiel strukturierte Daten für ein anderes System.
  • Die Aufgabe ist eng umrissen und fällt in großer Menge an, etwa das Einordnen eingehender Nachrichten in feste Kategorien.
  • Du willst einen bestimmten Stil oder Ton, den Anweisungen allein nicht zuverlässig erzeugen.
  • Du hast viele hochwertige Beispiele und die Kapazität, bei Änderungen neu zu trainieren und zu testen.

Inhalte für einen RAG-Chatbot vorbereiten

Bei den meisten Website-Chatbots übernehmen klare Anweisungen das, was man sich vom Fine-Tuning erhofft, und Retrieval liefert das Wissen. Retrieval findet aber nur, was in deinen Inhalten steht, und funktioniert am besten, wenn diese klar sind. Ein paar Gewohnheiten helfen dabei:

  • Beginne mit Seiten, die für Kunden geschrieben sind: FAQs, Produkt- und Leistungsseiten, Preise, Versand, Richtlinien und Hilfeartikel.
  • Lass Seiten weg, die nur Rauschen erzeugen, etwa Archive, Tag-Seiten, Login-Seiten und veraltete Ankündigungen.
  • Entferne oder aktualisiere alte Dokumente. Widersprechen sich zwei Quellen, findet der Chatbot womöglich die falsche.
  • Lege Q&A-Paare für Fragen an, bei denen es auf den genauen Wortlaut ankommt, etwa Kündigungsfristen oder Garantiebedingungen.
  • Behandle nach Möglichkeit ein Thema pro Seite oder Abschnitt, damit jeder Abschnitt für sich verständlich ist.
  • Indexiere nach wichtigen Änderungen neu, zum Beispiel bei neuen Preisen oder Öffnungszeiten.
  • Teste vor dem Start mit den Fragen, die echte Besucher stellen, auch mit vagen Fragen und mit solchen, die deine Inhalte nicht beantworten.

So macht es intoCHAT

intoCHAT setzt auf Retrieval. Wenn du einen Agenten erstellst, trainierst du ihn mit deinen eigenen Inhalten: Du fügst die URL deiner Website ein und wählst die Seiten aus, die gelesen werden sollen, lädst Dateien wie PDFs, Word-Dokumente, Tabellen oder Präsentationen hoch und ergänzt Textbausteine oder Q&A-Paare. intoCHAT zerlegt diese Inhalte in Abschnitte und erstellt Embeddings dafür.

Stellt ein Besucher eine Frage, führt intoCHAT eine hybride Suche aus, die semantische Suche und Keyword-Suche über deine Inhalte kombiniert, und gibt die besten Abschnitte zusammen mit deinen Anweisungen an das KI-Modell weiter. Eingebaute Regeln halten die Antworten an deinen Quellen und wehren Prompt-Injection ab, und der Agent sagt, wenn er etwas nicht weiß, statt eine Antwort zu erfinden.

intoCHAT führt kein Fine-Tuning von Modellen mit deinen Inhalten durch. Einen Agenten zu trainieren heißt bei intoCHAT, deine Inhalte für die Suche zu indexieren, nicht das Modell zu verändern. Das KI-Modell ist ein OpenAI-Modell, das intoCHAT auswählt und verwaltet, und Abschnitte deiner Inhalte werden an OpenAI gesendet, um Embeddings zu erstellen und Antworten zu generieren. Deshalb gehen Aktualisierungen auch schnell: Dein Wissen liegt in Quellen, die du selbst steuerst, nicht in einem Modell.

  • Antworten aus Q&A-Paaren haben Vorrang vor anderen Quellen, so legst du den Wortlaut wichtiger Antworten fest.
  • Markierst du eine Quelle mit einem Stern, wird sie bei der Suche höher gewichtet, ganz ohne neues Training.
  • Jede Quelle kannst du bearbeiten, in der Vorschau ansehen, herunterladen, löschen oder neu trainieren. Das Neutrainieren passiert manuell, trainiere eine Quelle also neu, wenn sich ihr Inhalt geändert hat.
  • Im Playground testest du den Agenten mit echten Fragen, bevor er live geht.

Den passenden Ansatz wählen

Wenn dein Chatbot Kundenfragen anhand von Informationen beantworten soll, die du veröffentlichst, fang mit Retrieval an. Es nutzt die Inhalte, die du schon hast, bleibt aktuell, wenn du diese Inhalte aktualisierst, und hält die Antworten an deinen Quellen. Fine-Tuning lohnt sich erst, wenn du ein bestimmtes Verhalten brauchst, das Anweisungen nicht liefern, und du die Daten und die Zeit hast, es zu pflegen.

Am schnellsten siehst du Retrieval in der Praxis mit deiner eigenen Website: Das kostenlose Vorschau-Tool baut einen temporären Agenten aus fünf deiner Seiten, und wenn du weitermachen willst, erstellst du deinen intoCHAT-Agenten kostenlos.

Häufige Fragen

Ist RAG für einen Kundenservice-Chatbot besser als Fine-Tuning?

In den meisten Fällen ja. Antworten im Kundenservice hängen von Fakten wie Richtlinien, Preisen und Abläufen ab, die sich mit der Zeit ändern, und mit Retrieval antwortet der Chatbot aus der aktuellen Version deiner Inhalte. Fine-Tuning eignet sich besser, um Ton oder Ausgabeformat zu prägen, als um Fakten korrekt zu halten.

Verhindert Fine-Tuning, dass ein Chatbot halluziniert?

Nein. Fine-Tuning kann ein Modell mehr nach deiner Marke klingen lassen, gibt ihm aber kein verlässliches Verzeichnis deiner Fakten, und das Modell kann weiterhin selbstsicher falsche Antworten geben. Antworten auf gefundene Abschnitte zu stützen und den Chatbot anzuweisen, fehlende Informationen offen zu sagen, ist ein direkterer Weg, erfundene Antworten zu reduzieren.

Lassen sich RAG und Fine-Tuning kombinieren?

Ja. Ein Modell kann auf einen bestimmten Stil oder ein Format feinabgestimmt sein und trotzdem per Retrieval Fakten nachschlagen, wenn eine Frage kommt. Bei den meisten Website-Chatbots regeln klare Anweisungen den Ton bereits, sodass Retrieval allein meist genügt.

Was ist hybride Suche bei einem RAG-Chatbot?

Hybride Suche kombiniert die semantische Suche, die nach Bedeutung sucht, mit der Keyword-Suche, die nach exakten Wörtern sucht. Das hilft, wenn Fragen Alltagssprache mit Namen, Artikelnummern oder anderen exakten Begriffen mischen. Die Ergebnisse beider Suchen werden zusammengeführt, damit die relevantesten Abschnitte beim Modell ankommen.

Macht intoCHAT ein Fine-Tuning von KI-Modellen mit meinen Inhalten?

Nein, intoCHAT führt kein Fine-Tuning von Modellen mit deinen Inhalten durch. Wenn intoCHAT vom Trainieren eines Agenten spricht, ist das Indexieren deiner Inhalte für die Suche gemeint: Sie werden in Abschnitte zerlegt, als Embeddings gespeichert und durchsucht, wenn ein Besucher eine Frage stellt. Um Embeddings zu erstellen und Antworten zu generieren, werden Abschnitte an OpenAI gesendet, dessen Modell intoCHAT auswählt und verwaltet.

Wie aktualisiere ich, was ein intoCHAT-Agent weiß?

Bearbeite oder ersetze die Quelle und trainiere sie neu, das ist ein manueller Schritt. Du kannst auch Q&A-Paare anlegen, die Vorrang vor anderen Quellen haben, oder eine Quelle mit einem Stern markieren, damit sie ohne neues Training höher gewichtet wird. intoCHAT synchronisiert deine Website nicht automatisch, trainiere also nach wichtigen Änderungen neu.

Sieh, wie er mit deiner Website antwortet

Gib die Adresse deiner Website ein und chatte mit einem Agenten, der aus deinen Seiten gebaut wird. Das dauert etwa eine Minute.

Agent kostenlos erstellen

Kostenloser Plan, keine Kreditkarte nötig.