Chunking
Zuletzt aktualisiert:
Was Chunking ist
Suchsysteme und Sprachmodelle arbeiten mit fokussierten Passagen besser als mit ganzen Dokumenten. Ein 40-seitiges Handbuch behandelt Dutzende Themen, ein einziges Embedding des ganzen Handbuchs wäre deshalb ein verschwommener Durchschnitt aus allen. Chunking zerlegt das Handbuch in Passagen zu je einem Thema, sodass jede für sich gefunden werden kann.
Jeder Chunk wird mit einem Verweis auf seine Quelle gespeichert. So weiß das System, aus welcher Seite oder Datei eine Antwort stammt.
So funktioniert es
Es gibt mehrere gängige Strategien, und viele Systeme kombinieren sie:
- Feste Größe: Der Text wird alle N Zeichen oder Tokens geteilt. Das ist einfach, kann aber Sätze und Gedanken mittendrin zerschneiden.
- Strukturbasiert: Geteilt wird an Absätzen, Überschriften oder Satzgrenzen, sodass natürliche Einheiten zusammenbleiben.
- Überlappung: Ein kleines Stück Text vom Ende eines Chunks wird am Anfang des nächsten wiederholt, damit Kontext an der Grenze nicht verloren geht.
- Semantisches Chunking: Ein neuer Chunk beginnt dort, wo das Thema wechselt, erkannt über Embeddings.
Die richtige Chunk-Größe
Die Chunk-Größe ist ein Kompromiss. Kleine Chunks sind präzise, können aber Kontext verlieren, etwa einen Satz wie „Das gilt für alle Bestellungen“ ohne den Satz, der erklärt, was „das“ ist. Große Chunks behalten Kontext, verwässern aber das Embedding, passen damit zu weniger konkreten Fragen und belegen mehr vom Kontextfenster des Modells.
Beispiel: Die FAQ-Seite eines Hotels behandelt Check-in-Zeiten, Parken, Haustiere und Frühstück. Ohne Chunking würde eine Frage zu Haustieren die ganze Seite abrufen, und die Antwort könnte fremde Details vermischen. Mit Chunking nach Absätzen wird der Abschnitt zu Haustieren ein eigener Chunk und liefert dem Modell eine saubere, fokussierte Quelle.
Warum das für Business-Chatbots wichtig ist
Chunking wird leicht übersehen, beeinflusst aber jede Antwort. Schlechte Chunks führen zu zwei typischen Fehlern: Die richtige Information wird nicht gefunden, weil sie in einer fremden Passage untergeht, oder sie wird ohne den Satz gefunden, der ihre Bedingungen nennt. Klar strukturierte Inhalte helfen. Kurze Abschnitte mit aussagekräftigen Überschriften lassen sich gut teilen, lange Textwüsten oder in Fließtext umgewandelte Tabellen dagegen schlecht.
So geht intoCHAT damit um
intoCHAT teilt deine Inhalte automatisch in Chunks, wenn du eine Quelle trainierst. Der Text wird an Absatz- und Satzgrenzen geteilt, und benachbarte Chunks überlappen leicht, damit Gedanken über eine Grenze hinweg erhalten bleiben. Jeder Chunk bekommt dann ein Embedding und wird per hybrider Suche durchsucht. Eine Chunk-Größe wählst du nicht. Am meisten hilft es, deine Quellinhalte gut zu strukturieren.