Embeddings
Zuletzt aktualisiert:
Was Embeddings sind
Ein Embedding-Modell verwandelt ein Wort, einen Satz oder einen Absatz in einen Vektor: eine Liste von Zahlen mit fester Länge, oft einige hundert bis einige tausend Werte. Einzeln sagen die Zahlen wenig aus. Entscheidend ist die Lage im Raum: Texte über ähnliche Dinge bekommen Vektoren, die in ähnliche Richtungen zeigen.
Damit wird Bedeutung messbar. „Wie schicke ich eine Jacke zurück?“ und „Wie läuft die Erstattung bei Kleidung?“ haben kaum gemeinsame Wörter, aber ihre Embeddings liegen nah beieinander, sodass ein System sie als verwandt erkennt.
So funktionieren Embeddings
Embedding-Modelle sind neuronale Netze, die mit großen Textmengen darauf trainiert wurden, Verwandtes nah beieinander abzulegen. In einem Chatbot geschieht das in drei Schritten:
Vektoren verschiedener Embedding-Modelle sind nicht kompatibel. Wechselt das Modell, müssen alle Inhalte neu eingebettet werden.
- Jeder Chunk deiner Inhalte wird einmal an das Embedding-Modell geschickt, und der entstehende Vektor wird gespeichert.
- Kommt eine Frage herein, wird sie mit demselben Modell eingebettet.
- Das System vergleicht den Fragevektor mit den gespeicherten Vektoren, meist über die Kosinus-Ähnlichkeit, und liefert die nächstgelegenen Chunks.
Beispiel
Ein Hotel speichert seine FAQ als Chunks mit Embeddings. Ein Gast fragt: „Darf ich meinen Hund mitbringen?“ Der nächstgelegene Chunk ist der zur Haustierregelung, laut der Haustiere gegen eine Gebühr pro Nacht willkommen sind. Eine Stichwortsuche nach „Hund“ könnte diese Stelle verfehlen, wenn auf der Seite nur „Haustiere“ steht, die Embeddings erkennen dagegen den Zusammenhang.
Warum Embeddings für Business-Chatbots wichtig sind
Besucher verwenden selten dieselben Wörter wie deine Website. Mit Embeddings findet ein Chatbot die richtige Stelle trotz Synonymen, Tippfehlern und Umschreibungen. Mehrsprachige Embedding-Modelle können sogar eine Frage in einer Sprache mit Inhalten in einer anderen Sprache verbinden.
Ihre Schwachstelle sind exakte Begriffe. Artikelnummern, Modellbezeichnungen und seltene Namen werden oft schlecht getroffen, weil ein Vektor die allgemeine Bedeutung erfasst, nicht die genaue Zeichenfolge. Deshalb kombinieren viele Systeme Embeddings mit einer Stichwortsuche.
Wie intoCHAT Embeddings nutzt
Wenn du einen intoCHAT-Agenten trainierst, bekommt jeder Chunk deiner Webseiten, Dateien, Textbausteine und Q&A-Paare ein Embedding, und intoCHAT speichert und indexiert sie für dich. Im Chat wird die Frage des Besuchers eingebettet und mit deinen Inhalten verglichen, und die Treffer werden mit einer Stichwortsuche zu einer gemeinsamen hybriden Rangliste zusammengeführt. Bearbeitest du eine Quelle, erneuert das Neutrainieren ihre Embeddings.