Zum Inhalt springen

Embeddings

Zuletzt aktualisiert:

Was Embeddings sind

Ein Embedding-Modell verwandelt ein Wort, einen Satz oder einen Absatz in einen Vektor: eine Liste von Zahlen mit fester Länge, oft einige hundert bis einige tausend Werte. Einzeln sagen die Zahlen wenig aus. Entscheidend ist die Lage im Raum: Texte über ähnliche Dinge bekommen Vektoren, die in ähnliche Richtungen zeigen.

Damit wird Bedeutung messbar. „Wie schicke ich eine Jacke zurück?“ und „Wie läuft die Erstattung bei Kleidung?“ haben kaum gemeinsame Wörter, aber ihre Embeddings liegen nah beieinander, sodass ein System sie als verwandt erkennt.

So funktionieren Embeddings

Embedding-Modelle sind neuronale Netze, die mit großen Textmengen darauf trainiert wurden, Verwandtes nah beieinander abzulegen. In einem Chatbot geschieht das in drei Schritten:

Vektoren verschiedener Embedding-Modelle sind nicht kompatibel. Wechselt das Modell, müssen alle Inhalte neu eingebettet werden.

  • Jeder Chunk deiner Inhalte wird einmal an das Embedding-Modell geschickt, und der entstehende Vektor wird gespeichert.
  • Kommt eine Frage herein, wird sie mit demselben Modell eingebettet.
  • Das System vergleicht den Fragevektor mit den gespeicherten Vektoren, meist über die Kosinus-Ähnlichkeit, und liefert die nächstgelegenen Chunks.

Beispiel

Ein Hotel speichert seine FAQ als Chunks mit Embeddings. Ein Gast fragt: „Darf ich meinen Hund mitbringen?“ Der nächstgelegene Chunk ist der zur Haustierregelung, laut der Haustiere gegen eine Gebühr pro Nacht willkommen sind. Eine Stichwortsuche nach „Hund“ könnte diese Stelle verfehlen, wenn auf der Seite nur „Haustiere“ steht, die Embeddings erkennen dagegen den Zusammenhang.

Warum Embeddings für Business-Chatbots wichtig sind

Besucher verwenden selten dieselben Wörter wie deine Website. Mit Embeddings findet ein Chatbot die richtige Stelle trotz Synonymen, Tippfehlern und Umschreibungen. Mehrsprachige Embedding-Modelle können sogar eine Frage in einer Sprache mit Inhalten in einer anderen Sprache verbinden.

Ihre Schwachstelle sind exakte Begriffe. Artikelnummern, Modellbezeichnungen und seltene Namen werden oft schlecht getroffen, weil ein Vektor die allgemeine Bedeutung erfasst, nicht die genaue Zeichenfolge. Deshalb kombinieren viele Systeme Embeddings mit einer Stichwortsuche.

Wie intoCHAT Embeddings nutzt

Wenn du einen intoCHAT-Agenten trainierst, bekommt jeder Chunk deiner Webseiten, Dateien, Textbausteine und Q&A-Paare ein Embedding, und intoCHAT speichert und indexiert sie für dich. Im Chat wird die Frage des Besuchers eingebettet und mit deinen Inhalten verglichen, und die Treffer werden mit einer Stichwortsuche zu einer gemeinsamen hybriden Rangliste zusammengeführt. Bearbeitest du eine Quelle, erneuert das Neutrainieren ihre Embeddings.

Häufige Fragen

Was ist der Unterschied zwischen Embeddings und Stichwörtern?

Eine Stichwortsuche findet die exakten Wörter einer Anfrage, Embeddings dagegen die Bedeutung. Embeddings finden verwandte Texte auch bei anderer Formulierung, können aber exakte Codes oder Namen verfehlen. Eine hybride Suche nutzt beides, damit sich die Verfahren gegenseitig ergänzen.

Ist das Erstellen von Embeddings dasselbe wie ein Modell zu trainieren?

Nein. Beim Erstellen von Embeddings werden deine Inhalte für die Suche in Vektoren umgewandelt, das Sprachmodell selbst bleibt unverändert. Deshalb lässt sich das Wissen eines Chatbots auf diese Weise schnell und ohne Fine-Tuning aktualisieren.

Wo werden Embeddings gespeichert?

Meist in einer Vektordatenbank oder in einer normalen Datenbank mit Vektorindex, die schnell die Vektoren findet, die einer Anfrage am nächsten liegen. Auf einer gehosteten Plattform wie intoCHAT übernimmt der Anbieter Speicherung und Indexierung für dich.

Funktionieren Embeddings sprachübergreifend?

Mehrsprachige Embedding-Modelle legen Texte mit gleicher Bedeutung auch dann nah beieinander, wenn sie in verschiedenen Sprachen geschrieben sind. Wie gut das klappt, hängt vom Modell und den beteiligten Sprachen ab. Zuverlässig prüfen lässt es sich nur mit echten Fragen in den Sprachen deiner Besucher.

Sieh, wie er mit deiner Website antwortet

Gib die Adresse deiner Website ein und chatte mit einem Agenten, der aus deinen Seiten gebaut wird. Das dauert etwa eine Minute.

Agent kostenlos erstellen

Kostenloser Plan, keine Kreditkarte nötig.