Embeddings (plongements vectoriels)
Dernière mise à jour:
Ce que sont les embeddings
Un modèle d’embedding transforme un mot, une phrase ou un paragraphe en vecteur : une liste de nombres de longueur fixe, souvent de quelques centaines à quelques milliers de valeurs. Pris isolément, ces nombres ne disent presque rien. Ce qui compte, c’est la position : des textes qui parlent de choses semblables reçoivent des vecteurs orientés dans des directions voisines.
Le sens devient ainsi mesurable. « Comment retourner une veste ? » et « Quelle est votre politique de remboursement pour les vêtements ? » n’ont presque aucun mot en commun, mais leurs embeddings sont proches, et un système peut donc les relier.
Comment fonctionnent les embeddings
Les modèles d’embedding sont des réseaux de neurones entraînés sur de grands volumes de texte pour rapprocher les contenus apparentés. Dans un chatbot, on les utilise en trois étapes :
Les vecteurs issus de modèles d’embedding différents ne sont pas compatibles. Si le modèle change, tous les contenus doivent être vectorisés à nouveau.
- Chaque segment de vos contenus est envoyé une fois au modèle d’embedding, et le vecteur obtenu est enregistré.
- Quand une question arrive, elle est vectorisée avec le même modèle.
- Le système compare le vecteur de la question aux vecteurs enregistrés, généralement par similarité cosinus, et renvoie les segments les plus proches.
Exemple
Un hôtel enregistre sa FAQ sous forme de segments avec leurs embeddings. Un client demande : « Puis-je venir avec mon chien ? » Le segment le plus proche est celui sur la politique relative aux animaux, qui indique que les animaux de compagnie sont acceptés moyennant un supplément par nuit. Une recherche par mot-clé sur « chien » pourrait passer à côté si la page parle seulement d’« animaux », alors que les embeddings font le lien.
Pourquoi les embeddings comptent pour les chatbots d’entreprise
Les visiteurs utilisent rarement les mêmes mots que votre site. Grâce aux embeddings, un chatbot trouve le bon passage malgré les synonymes, les fautes de frappe et les reformulations. Les modèles d’embedding multilingues peuvent même rapprocher une question posée dans une langue d’un contenu rédigé dans une autre.
Leur point faible, ce sont les termes exacts. Références produits, numéros de modèle et noms rares sont parfois mal retrouvés, car un vecteur capture le sens général plutôt que la chaîne de caractères précise. C’est pourquoi de nombreux systèmes associent embeddings et recherche par mots-clés.
Comment intoCHAT utilise les embeddings
Quand vous entraînez un agent intoCHAT, chaque segment de vos pages web, fichiers, textes et paires questions-réponses reçoit un embedding, qu’intoCHAT stocke et indexe pour vous. Pendant le chat, la question du visiteur est vectorisée et comparée à vos contenus, puis les résultats sont fusionnés avec une recherche par mots-clés en un classement hybride unique. Si vous modifiez une source, son réentraînement met à jour ses embeddings.