Embeddings
Última actualización:
Qué son los embeddings
Un modelo de embeddings convierte una palabra, una frase o un párrafo en un vector: una lista de números de longitud fija, a menudo de varios cientos a unos miles de valores. Por separado, cada número significa poco. Lo que importa es la posición: los textos sobre cosas parecidas reciben vectores que apuntan en direcciones similares.
Así el significado se vuelve medible. «¿Cómo devuelvo una chaqueta?» y «¿Cuál es vuestra política de reembolso para ropa?» apenas comparten palabras, pero sus embeddings están cerca, y un sistema puede tratarlas como relacionadas.
Cómo funcionan los embeddings
Los modelos de embeddings son redes neuronales entrenadas con grandes cantidades de texto para situar cerca el contenido relacionado. En un chatbot se usan en tres pasos:
Los vectores de modelos de embeddings distintos no son compatibles. Si cambia el modelo, hay que volver a procesar todo el contenido.
- Cada fragmento de tu contenido se envía una vez al modelo de embeddings y se guarda el vector resultante.
- Cuando llega una pregunta, se convierte en embedding con el mismo modelo.
- El sistema compara el vector de la pregunta con los guardados, normalmente por similitud del coseno, y devuelve los fragmentos más cercanos.
Ejemplo
Un hotel guarda sus preguntas frecuentes como fragmentos con embeddings. Un huésped pregunta: «¿Puedo llevar a mi perro?». El fragmento más cercano es el de la política de mascotas, que dice que se admiten animales con un suplemento por noche. Una búsqueda por la palabra «perro» podría no encontrarlo si la página solo habla de «mascotas», pero los embeddings reconocen la relación.
Por qué los embeddings importan en los chatbots de empresa
Los visitantes rara vez usan las mismas palabras que tu web. Con embeddings, un chatbot encuentra el fragmento correcto a pesar de sinónimos, erratas y paráfrasis. Los modelos de embeddings multilingües pueden incluso relacionar una pregunta en un idioma con contenido escrito en otro.
Su punto débil son los términos exactos. Referencias de producto, números de modelo y nombres poco comunes pueden emparejarse mal, porque un vector capta el significado general y no la cadena exacta. Por eso muchos sistemas combinan embeddings con búsqueda por palabras clave.
Cómo usa intoCHAT los embeddings
Cuando entrenas un agente de intoCHAT, cada fragmento de tus páginas web, archivos, textos y pares de preguntas y respuestas recibe un embedding, e intoCHAT los guarda e indexa por ti. Durante el chat, la pregunta del visitante se convierte en embedding y se compara con tu contenido, y los resultados se combinan con una búsqueda por palabras clave en una única clasificación híbrida. Si editas una fuente, al volver a entrenarla se actualizan sus embeddings.