Búsqueda semántica
Última actualización:
Qué es la búsqueda semántica
La búsqueda tradicional por palabras clave devuelve los documentos que contienen los términos que escribiste. La búsqueda semántica intenta devolver los documentos que responden a lo que querías decir, aunque usen otras palabras. Una consulta como «vuelos baratos a Roma» puede encontrar una página sobre «billetes de bajo coste a la capital italiana».
La idea es anterior a los modelos de lenguaje actuales, pero fueron los embeddings los que la hicieron práctica para usos cotidianos como la búsqueda en sitios web, las recomendaciones y los chatbots con IA.
Cómo funciona
La mayoría de los sistemas de búsqueda semántica siguen los mismos pasos:
- El contenido se divide en fragmentos y un modelo convierte cada uno en un embedding.
- La consulta se convierte en un embedding con el mismo modelo.
- El sistema mide la distancia entre el vector de la consulta y los vectores guardados, a menudo con la similitud del coseno.
- Se devuelven los fragmentos más cercanos, ordenados por similitud.
Un ejemplo
El centro de ayuda de una empresa de software tiene un artículo titulado «Restablecer tus credenciales de acceso». Un cliente escribe «Olvidé mi contraseña y no puedo entrar». Una búsqueda por palabras clave podría dejar el artículo muy abajo, porque apenas coinciden palabras. La búsqueda semántica reconoce que ambos textos describen el mismo problema y muestra el artículo en primer lugar.
También ocurre lo contrario. En una búsqueda del código de error «E-4012» importan los caracteres exactos, no el significado, y la búsqueda semántica puede devolver artículos sobre otros códigos que al modelo le parecen similares. Además, como la similitud es cuestión de grado, siempre devuelve sus mejores candidatos aunque nada sea realmente relevante, así que los buenos sistemas añaden comprobaciones antes de usar los resultados.
Por qué importa en los chatbots para empresas
Los visitantes rara vez usan el mismo vocabulario que tu documentación. Escriben preguntas cortas e informales, cometen errores de escritura o describen un síntoma en vez de nombrar una función. La búsqueda semántica permite al chatbot encontrar igualmente el fragmento correcto, y es la base de respuestas basadas en tu propio contenido y no en el conocimiento general del modelo.
Su punto débil son los términos exactos: SKU, números de pieza, nombres y siglas. Por eso los chatbots en producción suelen combinar la búsqueda semántica con la búsqueda por palabras clave, un enfoque conocido como búsqueda híbrida.
Cómo la usa intoCHAT
intoCHAT crea un embedding para cada fragmento de tu contenido de entrenamiento y ejecuta una búsqueda semántica con cada pregunta de los visitantes. Combina esos resultados con una búsqueda por palabras clave, para que el agente encuentre los fragmentos tanto por significado como por términos exactos. Los pares de pregunta y respuesta que escribes tienen prioridad y las fuentes marcadas con estrella suben en la clasificación, sin volver a entrenar.