Procesamiento del lenguaje natural (PLN)
Última actualización:
Qué es el PLN
El PLN está a medio camino entre la lingüística y el aprendizaje automático. Abarca cualquier tarea en la que un software tenga que manejar lenguaje cotidiano en lugar de datos estructurados: traducir textos, resumir documentos, filtrar spam, transcribir voz o responder preguntas en un chat.
Lo difícil es que el lenguaje es ambiguo. Una misma palabra puede significar cosas distintas, la gente comete erratas y el sentido depende a menudo del contexto.
Cómo funciona el PLN
Los sistemas de PLN antiguos usaban reglas escritas a mano y modelos estadísticos, cada uno entrenado para una tarea concreta. Hoy la mayor parte del PLN funciona con modelos de lenguaje de gran tamaño entrenados con enormes cantidades de texto. Sus piezas habituales son:
- Tokenización: dividir el texto en unidades pequeñas que el modelo puede procesar.
- Embeddings: convertir palabras y fragmentos en números que representan su significado, de modo que las ideas parecidas quedan cerca.
- Clasificación: asignar una etiqueta, como un idioma, un tema o una intención.
- Generación: producir texto nuevo, por ejemplo una respuesta o un resumen.
Ejemplo
Un cliente escribe «mi paquete aun no a llegado, lo pedi el martes pasado». Gracias al PLN, el sistema tolera las faltas de ortografía, entiende que se trata de un envío retrasado, interpreta «el martes pasado» como referencia temporal y responde en el mismo idioma. Una búsqueda por palabras clave podría no entenderlo, porque la palabra «envío» no aparece.
Por qué importa en los chatbots para empresas
Sin PLN, un chatbot solo reacciona a palabras clave exactas o a clics en botones. Con el PLN actual, los visitantes preguntan con sus propias palabras y en su idioma, y aun así reciben una respuesta relevante. El PLN también está detrás de la fase de búsqueda de muchos chatbots de IA: la búsqueda semántica usa embeddings para encontrar fragmentos que coinciden con el significado de una pregunta, no solo con sus palabras.
El PLN en intoCHAT
intoCHAT usa un modelo de lenguaje de OpenAI, elegido y gestionado por intoCHAT, para entender a los visitantes y redactar las respuestas. El modelo detecta el idioma del visitante y responde en él. Para encontrar la información correcta, intoCHAT combina búsqueda semántica y búsqueda por palabras clave en tu contenido, lo que ayuda tanto con preguntas reformuladas como con términos exactos, por ejemplo nombres de productos.