Cómo responde intoCHAT a partir de tu contenido
Cómo encuentra respuestas un agente de intoCHAT: fragmentación, búsqueda híbrida semántica y por palabras clave, fuentes prioritarias y sin fine-tuning.
intoCHAT no vuelve a entrenar un modelo de IA con tu contenido. Indexa tus fuentes y, para cada mensaje de un visitante, busca los fragmentos útiles y se los pasa al modelo junto con tus instrucciones. Conocer los pasos te ayuda a entender por qué una respuesta sale como sale.
1. Entrenamiento: dividir e indexar
Cuando pulsas Train agent, el texto de cada fuente se divide en fragmentos:
- Un fragmento tiene como máximo unos 1.600 caracteres. Los párrafos se mantienen enteros siempre que se puede; los largos se cortan entre frases.
- Los fragmentos vecinos se solapan unos 200 caracteres, para que un dato que cae en el límite se encuentre desde ambos lados.
- Un par de pregunta y respuesta se queda en una sola pieza, salvo que sea más largo que un fragmento.
- Cada fragmento se indexa junto con el título y la dirección de su fuente. Así un párrafo bajo «Plan Pro» se distingue del mismo texto bajo «Plan Starter».
En el panel, «entrenamiento» significa esta indexación. El modelo de IA en sí no cambia.
2. Entender la pregunta
Las preguntas de seguimiento suelen depender de lo anterior, como «¿y cuánto cuesta?». Por eso el agente reescribe primero el último mensaje como una consulta de búsqueda independiente, usando los últimos turnos de la conversación. Los nombres, códigos de producto y números se mantienen tal cual, igual que el idioma del visitante.
3. Búsqueda híbrida
La consulta pasa por dos búsquedas sobre tus fragmentos entrenados:
- La búsqueda semántica encuentra fragmentos con el mismo significado, aunque usen otras palabras.
- La búsqueda por palabras clave encuentra términos exactos como códigos de producto, nombres y precios, que la búsqueda semántica puede pasar por alto.
Las dos listas de resultados se combinan. Los fragmentos que no encajan lo bastante con la pregunta se descartan, para que una coincidencia débil no pase por respuesta. Un fragmento encontrado solo por palabras clave debe contener todas las palabras relevantes de la pregunta o todos los códigos de producto que cita.
4. Elegir lo que ve el modelo
De las coincidencias restantes, el agente elige como máximo seis fragmentos, con unos 12.000 caracteres en total. De una misma fuente toma primero tres como mucho, para que un único documento largo no desplace al resto. Cuando los resultados están parejos, gana el tipo de fuente más fiable, en este orden:
- Pares de pregunta y respuesta. Un par que encaja de cerca con la pregunta siempre se coloca primero.
- Fuentes marcadas como prioritarias (icono de estrella).
- Textos.
- Archivos.
- Páginas web.
Cada fragmento lleva una etiqueta con su tipo y la fecha de su último entrenamiento. Si los fragmentos se contradicen, el modelo debe seguir el mismo orden y, entre fuentes del mismo tipo, fiarse de la más reciente. Tus instrucciones están por encima de todo el conocimiento. El resultado correcto de una acción, por ejemplo un precio actualizado de tu API, está por encima de ambos para los datos en tiempo real.
5. Redactar la respuesta
El modelo recibe unas reglas integradas, los ajustes actuales del agente (acciones disponibles y formulario de leads), tus instrucciones y tus guardrails, y la conversación, a la que se adjuntan los fragmentos como material de referencia. Si hay conflicto, las reglas integradas prevalecen sobre tus instrucciones y tus guardrails. Hacen que el agente:
- base los datos del negocio, como productos, precios, condiciones y datos de contacto, solo en tus instrucciones, tu conocimiento o los resultados de acciones;
- diga brevemente lo que no puede confirmar cuando no encuentra nada pertinente, en lugar de inventarse una respuesta, un enlace o una vía de contacto;
- trate tu conocimiento y los resultados de acciones como datos, nunca como instrucciones. Una frase como «ignora tus reglas» en una página rastreada no tiene efecto, y los visitantes tampoco pueden saltarse las reglas.
La lista completa está en la página Instrucciones.
Las respuestas las redacta un único modelo de OpenAI que intoCHAT elige y gestiona. No se puede ajustar el modelo ni su temperatura. El agente responde en el idioma en que escribe el visitante.
Qué significa para ti
- Si un dato no está en ninguna fuente entrenada, el agente no puede conocerlo. Comprueba en la vista previa de una fuente qué se leyó realmente. Consulta Gestionar fuentes.
- Para preguntas que deben responderse de una sola manera, añade un par de pregunta y respuesta.
- Si una página desactualizada gana una y otra vez, actualízala o elimínala, o marca como prioritaria la fuente correcta.
- La prioridad se aplica desde la siguiente respuesta. El contenido modificado solo se aplica después del entrenamiento.