Rastreador web (crawler)
Última actualización:
Qué es un rastreador web
Un rastreador web, también llamado araña o bot, parte de una o varias direcciones y recorre un sitio página a página. Los más conocidos son los de los buscadores, como Googlebot y Bingbot, que descubren e indexan páginas. Las empresas de IA usan rastreadores como GPTBot de OpenAI para recopilar contenido para sus modelos, y las plataformas de chatbots los usan para leer la web de una empresa concreta.
Los propietarios de sitios dan instrucciones a los rastreadores mediante un archivo robots.txt y pueden listar sus páginas en un sitemap XML. Los rastreadores responsables respetan esas señales y se identifican con un nombre de user agent.
Cómo funciona un rastreador web
La mayoría de los rastreadores trabajan en cuatro fases:
Los rastreadores suelen limitar cuántas páginas descargan y a qué ritmo, para no sobrecargar el sitio que leen.
- Descubrir: reunir direcciones de páginas a partir de un sitemap, de los enlaces de páginas ya leídas o de ambos.
- Descargar: obtener cada página. Las páginas que construyen su contenido con JavaScript tienen que renderizarse antes en un entorno parecido a un navegador, o el rastreador verá una página casi vacía.
- Extraer: separar el contenido principal de la navegación, el pie de página, los avisos de cookies y otros elementos repetidos.
- Guardar: almacenar el texto según su finalidad, como un índice de búsqueda o la base de conocimiento de un chatbot.
Ejemplo
Una clínica dental quiere un chatbot que responda preguntas sobre tratamientos y precios. En lugar de copiar textos a mano, la dueña introduce la dirección de la web. El rastreador lee el sitemap y encuentra 40 páginas, y ella desmarca el archivo del blog y las ofertas de empleo. Las páginas restantes sobre tratamientos, precios, horarios y seguros se convierten en el conocimiento del chatbot.
Por qué importa en los chatbots de empresa
La web de una empresa suele ser la descripción más completa y ya aprobada de lo que ofrece, así que rastrearla es la forma más rápida de dar a un chatbot conocimiento útil. La calidad del rastreo marca la calidad de las respuestas: si faltan páginas importantes, si el contenido en JavaScript no se renderiza o si los menús y avisos de cookies acaban en el texto, la búsqueda empeora.
Además, las webs cambian. Cuando se actualizan precios, políticas o productos, hay que refrescar el contenido rastreado, o el chatbot seguirá respondiendo con la versión antigua.
Cómo rastrea intoCHAT una web
En intoCHAT pegas una URL y el rastreador descubre páginas a partir del sitemap y de un mapa de enlaces, hasta 500 URL. Eliges qué páginas incluir y puedes excluir rutas con patrones. Las páginas con mucho JavaScript se renderizan antes de leerlas, y los widgets de chat y los avisos de cookies se eliminan del texto. El número de rastreos al mes depende de tu plan y, cuando tu web cambia, vuelves a entrenar manualmente las fuentes afectadas; no hay sincronización automática. Para probarlo antes, la herramienta gratuita de vista previa crea un agente temporal con 5 páginas de cualquier web.