Saltar al contenido

Rastreador web (crawler)

Última actualización:

Qué es un rastreador web

Un rastreador web, también llamado araña o bot, parte de una o varias direcciones y recorre un sitio página a página. Los más conocidos son los de los buscadores, como Googlebot y Bingbot, que descubren e indexan páginas. Las empresas de IA usan rastreadores como GPTBot de OpenAI para recopilar contenido para sus modelos, y las plataformas de chatbots los usan para leer la web de una empresa concreta.

Los propietarios de sitios dan instrucciones a los rastreadores mediante un archivo robots.txt y pueden listar sus páginas en un sitemap XML. Los rastreadores responsables respetan esas señales y se identifican con un nombre de user agent.

Cómo funciona un rastreador web

La mayoría de los rastreadores trabajan en cuatro fases:

Los rastreadores suelen limitar cuántas páginas descargan y a qué ritmo, para no sobrecargar el sitio que leen.

  • Descubrir: reunir direcciones de páginas a partir de un sitemap, de los enlaces de páginas ya leídas o de ambos.
  • Descargar: obtener cada página. Las páginas que construyen su contenido con JavaScript tienen que renderizarse antes en un entorno parecido a un navegador, o el rastreador verá una página casi vacía.
  • Extraer: separar el contenido principal de la navegación, el pie de página, los avisos de cookies y otros elementos repetidos.
  • Guardar: almacenar el texto según su finalidad, como un índice de búsqueda o la base de conocimiento de un chatbot.

Ejemplo

Una clínica dental quiere un chatbot que responda preguntas sobre tratamientos y precios. En lugar de copiar textos a mano, la dueña introduce la dirección de la web. El rastreador lee el sitemap y encuentra 40 páginas, y ella desmarca el archivo del blog y las ofertas de empleo. Las páginas restantes sobre tratamientos, precios, horarios y seguros se convierten en el conocimiento del chatbot.

Por qué importa en los chatbots de empresa

La web de una empresa suele ser la descripción más completa y ya aprobada de lo que ofrece, así que rastrearla es la forma más rápida de dar a un chatbot conocimiento útil. La calidad del rastreo marca la calidad de las respuestas: si faltan páginas importantes, si el contenido en JavaScript no se renderiza o si los menús y avisos de cookies acaban en el texto, la búsqueda empeora.

Además, las webs cambian. Cuando se actualizan precios, políticas o productos, hay que refrescar el contenido rastreado, o el chatbot seguirá respondiendo con la versión antigua.

Cómo rastrea intoCHAT una web

En intoCHAT pegas una URL y el rastreador descubre páginas a partir del sitemap y de un mapa de enlaces, hasta 500 URL. Eliges qué páginas incluir y puedes excluir rutas con patrones. Las páginas con mucho JavaScript se renderizan antes de leerlas, y los widgets de chat y los avisos de cookies se eliminan del texto. El número de rastreos al mes depende de tu plan y, cuando tu web cambia, vuelves a entrenar manualmente las fuentes afectadas; no hay sincronización automática. Para probarlo antes, la herramienta gratuita de vista previa crea un agente temporal con 5 páginas de cualquier web.

Preguntas frecuentes

¿Qué diferencia hay entre un rastreador web y un scraper?

Un rastreador se centra en descubrir y visitar páginas siguiendo enlaces o sitemaps. Un scraper se centra en extraer datos concretos de las páginas, como precios o datos de contacto. Muchas herramientas hacen ambas cosas: rastrean para encontrar páginas y luego extraen su contenido.

¿Puede el rastreador de un chatbot leer webs con JavaScript?

Solo si renderiza antes las páginas, como hace un navegador. Las webs que cargan su contenido con JavaScript pueden parecer casi vacías a un rastreador que solo lee el HTML sin procesar. intoCHAT renderiza las páginas con mucho JavaScript antes de leerlas.

¿Cómo mantengo a los rastreadores fuera de partes de mi web?

El método estándar es un archivo robots.txt que indica a los rastreadores qué rutas no visitar, aunque depende de que el rastreador decida respetarlo. Para un chatbot que configuras tú, es más sencillo dejar fuera esas páginas en los ajustes del rastreo. En intoCHAT desmarcas páginas o excluyes rutas con patrones antes de entrenar.

¿intoCHAT vuelve a rastrear mi web automáticamente?

No. intoCHAT no tiene sincronización automática, así que cuando tu web cambia vuelves a entrenar manualmente las fuentes afectadas. El número de rastreos de la web al mes depende de tu plan.

Míralo responder con tu propia web

Pega la dirección de tu web y chatea con un agente creado a partir de tus páginas. Tarda alrededor de un minuto.

Crea tu agente gratis

Plan gratuito, sin tarjeta de crédito.