Robot d’indexation (crawler)
Dernière mise à jour:
Ce qu’est un robot d’indexation
Un robot d’indexation, aussi appelé spider ou bot, part d’une ou plusieurs adresses et parcourt un site page après page. Les plus connus sont ceux des moteurs de recherche, comme Googlebot et Bingbot, qui découvrent et indexent les pages. Les entreprises d’IA exploitent des crawlers comme GPTBot d’OpenAI pour collecter du contenu pour leurs modèles, et les plateformes de chatbot utilisent des crawlers pour lire le site d’une entreprise précise.
Les propriétaires de sites donnent des consignes aux crawlers dans un fichier robots.txt et peuvent lister leurs pages dans un sitemap XML. Les crawlers sérieux respectent ces signaux et s’identifient par un nom d’agent utilisateur (user agent).
Comment fonctionne un robot d’indexation
La plupart des crawlers procèdent en quatre étapes :
Les crawlers limitent généralement le nombre de pages récupérées et leur rythme, pour ne pas surcharger le site visité.
- Découvrir : rassembler les adresses des pages à partir d’un sitemap, des liens des pages déjà lues, ou des deux.
- Récupérer : télécharger chaque page. Les pages qui construisent leur contenu en JavaScript doivent d’abord être rendues dans un environnement proche d’un navigateur, sinon le crawler voit une page presque vide.
- Extraire : séparer le contenu principal de la navigation, du pied de page, des bandeaux cookies et des autres éléments répétés.
- Stocker : enregistrer le texte selon l’usage prévu, par exemple un index de recherche ou la base de connaissances d’un chatbot.
Exemple
Un cabinet dentaire veut un chatbot qui réponde aux questions sur les soins et les tarifs. Plutôt que de copier les textes à la main, la praticienne saisit l’adresse du site. Le crawler lit le sitemap et trouve 40 pages ; elle désélectionne les archives du blog et les offres d’emploi. Les pages restantes sur les soins, les tarifs, les horaires et les mutuelles deviennent les connaissances du chatbot.
Pourquoi c’est important pour les chatbots d’entreprise
Le site d’une entreprise est généralement la description la plus complète et déjà validée de son offre : l’explorer est donc le moyen le plus rapide de donner des connaissances utiles à un chatbot. La qualité de l’exploration conditionne celle des réponses : si des pages importantes manquent, si le contenu JavaScript n’est pas rendu ou si menus et mentions cookies se retrouvent dans le texte, la recherche se dégrade.
Les sites évoluent aussi. Quand les prix, les conditions ou les produits changent, le contenu exploré doit être actualisé, sinon le chatbot continue de répondre avec l’ancienne version.
Comment intoCHAT explore un site
Dans intoCHAT, vous collez une URL et le crawler découvre les pages via le sitemap et une carte des liens, jusqu’à 500 URL. Vous choisissez les pages à inclure et pouvez exclure des chemins à l’aide de motifs. Les pages riches en JavaScript sont rendues avant lecture, et les widgets de chat et bandeaux cookies sont retirés du texte. Le nombre d’explorations par mois dépend de votre offre, et quand votre site change, vous réentraînez manuellement les sources concernées : il n’y a pas de synchronisation automatique. Pour essayer d’abord, l’outil gratuit d’aperçu crée un agent temporaire à partir de 5 pages de n’importe quel site.