Aller au contenu

Robot d’indexation (crawler)

Dernière mise à jour:

Ce qu’est un robot d’indexation

Un robot d’indexation, aussi appelé spider ou bot, part d’une ou plusieurs adresses et parcourt un site page après page. Les plus connus sont ceux des moteurs de recherche, comme Googlebot et Bingbot, qui découvrent et indexent les pages. Les entreprises d’IA exploitent des crawlers comme GPTBot d’OpenAI pour collecter du contenu pour leurs modèles, et les plateformes de chatbot utilisent des crawlers pour lire le site d’une entreprise précise.

Les propriétaires de sites donnent des consignes aux crawlers dans un fichier robots.txt et peuvent lister leurs pages dans un sitemap XML. Les crawlers sérieux respectent ces signaux et s’identifient par un nom d’agent utilisateur (user agent).

Comment fonctionne un robot d’indexation

La plupart des crawlers procèdent en quatre étapes :

Les crawlers limitent généralement le nombre de pages récupérées et leur rythme, pour ne pas surcharger le site visité.

  • Découvrir : rassembler les adresses des pages à partir d’un sitemap, des liens des pages déjà lues, ou des deux.
  • Récupérer : télécharger chaque page. Les pages qui construisent leur contenu en JavaScript doivent d’abord être rendues dans un environnement proche d’un navigateur, sinon le crawler voit une page presque vide.
  • Extraire : séparer le contenu principal de la navigation, du pied de page, des bandeaux cookies et des autres éléments répétés.
  • Stocker : enregistrer le texte selon l’usage prévu, par exemple un index de recherche ou la base de connaissances d’un chatbot.

Exemple

Un cabinet dentaire veut un chatbot qui réponde aux questions sur les soins et les tarifs. Plutôt que de copier les textes à la main, la praticienne saisit l’adresse du site. Le crawler lit le sitemap et trouve 40 pages ; elle désélectionne les archives du blog et les offres d’emploi. Les pages restantes sur les soins, les tarifs, les horaires et les mutuelles deviennent les connaissances du chatbot.

Pourquoi c’est important pour les chatbots d’entreprise

Le site d’une entreprise est généralement la description la plus complète et déjà validée de son offre : l’explorer est donc le moyen le plus rapide de donner des connaissances utiles à un chatbot. La qualité de l’exploration conditionne celle des réponses : si des pages importantes manquent, si le contenu JavaScript n’est pas rendu ou si menus et mentions cookies se retrouvent dans le texte, la recherche se dégrade.

Les sites évoluent aussi. Quand les prix, les conditions ou les produits changent, le contenu exploré doit être actualisé, sinon le chatbot continue de répondre avec l’ancienne version.

Comment intoCHAT explore un site

Dans intoCHAT, vous collez une URL et le crawler découvre les pages via le sitemap et une carte des liens, jusqu’à 500 URL. Vous choisissez les pages à inclure et pouvez exclure des chemins à l’aide de motifs. Les pages riches en JavaScript sont rendues avant lecture, et les widgets de chat et bandeaux cookies sont retirés du texte. Le nombre d’explorations par mois dépend de votre offre, et quand votre site change, vous réentraînez manuellement les sources concernées : il n’y a pas de synchronisation automatique. Pour essayer d’abord, l’outil gratuit d’aperçu crée un agent temporaire à partir de 5 pages de n’importe quel site.

Questions fréquentes

Quelle différence entre un crawler et un scraper ?

Un crawler sert à découvrir et visiter des pages en suivant des liens ou des sitemaps. Un scraper sert à extraire des données précises de ces pages, comme des prix ou des coordonnées. Beaucoup d’outils font les deux : ils explorent pour trouver les pages, puis en extraient le contenu.

Le crawler d’un chatbot peut-il lire les sites en JavaScript ?

Seulement s’il commence par rendre les pages, comme le fait un navigateur. Les sites qui chargent leur contenu en JavaScript peuvent sembler presque vides à un crawler qui ne lit que le HTML brut. intoCHAT rend les pages riches en JavaScript avant de les lire.

Comment tenir les crawlers à l’écart de certaines parties de mon site ?

La méthode standard est un fichier robots.txt qui indique aux crawlers les chemins à ne pas visiter, mais il ne fonctionne que si le crawler choisit de le respecter. Pour un chatbot que vous configurez vous-même, il est plus simple d’exclure ces pages dans les réglages d’exploration. Dans intoCHAT, vous désélectionnez des pages ou excluez des chemins avec des motifs avant l’entraînement.

intoCHAT réexplore-t-il mon site automatiquement ?

Non. intoCHAT n’a pas de synchronisation automatique : quand votre site change, vous réentraînez manuellement les sources concernées. Le nombre d’explorations de site par mois dépend de votre offre.

Voyez-le répondre à partir de votre site

Collez l’adresse de votre site et discutez avec un agent créé à partir de vos pages. Cela prend environ une minute.

Créer votre agent gratuitement

Offre gratuite, sans carte bancaire.