Webcrawler
Zuletzt aktualisiert:
Was ein Webcrawler ist
Ein Webcrawler, auch Spider oder Bot genannt, startet bei einer oder mehreren Adressen und arbeitet sich Seite für Seite durch eine Website. Die bekanntesten Crawler betreiben Suchmaschinen, etwa Googlebot und Bingbot, um Seiten zu finden und zu indexieren. KI-Unternehmen betreiben Crawler wie GPTBot von OpenAI, um Inhalte für ihre Modelle zu sammeln, und Chatbot-Plattformen nutzen Crawler, um die Website eines bestimmten Unternehmens zu lesen.
Website-Betreiber geben Crawlern über eine robots.txt-Datei Anweisungen und können ihre Seiten in einer XML-Sitemap auflisten. Seriöse Crawler halten sich an diese Signale und geben sich über einen User-Agent-Namen zu erkennen.
So funktioniert ein Webcrawler
Die meisten Crawler arbeiten in vier Schritten:
Crawler begrenzen meist, wie viele Seiten sie abrufen und wie schnell, damit sie die Website nicht überlasten.
- Entdecken: Seitenadressen aus einer Sitemap, aus Links bereits gelesener Seiten oder aus beidem sammeln.
- Abrufen: jede Seite herunterladen. Seiten, die ihre Inhalte per JavaScript aufbauen, müssen zuerst in einer browserähnlichen Umgebung gerendert werden, sonst sieht der Crawler eine fast leere Seite.
- Extrahieren: den eigentlichen Inhalt von Navigation, Footer, Cookie-Bannern und anderen wiederkehrenden Elementen trennen.
- Speichern: den Text für seinen Zweck ablegen, etwa in einem Suchindex oder in der Wissensdatenbank eines Chatbots.
Beispiel
Eine Zahnarztpraxis möchte einen Chatbot, der Fragen zu Behandlungen und Preisen beantwortet. Statt Texte von Hand zu kopieren, gibt die Inhaberin die Adresse der Website ein. Der Crawler liest die Sitemap und findet 40 Seiten, und sie wählt das Blog-Archiv und die Stellenanzeigen ab. Die übrigen Seiten zu Behandlungen, Preisen, Öffnungszeiten und Versicherungen werden zum Wissen des Chatbots.
Warum es für Business-Chatbots wichtig ist
Die Website eines Unternehmens ist meist die vollständigste, bereits freigegebene Beschreibung seines Angebots. Sie zu crawlen ist deshalb der schnellste Weg, einem Chatbot nützliches Wissen zu geben. Die Qualität des Crawls prägt die Qualität der Antworten: Fehlen wichtige Seiten, wird JavaScript-Inhalt nicht gerendert oder landen Menüs und Cookie-Hinweise im Text, wird die Suche schlechter.
Websites ändern sich außerdem. Werden Preise, Richtlinien oder Produkte aktualisiert, müssen die gecrawlten Inhalte erneuert werden, sonst antwortet der Chatbot weiter mit dem alten Stand.
Wie intoCHAT eine Website crawlt
In intoCHAT fügst du eine URL ein, und der Crawler findet Seiten über die Sitemap und eine Linkkarte, bis zu 500 URLs. Du wählst aus, welche Seiten hineinkommen, und kannst Pfade mit Mustern ausschließen. Seiten mit viel JavaScript werden vor dem Lesen gerendert, und Chat-Widgets sowie Cookie-Banner werden aus dem Text entfernt. Wie viele Crawls pro Monat möglich sind, hängt von deinem Tarif ab, und wenn sich deine Website ändert, trainierst du die betroffenen Quellen manuell neu; eine automatische Synchronisierung gibt es nicht. Zum Ausprobieren baut das kostenlose Vorschau-Tool einen temporären Agenten aus 5 Seiten einer beliebigen Website.