Zum Inhalt springen

Webcrawler

Zuletzt aktualisiert:

Was ein Webcrawler ist

Ein Webcrawler, auch Spider oder Bot genannt, startet bei einer oder mehreren Adressen und arbeitet sich Seite für Seite durch eine Website. Die bekanntesten Crawler betreiben Suchmaschinen, etwa Googlebot und Bingbot, um Seiten zu finden und zu indexieren. KI-Unternehmen betreiben Crawler wie GPTBot von OpenAI, um Inhalte für ihre Modelle zu sammeln, und Chatbot-Plattformen nutzen Crawler, um die Website eines bestimmten Unternehmens zu lesen.

Website-Betreiber geben Crawlern über eine robots.txt-Datei Anweisungen und können ihre Seiten in einer XML-Sitemap auflisten. Seriöse Crawler halten sich an diese Signale und geben sich über einen User-Agent-Namen zu erkennen.

So funktioniert ein Webcrawler

Die meisten Crawler arbeiten in vier Schritten:

Crawler begrenzen meist, wie viele Seiten sie abrufen und wie schnell, damit sie die Website nicht überlasten.

  • Entdecken: Seitenadressen aus einer Sitemap, aus Links bereits gelesener Seiten oder aus beidem sammeln.
  • Abrufen: jede Seite herunterladen. Seiten, die ihre Inhalte per JavaScript aufbauen, müssen zuerst in einer browserähnlichen Umgebung gerendert werden, sonst sieht der Crawler eine fast leere Seite.
  • Extrahieren: den eigentlichen Inhalt von Navigation, Footer, Cookie-Bannern und anderen wiederkehrenden Elementen trennen.
  • Speichern: den Text für seinen Zweck ablegen, etwa in einem Suchindex oder in der Wissensdatenbank eines Chatbots.

Beispiel

Eine Zahnarztpraxis möchte einen Chatbot, der Fragen zu Behandlungen und Preisen beantwortet. Statt Texte von Hand zu kopieren, gibt die Inhaberin die Adresse der Website ein. Der Crawler liest die Sitemap und findet 40 Seiten, und sie wählt das Blog-Archiv und die Stellenanzeigen ab. Die übrigen Seiten zu Behandlungen, Preisen, Öffnungszeiten und Versicherungen werden zum Wissen des Chatbots.

Warum es für Business-Chatbots wichtig ist

Die Website eines Unternehmens ist meist die vollständigste, bereits freigegebene Beschreibung seines Angebots. Sie zu crawlen ist deshalb der schnellste Weg, einem Chatbot nützliches Wissen zu geben. Die Qualität des Crawls prägt die Qualität der Antworten: Fehlen wichtige Seiten, wird JavaScript-Inhalt nicht gerendert oder landen Menüs und Cookie-Hinweise im Text, wird die Suche schlechter.

Websites ändern sich außerdem. Werden Preise, Richtlinien oder Produkte aktualisiert, müssen die gecrawlten Inhalte erneuert werden, sonst antwortet der Chatbot weiter mit dem alten Stand.

Wie intoCHAT eine Website crawlt

In intoCHAT fügst du eine URL ein, und der Crawler findet Seiten über die Sitemap und eine Linkkarte, bis zu 500 URLs. Du wählst aus, welche Seiten hineinkommen, und kannst Pfade mit Mustern ausschließen. Seiten mit viel JavaScript werden vor dem Lesen gerendert, und Chat-Widgets sowie Cookie-Banner werden aus dem Text entfernt. Wie viele Crawls pro Monat möglich sind, hängt von deinem Tarif ab, und wenn sich deine Website ändert, trainierst du die betroffenen Quellen manuell neu; eine automatische Synchronisierung gibt es nicht. Zum Ausprobieren baut das kostenlose Vorschau-Tool einen temporären Agenten aus 5 Seiten einer beliebigen Website.

Häufige Fragen

Was ist der Unterschied zwischen einem Webcrawler und einem Web Scraper?

Ein Crawler konzentriert sich darauf, Seiten über Links oder Sitemaps zu finden und zu besuchen. Ein Scraper konzentriert sich darauf, bestimmte Daten aus Seiten zu extrahieren, etwa Preise oder Kontaktdaten. Viele Tools machen beides: Sie crawlen, um Seiten zu finden, und extrahieren dann deren Inhalte.

Kann ein Chatbot-Crawler JavaScript-Websites lesen?

Nur wenn er die Seiten zuerst rendert, so wie ein Browser. Websites, die ihre Inhalte per JavaScript laden, wirken für einen Crawler, der nur das rohe HTML liest, fast leer. intoCHAT rendert Seiten mit viel JavaScript, bevor es sie liest.

Wie halte ich Crawler von Teilen meiner Website fern?

Der Standardweg ist eine robots.txt-Datei, die Crawlern sagt, welche Pfade sie nicht besuchen sollen, wobei sich Crawler freiwillig daran halten müssen. Bei einem Chatbot, den du selbst einrichtest, ist es einfacher, Seiten in den Crawl-Einstellungen auszulassen. In intoCHAT wählst du Seiten ab oder schließt Pfade mit Mustern aus, bevor du trainierst.

Crawlt intoCHAT meine Website automatisch neu?

Nein. intoCHAT hat keine automatische Synchronisierung, wenn sich deine Website ändert, trainierst du die betroffenen Quellen also manuell neu. Wie viele Website-Crawls pro Monat möglich sind, hängt von deinem Tarif ab.

Sieh, wie er mit deiner Website antwortet

Gib die Adresse deiner Website ein und chatte mit einem Agenten, der aus deinen Seiten gebaut wird. Das dauert etwa eine Minute.

Agent kostenlos erstellen

Kostenloser Plan, keine Kreditkarte nötig.