Website crawlen und deinen KI-Agenten trainieren
Füge deine Website einem intoCHAT-Agenten hinzu: Seiten über Sitemap und Links finden, auswählen, Pfade ausschließen, JavaScript-Seiten und Crawl-Limits.
Am schnellsten bekommt dein Agent Wissen, wenn er deine Website liest. Du gibst eine Adresse ein, intoCHAT listet die gefundenen Seiten auf, und du entscheidest, welche hinzukommen.
Seiten finden und hinzufügen
- Öffne den Tab Knowledge (Wissen) des Agenten und wähle unter Add knowledge den Bereich Website.
- Gib deine Website unter Website URL ein, zum Beispiel
https://example.com. - Optional: Trage unter Exclude URLs containing Adressteile ein, die übersprungen werden sollen, getrennt durch Kommas, zum Beispiel
/blog, /careers, ?lang=. - Klicke auf Find pages (Seiten finden).
- Prüfe die Liste. Nutze Filter pages…, Select all (alle) oder None (keine) und setze Haken einzeln.
- Klicke auf Add … selected pages und warte, bis der Fortschrittsbalken durchgelaufen ist.
- Klicke oben im Tab auf Train agent.
Hinzugefügte Seiten werden sofort mit dem Status Pending (ausstehend) gespeichert. Der Agent nutzt sie erst nach dem Training.
Wie Seiten gefunden werden
Find pages kombiniert zwei Methoden:
- Sitemap: intoCHAT sucht an üblichen Stellen wie
/sitemap.xmlund/wp-sitemap.xmlsowie in der ZeileSitemap:derrobots.txtnach einer Sitemap. Einträge für Login-, Registrierungs- und Admin-Seiten werden übersprungen. - Link-Map: Ein Crawler sammelt die Links auf derselben Domain.
Jede Methode liefert bis zu 500 Adressen. Dubletten wie /about und /about/, Bilder, Feeds und andere Dateien, die keine Seiten sind, werden entfernt. Links auf PDF-Dateien bleiben in der Liste und werden wie Seiten gelesen.
Bei einer mehrsprachigen Website mit Sprachordnern wie /de/ und /fr/ erscheint über der Liste eine Zeile Languages (Sprachen). Vorausgewählt sind die Seiten in der Sprache der eingegebenen Adresse und die Startseite; ein Klick auf eine Sprache wählt alle ihre Seiten aus oder ab. Seiten, die schon in deinem Wissen sind, zeigen already added und sind nicht ausgewählt.
Was von jeder Seite gelesen wird
intoCHAT liest den Hauptinhalt jeder Seite. Chat-Widgets und Cookie-Banner werden entfernt, und Menüs oder Banner, die auf jeder Seite wiederkehren, bleiben nur einmal erhalten.
Manche Websites bauen ihren Inhalt erst nach dem Laden per JavaScript auf. Kommen mehrere Seiten als dieselbe leere Hülle zurück, liest intoCHAT sie erneut und lässt ihnen ein paar Sekunden zum Laden, ebenso dem Rest des Durchlaufs. Solche Websites brauchen deshalb länger. Ist der Crawler ausgelastet, pausiert der Durchlauf mit einem Countdown und läuft dann von selbst weiter.
Seiten mit Zeitüberschreitung werden am Ende ein zweites Mal versucht. Scheitert eine Seite weiterhin, ist sie als failed markiert. Fahre mit der Maus darüber, um den Grund zu sehen, und füge sie danach erneut hinzu.
Single page mode
Schalte Single page mode (Einzelseiten-Modus) ein, um eine einzelne Adresse hinzuzufügen, ohne die Website zu durchsuchen. Der Button heißt dann Add page. Nutze ihn für eine Seite, die nicht gefunden wurde. Um eine bereits hinzugefügte Seite zu aktualisieren, nutze stattdessen Refresh from website (von der Website aktualisieren) bei ihrer Quelle.
Crawl-Limits
| Plan | Website-Crawls pro Monat | Zeichen pro Agent |
|---|---|---|
| Free | 1 | 100K |
| Starter | 9 | 500K |
| Pro | 20 | 1M |
| Enterprise | individuell | individuell |
- Die Suche mit Find pages verbraucht keinen Crawl.
- Das Hinzufügen von Seiten verbraucht einen Crawl, egal ob Auswahl oder Einzelseite. Alle Seiten eines Durchlaufs teilen sich diesen Crawl. Refresh from website bei einer Quelle zählt wie das Hinzufügen einer einzelnen Seite.
- Crawls zählen pro Konto über alle Agenten hinweg und werden jeden Monat zurückgesetzt.
- Gecrawlter Text zählt zum Zeichenlimit des Agenten. Erreicht ein Durchlauf das Limit, werden die restlichen Seiten als fehlgeschlagen markiert.
Sind keine mehr übrig, zeigt intoCHAT „Monthly crawl limit reached“. Du kannst aber weiterhin Dateien sowie Text und Q&A hinzufügen.
Websites, die Crawler blockieren
Manche Websites weisen automatische Besucher per Bot-Schutz oder Firewall ab. Dann siehst du „No pages found“, oder Seiten scheitern mit wenig oder gar keinem Inhalt. Probiere Single page mode für die wichtigsten Seiten, speichere zentrale Seiten als PDF und lade sie als Dateien hoch, oder füge ihren Text als Textbaustein ein.
Gecrawlt werden nur öffentliche http- und https-Adressen. Seiten hinter einem Login, Adressen mit Benutzername und Passwort sowie private oder interne Netzwerkadressen werden abgelehnt.
Seiten aktuell halten
Es gibt keine automatische Synchronisierung, und Re-index saved text trainiert nur den zuvor gelesenen Text erneut. Um Änderungen an einer Seite zu übernehmen, klicke bei ihrer Quelle auf Refresh from website (das Wolken-Symbol). intoCHAT liest die Seite neu und speichert und trainiert sie sofort, wenn sich ihr Text geändert hat; sonst siehst du „No changes found“. Eine Seite, die in der letzten Stunde abgerufen wurde, kann aus einer zwischengespeicherten Kopie stammen.
Um viele Seiten auf einmal zu aktualisieren, füge sie über Find pages erneut hinzu und trainiere dann. Bestehende Quellen werden aktualisiert statt verdoppelt. Siehe Quellen verwalten.