Zum Hauptinhalt springen

Websites hinzufügen

Inhalte der eigenen Website als Wissensbasis nutzen — eine Seite, eine ganze Sitemap oder alles, was der Crawler von einer Start-URL aus erreicht.

Ablauf

Nach dem Start eines Imports geschieht Folgendes:

  1. Ermitteln der zu ladenden Seiten (über Links, eine Sitemap oder die angegebene Einzel-URL)
  2. Abrufen jeder Seite und Extrahieren des Haupttextes; Navigation, Seitenleisten, Fußzeilen, Werbung und Skripte entfallen
  3. Aufteilen und Einbetten des Textes
  4. Bereitstellen für Antworten

Importmodi

Auf der Seite Sources des Agenten stehen drei Modi zur Wahl:

Ausgehend von einer URL folgt der Crawler den Links und findet so weitere Seiten derselben Website.

  • Geeignet für Hilfebereiche, Dokumentation und Produktbereiche
  • Die genaue Seitenzahl steht erst nach dem Lauf fest, da unterwegs neue Links auftauchen und einzelne Links ungültig sind

Sitemap

Entweder direkt auf eine sitemap.xml verweisen oder auf die Startseite — die Sitemap wird dann automatisch gefunden.

  • Geeignet für vollständige, planbare Abdeckung einer eigenen Website
  • In der Regel der schnellste Weg zu breiter Abdeckung

Genau eine URL wird geladen, sonst nichts.

  • Geeignet für eine einzelne FAQ-, Preis- oder Richtlinienseite
  • Praktisch, um eine Wissensbasis gezielt zu ergänzen

Crawl-Grenzen

Es gelten zwei Grenzen, beide abhängig vom Tarif:

TarifSeiten pro CrawlCrawls pro Tag
Free253
Starter5020
Pro500100
Business5.000500

Die Tagesgrenze wird alle 24 Stunden zurückgesetzt. Die Seite „Sources" zeigt, wie viele Importe heute noch möglich sind.

Zusätzlich gilt der Speicher: Ein Crawl endet vorzeitig, wenn weitere Seiten das Kontingent überschreiten würden.

Erweiterte Optionen (ab Pro)

Der Bereich Advanced options bietet zwei Einstellungen:

Pfadregeln

Schränken ein, welche URLs importiert werden. Jede Regel nutzt einen Operator:

OperatorBeispiel
Beginnt mit/blog
Endet mit.html
Enthälttutorial
Exakte Übereinstimmung/about
Platzhalterhttps://example.com/blog/**

Nur diese Pfade einschließen begrenzt den Crawl auf passende URLs. Pfade ausschließen entfernt passende URLs aus einem ansonsten breiten Crawl. Ausschlüsse sind der übliche Weg, um Changelogs, Tag-Archive und Übersichtsseiten aus einer Wissensbasis herauszuhalten.

Langsames Scraping

Rendert jede Seite in einem vollständigen Headless-Browser statt nur das HTML abzurufen. Das dauert länger, sorgt aber dafür, dass JavaScript-lastige Seiten und Single-Page-Anwendungen korrekt importiert werden.

:::tip Wann langsames Scraping sinnvoll ist Läuft ein Crawl durch, enthalten die importierten Seiten aber kaum Text, wird der Inhalt vermutlich clientseitig gerendert. Den Import mit aktiviertem langsamem Scraping wiederholen. :::

Bewährte Vorgehensweisen

Geeignete URLs

  • FAQ- und Hilfeartikel
  • Dokumentation
  • Produkt- und Preisseiten
  • Richtlinien zu Rückgabe, Versand und Garantie

Ungeeignete URLs

  • Seiten hinter einem Login — der Crawler ist nicht angemeldet
  • Seiten, die überwiegend aus Bildern oder Videos bestehen
  • Tag-, Kategorie- und Paginierungsseiten: viel Rauschen, keine Antworten

Inhalte aktuell halten

Importierte Seiten sind eine Momentaufnahme. Ändert sich die Website, muss der Import erneut laufen. Gecrawlte Seiten sind nach Crawl-Lauf gruppiert, sodass sich ein veralteter Lauf löschen und sauber neu importieren lässt.

Anforderungen an URLs

  • Öffentlich erreichbar, ohne Anmeldung
  • Liefert HTML aus
  • Fehlt das Protokoll, wird https:// angenommen

Fehlerbehebung

Crawl fehlgeschlagen

Häufige Ursachen: falsche URL, Login erforderlich, die Website blockiert Crawler, oder Zeitüberschreitung des Servers.

Lösung: Die URL in einem privaten Browserfenster öffnen, um die öffentliche Erreichbarkeit zu prüfen, und einen anderen Einstiegspunkt versuchen — ein Sitemap-Import gelingt oft dort, wo Link-Crawling scheitert.

Wenige oder keine Seiten importiert

  • Inhalte werden per JavaScript gerendert — langsames Scraping aktivieren
  • Pfadregeln sind zu eng gefasst — Einschlussregeln prüfen
  • Tagesgrenze oder Speicher wurde während des Laufs erreicht

Zu viele irrelevante Seiten

Ausschlussregeln für die störenden Bereiche ergänzen, den Crawl-Lauf löschen und neu importieren.

Nächste Schritte