Websites hinzufügen
Inhalte der eigenen Website als Wissensbasis nutzen — eine Seite, eine ganze Sitemap oder alles, was der Crawler von einer Start-URL aus erreicht.
Ablauf
Nach dem Start eines Imports geschieht Folgendes:
- Ermitteln der zu ladenden Seiten (über Links, eine Sitemap oder die angegebene Einzel-URL)
- Abrufen jeder Seite und Extrahieren des Haupttextes; Navigation, Seitenleisten, Fußzeilen, Werbung und Skripte entfallen
- Aufteilen und Einbetten des Textes
- Bereitstellen für Antworten
Importmodi
Auf der Seite Sources des Agenten stehen drei Modi zur Wahl:
Links crawlen
Ausgehend von einer URL folgt der Crawler den Links und findet so weitere Seiten derselben Website.
- Geeignet für Hilfebereiche, Dokumentation und Produktbereiche
- Die genaue Seitenzahl steht erst nach dem Lauf fest, da unterwegs neue Links auftauchen und einzelne Links ungültig sind
Sitemap
Entweder direkt auf eine sitemap.xml verweisen oder auf die Startseite — die Sitemap wird dann automatisch gefunden.
- Geeignet für vollständige, planbare Abdeckung einer eigenen Website
- In der Regel der schnellste Weg zu breiter Abdeckung
Einzelner Link
Genau eine URL wird geladen, sonst nichts.
- Geeignet für eine einzelne FAQ-, Preis- oder Richtlinienseite
- Praktisch, um eine Wissensbasis gezielt zu ergänzen
Crawl-Grenzen
Es gelten zwei Grenzen, beide abhängig vom Tarif:
| Tarif | Seiten pro Crawl | Crawls pro Tag |
|---|---|---|
| Free | 25 | 3 |
| Starter | 50 | 20 |
| Pro | 500 | 100 |
| Business | 5.000 | 500 |
Die Tagesgrenze wird alle 24 Stunden zurückgesetzt. Die Seite „Sources" zeigt, wie viele Importe heute noch möglich sind.
Zusätzlich gilt der Speicher: Ein Crawl endet vorzeitig, wenn weitere Seiten das Kontingent überschreiten würden.
Erweiterte Optionen (ab Pro)
Der Bereich Advanced options bietet zwei Einstellungen:
Pfadregeln
Schränken ein, welche URLs importiert werden. Jede Regel nutzt einen Operator:
| Operator | Beispiel |
|---|---|
| Beginnt mit | /blog |
| Endet mit | .html |
| Enthält | tutorial |
| Exakte Übereinstimmung | /about |
| Platzhalter | https://example.com/blog/** |
Nur diese Pfade einschließen begrenzt den Crawl auf passende URLs. Pfade ausschließen entfernt passende URLs aus einem ansonsten breiten Crawl. Ausschlüsse sind der übliche Weg, um Changelogs, Tag-Archive und Übersichtsseiten aus einer Wissensbasis herauszuhalten.
Langsames Scraping
Rendert jede Seite in einem vollständigen Headless-Browser statt nur das HTML abzurufen. Das dauert länger, sorgt aber dafür, dass JavaScript-lastige Seiten und Single-Page-Anwendungen korrekt importiert werden.
:::tip Wann langsames Scraping sinnvoll ist Läuft ein Crawl durch, enthalten die importierten Seiten aber kaum Text, wird der Inhalt vermutlich clientseitig gerendert. Den Import mit aktiviertem langsamem Scraping wiederholen. :::
Bewährte Vorgehensweisen
Geeignete URLs
- FAQ- und Hilfeartikel
- Dokumentation
- Produkt- und Preisseiten
- Richtlinien zu Rückgabe, Versand und Garantie
Ungeeignete URLs
- Seiten hinter einem Login — der Crawler ist nicht angemeldet
- Seiten, die überwiegend aus Bildern oder Videos bestehen
- Tag-, Kategorie- und Paginierungsseiten: viel Rauschen, keine Antworten
Inhalte aktuell halten
Importierte Seiten sind eine Momentaufnahme. Ändert sich die Website, muss der Import erneut laufen. Gecrawlte Seiten sind nach Crawl-Lauf gruppiert, sodass sich ein veralteter Lauf löschen und sauber neu importieren lässt.
Anforderungen an URLs
- Öffentlich erreichbar, ohne Anmeldung
- Liefert HTML aus
- Fehlt das Protokoll, wird
https://angenommen
Fehlerbehebung
Crawl fehlgeschlagen
Häufige Ursachen: falsche URL, Login erforderlich, die Website blockiert Crawler, oder Zeitüberschreitung des Servers.
Lösung: Die URL in einem privaten Browserfenster öffnen, um die öffentliche Erreichbarkeit zu prüfen, und einen anderen Einstiegspunkt versuchen — ein Sitemap-Import gelingt oft dort, wo Link-Crawling scheitert.
Wenige oder keine Seiten importiert
- Inhalte werden per JavaScript gerendert — langsames Scraping aktivieren
- Pfadregeln sind zu eng gefasst — Einschlussregeln prüfen
- Tagesgrenze oder Speicher wurde während des Laufs erreicht
Zu viele irrelevante Seiten
Ausschlussregeln für die störenden Bereiche ergänzen, den Crawl-Lauf löschen und neu importieren.
Nächste Schritte
- Frage-Antwort-Paare anlegen — gezielte Antworten
- Dokumente hochladen — dateibasierte Inhalte
- Notion verbinden — Workspace-Seiten importieren