Przejdź do głównej zawartości

Dodaj strony WWW

Wykorzystaj treść własnej witryny jako bazę wiedzy — jedną podstronę, całą mapę strony albo wszystko, do czego crawler dotrze z podanego adresu.

Jak to działa

Po uruchomieniu importu Leezy:

  1. ustala listę podstron do pobrania (z linków, z mapy strony albo z podanego pojedynczego adresu),
  2. pobiera każdą podstronę i wydobywa główną treść, pomijając nawigację, panele boczne, stopki, reklamy i skrypty,
  3. dzieli tekst na fragmenty i tworzy embeddingi,
  4. udostępnia treść do odpowiedzi.

Tryby importu

Na stronie Sources agenta wybierz sposób importu:

Skanowanie linków

Podajesz adres, a crawler podąża za linkami z tej strony i odnajduje kolejne podstrony w tej samej witrynie.

  • Sprawdza się przy centrach pomocy, dokumentacji i sekcjach produktowych
  • Dokładna liczba podstron znana jest dopiero po zakończeniu, bo po drodze pojawiają się nowe linki, a część okazuje się nieprawidłowa

Mapa strony

Wskaż bezpośrednio plik sitemap.xml albo adres główny witryny — mapa zostanie wykryta automatycznie.

  • Sprawdza się przy pełnym, przewidywalnym pokryciu własnej witryny
  • Zwykle najszybsza droga do szerokiego pokrycia

Pobierana jest dokładnie jedna podstrona.

  • Sprawdza się przy pojedynczym FAQ, cenniku albo regulaminie
  • Przydaje się do uzupełnienia bazy wiedzy bez ponownego skanowania całości

Limity skanowania

Obowiązują dwa limity, oba zależne od planu:

PlanPodstron na skanSkanów dziennie
Free253
Starter5020
Pro500100
Business5000500

Limit dzienny odnawia się co 24 godziny. Strona „Sources" pokazuje, ile importów zostało na dziś.

Dodatkowo obowiązuje limit miejsca: skan kończy się wcześniej, jeśli kolejne podstrony przekroczyłyby dostępne miejsce.

Opcje zaawansowane (od planu Pro)

Panel Advanced options daje dwa dodatkowe ustawienia:

Reguły ścieżek

Ograniczają, które adresy trafiają do importu. Każda reguła korzysta z operatora:

OperatorPrzykład
Zaczyna się od/blog
Kończy się na.html
Zawieratutorial
Dokładne dopasowanie/about
Znak wieloznacznyhttps://example.com/blog/**

Uwzględnij tylko ścieżki zawęża skan do pasujących adresów. Wyklucz ścieżki usuwa pasujące adresy z szerokiego skanu. Wykluczenia to typowy sposób, by trzymać changelogi, archiwa tagów i strony z paginacją poza bazą wiedzy.

Wolne skanowanie

Renderuje każdą podstronę w pełnej przeglądarce headless zamiast pobierać surowy HTML. Trwa dłużej, ale to właśnie dzięki temu poprawnie importują się strony oparte na JavaScripcie i aplikacje jednostronicowe.

:::tip Kiedy sięgnąć po wolne skanowanie Jeśli skan kończy się powodzeniem, ale zaimportowane podstrony są niemal puste, treść najprawdopodobniej renderuje się po stronie przeglądarki. Powtórz import z włączonym wolnym skanowaniem. :::

Dobre praktyki

Dobre adresy do importu

  • artykuły FAQ i centra pomocy,
  • dokumentacja,
  • strony produktów i cenniki,
  • regulaminy (zwroty, wysyłka, gwarancja).

Czego unikać

  • podstron za logowaniem — crawler nie jest zalogowany,
  • podstron złożonych głównie z obrazów lub wideo,
  • stron tagów, kategorii i paginacji: dużo szumu, zero odpowiedzi.

Utrzymuj aktualność

Zaimportowane podstrony to zdjęcie stanu z chwili skanowania. Gdy witryna się zmienia, uruchom import ponownie. Zeskanowane podstrony są pogrupowane według przebiegu skanu, więc nieaktualny przebieg można usunąć i zaimportować od nowa.

Wymagania wobec adresów

  • Publicznie dostępne, bez logowania
  • Zwracają HTML
  • Brak protokołu jest uzupełniany jako https://

Rozwiązywanie problemów

Skanowanie nie powiodło się

Najczęstsze przyczyny: błędny adres, wymagane logowanie, witryna blokuje crawlery albo serwer przekroczył limit czasu.

Rozwiązanie: otwórz adres w oknie prywatnym, aby potwierdzić, że jest publiczny, a potem spróbuj innego punktu wejścia — import mapy strony często udaje się tam, gdzie skanowanie linków zawodzi.

Zaimportowano mało podstron albo żadnej

  • Treść renderuje się w JavaScripcie — włącz wolne skanowanie
  • Reguły ścieżek są zbyt wąskie — sprawdź reguły uwzględniania
  • W trakcie skanu wyczerpał się limit dzienny albo miejsce

Za dużo nieistotnych podstron

Dodaj reguły wykluczające dla zaszumionych sekcji, usuń przebieg skanu i zaimportuj ponownie.

Następne kroki